LLM Inference Benchmark

20260724_095021 · endpoint http://localhost:11434/v1 · 3 runs/test · concurrency [1, 2, 4]
NB480 · Windows 10
CPU: Intel64 Family 6 Model 154 Stepping 4, GenuineIntel (12 cores) · RAM: 16 GB
GPU: no NVIDIA GPU detected

Per-concurrency detail (latency percentiles)

Efficiency = actual total throughput / perfect scaling (concurrency x single-request speed). 100% = ideal scaling; dropping = losses; flat = saturation.

ModelConc.Gen tok/sTotal tok/sEfficiencyTTFR p50 msTTFR p95 msTTFR p99 ms
qwen2.5:0.5b10.00.0100%348355356
qwen2.5:0.5b20.00.0100%436494498
qwen2.5:0.5b40.00.0100%546675707
qwen2.5-coder:7b10.00.0100%780797799
qwen2.5-coder:7b20.00.0100%91311531160
qwen2.5-coder:7b40.00.0100%159824882556

Token load

ModelPrompt (tok)Result (tok) Tokenizer
qwen2.5:0.5b110tiktoken:cl100k_base
qwen2.5-coder:7b110tiktoken:cl100k_base

Direct comparison (key metrics)

ModelPrompt throughput
tok/s
Time to first response
ms
qwen2.5:0.5b4.45445.61
qwen2.5-coder:7b1.591108.88

Dashboard

dashboard