LLM Inference Benchmark Explorer

Qwen3.8-27B op RTX PRO 6000 — NVFP4, vLLM, TP1, speculatieve decodering k=3 inferentiebenchmark

Open deze configuratie in de LLM Inference Benchmark Explorer

ModelQwen3.8-27B
Parameters27B
Intelligence Index33.7
Agentic Index45.8
ApparaatRTX PRO 6000
KwantisatieNVFP4
Max C64
Chatcapaciteit71
Agentische capaciteit24
TP—
DP—
PP—
EnginevLLM
Speculatieve decoderingJa
CTTFT (ms)TPS (tok/s)Status
172128.33PASS
2102128.21PASS
4114115.32PASS
817594.92PASS
1619678.35PASS
3230652.64PASS
6457029.34PASS
128459614.92FAIL

In deze meting bereikte Qwen3.8-27B (27B parameters), aangeboden in NVFP4-formaat met vLLM en speculatieve decodering op RTX PRO 6000, met één verzoek een generatiesnelheid van 128.3 tok/s per verzoek en een time to first token (TTFT) van 72 ms.

Rekening houdend met de snelheidsdoelen en de beschikbare KV-cachecapaciteit, bedraagt de geschatte capaciteit 71 gebruikers voor chatgebruik en 24 voor agentisch gebruik. De realistische capaciteit ligt waarschijnlijk tussen deze twee waarden. In scenario's waarin programmeren, toolgebruik, lange workflows en multi-agentgebruik overheersen, benadert de capaciteit de agentische schatting; waar kortere interacties, standaardgesprekken en lichtere taken overheersen, benadert zij de chatschatting.

Opmerkingen: Speculative MTP k=3.

De waarden van Intelligence Index en Agentic Index worden gepubliceerd door Artificial Analysis en worden hier met bronvermelding overgenomen.