Wijzigingslogboek
Nieuwe whitepapers en nieuwe LLM-, VLM- en CV-benchmarkresultaten, van nieuw naar oud. Elke vermelding linkt naar waar zij over gaat.
oktober 2026
- 6 oktoberNieuwe LLM-benchmarkQwen3.8-27B — RTX PRO 6000Qwen3.8-27B op één RTX PRO 6000: NVFP4-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3), gemeten tot 128 gelijktijdige verzoeken.
- 6 oktoberNieuwe LLM-benchmarkQwen3.8-27B — RTX PRO 6000Qwen3.8-27B op één RTX PRO 6000: BF16-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3), gemeten tot 128 gelijktijdige verzoeken.
- 6 oktoberNieuwe whitepaperDe eerste open-gewichtsalternatieven voor JevZes open-weight typed-decision-modellen, vergeleken op één NVIDIA DGX Spark (GB10) via één gedeelde state + questions-interface en één set van 25 vragen: nauwkeurigheid, kalibratie, gevoeligheid voor de optievolgorde en latentie — plus welk model bij welke taak past.
- 6 oktoberNieuwe whitepaperVLM Inference Benchmark ExplorerVerken inferentiebenchmarks van vision-languagemodellen op RTX PRO 6000 Blackwell, Jetson AGX Orin en Jetson Orin NX. Kies het beeldformaat, stel in hoe lang een camera op zijn antwoord mag wachten, en zie hoeveel camera's elke configuratie bijhoudt.
- 1 oktoberNieuwe LLM-benchmarkGemma-4-31B-it — ThorGemma-4-31B-it op Jetson AGX Thor: NVFP4-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3) en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkQwen3-VL-30B-A3B-Instruct — ThorQwen3-VL-30B-A3B-Instruct, een vision-languagemodel, op Jetson AGX Thor: FP8-gewichten geserveerd met vLLM, met speculatieve decodering en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkQwen3.8-27B — RTX PRO 6000Qwen3.8-27B op één RTX PRO 6000: FP8-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3), gemeten tot 128 gelijktijdige verzoeken.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Pro-MOPD — DGX B300MiMo-V2.6-Pro-MOPD (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens, gemeten tot 256 gelijktijdige verzoeken.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 2× DGX SparkMiMo-V2.6-Flash-RL (310B) op 2× DGX Spark: FP4-gewichten geserveerd met vLLM over beide nodes (TP2), met DFlash speculatieve decodering (k=7) en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 4× DGX SparkMiMo-V2.6-Flash-RL (310B) op 4× DGX Spark: FP4-gewichten geserveerd met vLLM over vier nodes (TP4), met DFlash speculatieve decodering (k=7) en een context van 500K.
september 2026
- 29 septemberNieuwe whitepaperEngram-offloading bij LLM-inferentieEngram-tabellen zijn groot, maar per token worden er maar een paar rijen uit gelezen; daarom kunnen ze van het GPU-geheugen naar systeem-RAM of NVMe. Wat dat betekent op DGX Spark, RTX PRO 6000 en DGX B300, en meetresultaten met DeepSeek-V4.1-Flash en Qwen3.8-Flash-Next.
- 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — 1× DGX SparkQwen3.8-Flash-Next (176B) op één DGX Spark: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB gelezen vanaf NVMe.
- 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — RTX PRO 6000Qwen3.8-Flash-Next (176B) op één RTX PRO 6000: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB in systeem-RAM.
- 28 septemberNieuwe LLM-benchmarkMiMo-V2.6-Pro-RL — DGX B300MiMo-V2.6-Pro-RL (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens.
- 18 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson AGX ThorPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11-N — Jetson AGX ThorYOLO11-N-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11S — Jetson AGX ThorYOLO11S-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11M — Jetson AGX ThorYOLO11M-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11L — Jetson AGX ThorYOLO11L-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 17 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 8× DGX Spark met TP8Deployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 8× NVIDIA DGX Spark (GB10) met TP8: twee configuraties (300K met Engram in het geheugen, 1M met Engram-on-disk), NCCL-optimalisatie, benchmarkresultaten en vergelijking met TP4.
- 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: FP8-gewichten geserveerd met vLLM over acht nodes (TP8), met DSpark speculatieve decodering (k=5) en een context van 300K, de Engram-tabel in het geheugen.
- 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: dezelfde TP8-opstelling met een context van 1M tokens, de Engram-tabel verplaatst naar schijf.
- 16 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 4× DGX SparkDeployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 4× NVIDIA DGX Spark (GB10) met tensorparallellisme: vLLM-buildketen, 7 patches voor SM 12.1a, Engram-on-disk, benchmarkresultaten en vergelijking met B300.
- 16 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 4× DGX SparkDeepSeek-V4.1-Flash (763B) op 4× DGX Spark: FP8-gewichten geserveerd met vLLM over vier nodes (TP4), met DSpark speculatieve decodering (k=5) en een context van 300K.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — GB10PeopleNet-persoonsdetectie (INT8, invoer 960×544) op GB10 (DGX Spark): frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson Orin NanoPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson Orin Nano: frames per seconde per camera, gemeten van 1 tot 8 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3060PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3060: frames per seconde per camera, gemeten van 1 tot 16 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3090PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkYOLO11-N — RTX 3090YOLO11-N-objectdetectie (invoer 640×640) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 28 gelijktijdige camera's.
- 14 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — DGX B300DeepSeek-V4.1-Flash (763B) op DGX B300: FP8-gewichten geserveerd met vLLM op vier GPU's (TP4), met DSpark speculatieve decodering (k=3) en een context van 1M tokens.
- 14 septemberNieuwe LLM-benchmarkTencent-Hy4-preview — DGX B300Tencent-Hy4-preview (780B) op DGX B300: BF16-gewichten geserveerd met vLLM op alle acht GPU's (TP8), met MTP voor speculatieve decodering (k=3) en een context van 512K.
- 14 septemberNieuwe LLM-benchmarkDeepSeek-V4-Flash-Vision-Exp — 2× DGX SparkDeepSeek-V4-Flash-Vision-Exp (305B) op 2× DGX Spark: FP8-gewichten geserveerd met vLLM over beide nodes (TP2), met DSpark speculatieve decodering (k=3) en een context van 131K.
- 4 septemberNieuwe LLM-benchmarkGLM-5.3 — 8× DGX SparkGLM-5.3 (753B) op 8× DGX Spark: NVFP4-gewichten geserveerd met vLLM over acht nodes (TP8), met de ingebouwde MTP van het model voor speculatieve decodering (k=4) en een context van 256K.
- 4 septemberNieuwe LLM-benchmarkMuse-Glimmer-30B — RTX PRO 6000Muse-Glimmer-30B op één RTX PRO 6000: BF16-gewichten geserveerd met vLLM, met DFlash speculatieve decodering via de ingebouwde MTP van het model (k=15).
- 1 septemberNieuwe LLM-benchmarkGLM-5.3 — DGX B300GLM-5.3 (753B) op DGX B300: FP8-gewichten geserveerd met SGLang op vier GPU's (TP4), met een context van 1M tokens.
augustus 2026
- 3 augustusNieuwe whitepaperNVIDIA DGX B300 vs GB300 NVL72: vergelijking van clusterarchitecturenTechnische vergelijking van twee NVIDIA Blackwell Ultra-architecturen, DGX B300 en GB300 NVL72: systeemontwerp, schaalaanpak, netwerkfabric, stroom en koeling, en welke workloads bij welk platform passen.
juli 2026
- 30 juliNieuwe whitepaperKimi K3-inferentiebenchmark op DGX-B300Prestatie-evaluatie van Moonshot AI Kimi K3 (2.8T MoE, MXFP4) op NVIDIA DGX-B300 (8x Blackwell Ultra, TP=8): vLLM versus SGLang, direct versus DSpark speculatieve decodering, met capaciteitsplanning op basis van SLO's.
- 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 3 nodesInstallatie van een AI-cluster in ringtopologie (mesh) met 3 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
- 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 2 nodesInstallatie van een AI-cluster in point-to-point-topologie met 2 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
- 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 8 nodesInstallatie van een switchgebaseerd AI-cluster met 8 NVIDIA DGX Spark-nodes via een MikroTik CRS804 met 200G-breakout: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
- 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 4 nodesInstallatie van een switchgebaseerd AI-cluster met 4 NVIDIA DGX Spark-nodes via een MikroTik CRS812: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
- 6 juliNieuwe whitepaperSchaling van Qwen3.6-27B op een DGX Spark-clusterSchalingsstudie over meerdere nodes van Qwen3.6-27B-NVFP4 op 1x, 2x en 4x NVIDIA DGX Spark (GB10): tensorparallellisme over 200GbE, capaciteitsplanning op basis van SLO's en advies voor de keuze tussen TP en replicatie bij deployment.
- 3 juliNieuwe whitepaperQwen3.6-27B DGX Spark-benchmarkPrestatie-evaluatie van het Qwen3.6-27B-model op het NVIDIA DGX Spark (GB10)-platform met de kwantisatievarianten FP8, FP8-MTP, AWQ-MTP, NVFP4 en NVFP4-MTP.
juni 2026
- 30 juniNieuwe whitepaperHandleiding voor lokaal LLM-gebruikIntegrale beslisgids voor lokaal LLM-gebruik: hardware (NVIDIA Jetson, RTX PRO, DGX Spark, DGX/HGX), modelkeuze, softwarestack en koppeling aan scenario's.