NVIDIA-jev inference stack smanjio je trošak tokena DeepSeek V4 za do 5 puta na GPU-ima Blackwell, koristeći TensorRT-LLM, Dynamo, NVFP4, vLLM i SGLang.
NVIDIA-jevi trošak tokena DeepSeek V4 smanjen za 5 puta
Izvori
Originalni sadržaj iz javnih izvora. Pune članke ne objavljujemo — kliknite za izvornu publikaciju.
- Techgenyz (2026-07-01 16:19) Pročitaj original ↗
AI će pretražiti dodatne izvore i sintetizirati detaljniji sažetak (8-12 rečenica) iz više izvora. Rezultat se ne sprema javno i ne indeksira.