NVIDIA-jev inference stack smanjio je trošak tokena DeepSeek V4 za do 5 puta na GPU-ima Blackwell, koristeći TensorRT-LLM, Dynamo, NVFP4, vLLM i SGLang.