英伟达Blackwell平台适配DeepSeek-V4系列模型 助力开发者高效部署与推理
英伟达近日宣布,其NVIDIA Blackwell平台已完成对DeepSeek-V4-Pro与DeepSeek-V4-Flash两款大模型的适配工作。开发者可通过NVIDIA NIM微服务直接下载部署,或基于SGLang、vLLM框架实现定制化推理,为AI应用开发提供更灵活的技术路径。
在模型参数配置上,DeepSeek-V4-Pro以1.6万亿总参数量与490亿激活参数的组合,专注于复杂推理场景;而DeepSeek-V4-Flash则采用2840亿总参数量与130亿激活参数的轻量化设计,主打高速响应需求。两款模型均支持百万级Token上下文窗口与最高38.4万Token的输出能力,可覆盖长文档分析、代码生成等核心应用场景,并采用MIT开源协议保障技术共享。
性能测试显示,DeepSeek-V4-Pro在NVIDIA GB200 NVL72集群上实现每用户每秒150个token的基准性能,通过vLLM框架的Day 0优化方案,可在Blackwell B300架构上快速完成部署。随着Dynamo编译器、NVFP4量化技术及CUDA内核的持续优化,模型推理效率有望进一步提升。
在部署生态构建方面,SGLang框架提供低延迟、均衡负载及最大吞吐量三种优化模式,满足不同场景的性能需求;vLLM框架则支持跨100个以上GPU节点的分布式推理,并集成工具调用与推测解码功能,为大规模AI服务提供技术支撑。这种多框架兼容的设计,显著降低了开发者将模型落地至生产环境的门槛。
相关阅读
- 首创平嵌级艺术门锁!卡萨帝智能门锁发布X80新品
- 折叠未来 展开无限 三星“Unfold your world折叠势・集”落地上海
- 云天励飞AI版图再添一员,收购智能穿戴公司岍丞技术
- DapuStor使用Pliops加速NoSQL存储引擎
- 千亿身家湖南女首富周群飞:押宝人形机器人,续写商业传奇新篇
- DIGISTOR的Citadel SSD获得NSA认证 对保护敏感数据至关重要
- 抢滩AI高地! 卡奥斯数字生态大会将在上海举行,平台重装升级亮相
- 国务院办公厅:拟提请全国人大常委会修订住房公积金管理等条例
- 联想ThinkSystem SR685a V3和SR680a V3 GPU服务器发布
- Pure Storage和红帽通过Portworx推动现代虚拟化