DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs
英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录,每 GPU 算力达 1648 TFLOPs。...
最新 7 月 22 日消息,英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录,每 GPU 算力达 1648 TFLOPs(每秒万亿次浮点运算)。
最新注:MoE(混合专家模型)是一种机器学习模型架构。它将大型模型分割为多个更小的“专家”子网络,每次推理或训练时仅激活其中一部分。该架构旨在以更低的计算成本实现更大规模的模型容量,常用于大语言模型以提升效率。

模型预训练是指在大规模无标注数据集上,利用自监督学习方法让模型初步掌握通用的语言规律、视觉特征或常识。
在最新博文中,英伟达表示:
使用 256 块 GPU 预训练 DeepSeek-v3 671B 模型,GB300 NVL72 实现了每 GPU 吞吐 1648 TFLOPs 的全新世界纪录。在相同训练任务上,GB300 NVL72 用更少的 GPU 硬件,达到了相同的性能。
英伟达表示在过去 6 个多月时间里,通过模拟超过 25 万种不同配置,为 Blackwell 摸索发现了 38 项重大优化方案,累计进行了 140 万小时的 GPU 优化测试。

相比较 2025 年 11 月的预训练测试(1088 TFLOPs)结果,GB300 NVL72 系统性能优化提升 50%。

与上一代 GB200 每 GPU 606 TFLOPs 的成绩相比,GB300 实现了约 3 倍的性能跃升。




《DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
三菱电机与索尼半导体将设立制造业 AI 视觉解决方案合资企业
这家名为 Advanced Vision Solutions 将打造端侧集成式图像 AI 分析系统,助力制造业无人化。... -
Mac 版 Claude Code 集成 iOS 模拟器,可 AI 构建和测试 App
@ClaudeDevs 官方账号今天(7 月 22 日)在 X 平台发布推文,宣布桌面版 Claude Code 内置集成 iOS 模拟器,无需屏幕录制与辅助功能权限即可构建、运行和测试 iOS 应用。... -
Claude Cowork 新增录屏教学:用户演示一遍即可教会 AI
@claudeai 官方账号昨日(7 月 21 日)在 X 平台发布推文,邀请 Pro、Max 以及 Teams 订阅用户,体验 Claude Cowork 中的“录制技能”(Record a skill)功能。... -
消息称三星考虑按 200 亿欧元估值向 Mistral AI 投资 10 亿欧元
Mistral AI 对于欧洲乃至更广泛地区的人工智能独立性的重要性随着美国政府近期一连串监管措施进一步凸显。... -
DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs
英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录,每 GPU 算力达 1648 TFLOPs。...












