星途科讯 17小时前
Ai2开源OlmoCore 3:万亿参数MoE训练提速,揭示路由故障
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

2026 年 10 月 1 日,AI 研究所(Allen Institute for AI,简称 Ai2)正式发布 OlmoCore 3。这是一款经过重新设计的开源训练框架,旨在让研究人员无需依赖专有工业级技术栈,即可构建和训练混合专家(MoE)语言模型。该框架首次提供了针对总参数量超过一万亿模型的完整基准测试文档,其规模此前仅少数闭源实验室能够触及。

架构重构:从 FSDP 转向 DDP

OlmoCore 3 的核心工程变革在于将并行策略从全分片数据并行(FSDP)切换为分布式数据并行(DDP)。在传统 FSDP 模式下,每个训练批次需收集并重新分片整个专家池,随着专家规模扩大,通信成本急剧上升。OlmoCore 3 采用新策略,将专家固定驻留在 GPU 上,仅路由数据至相应专家,从而大幅消除通信开销。

基准测试显示,在 8 块 NVIDIA B300 GPU 上训练 470 亿参数的 MoE 模型时,新架构下的吞吐量达到每 GPU 每秒约 52,000 个 token,较此前实现的约 19,400 个 token 提升了约 2.7 倍。即便将专家池从 8 个扩展至 128 个(总参数容量从 46 亿增至 470 亿),同时保持活跃参数固定在约 32 亿,训练吞吐量下降幅度仍控制在 5% 以内,实现了跨越 10 倍扩展的近平坦性能曲线。

万亿参数基准与硬件极限

Ai2 在远超以往 OlmO 模型规模的配置下对 OlmoCore 3 进行了压力测试。在 512 块 B300 GPU 集群上,拥有 1.2 万亿总参数(约 583.6 亿活跃参数)的配置实现了每 GPU 858 TFLOPS 的峰值吞吐量。另一项使用 DeepEP v2 通信层的测试则触及了约 2.38 万亿总参数的配置。

值得注意的是,这些基准测试均基于随机路由而非真实 token 分布,旨在衡量系统吞吐量上限,而非证明 Ai2 已完成万亿参数模型的训练或验证其最终表现。技术报告《为高效可扩展的 MoE 训练加速 Olmo-core》明确将这些数据标记为系统参考值。此外,在 7B 规模模型测试中,该框架在 43% 的模型 FLOP 利用率下,每 GPU 每秒可处理约 7,700 个 token。

技术细节:路由优化与精度压缩

OlmoCore 3 通过三种并行策略分布大型 MoE 模型:专家并行性将不同专家子集分配至不同 GPU;流水线并行性分割模型层以降低单卡内存需求;分布式优化器则对梯度元数据进行分片。在此基础上,三项路由优化进一步降低成本:利用 NVSHMEM 实现的行级专家并行性使通信完全同步自由;GPU 驻留路由让元数据保留在显卡内,避免 CPU 等待;分组 GEMM 则将小型专家计算批量执行,提升 GPU 效率。

框架还支持 MXFP8 低精度格式。在四块 B300 GPU 的受控测试中,启用 MXFP8 相比 BF16 基线,吞吐量提升约 21%,峰值活跃内存从约 103 GiB 降至 95 GiB。其检查点格式独立于并行布局记录全局 FP32 张量,支持在不同集群拓扑间暂停和恢复训练而不丢失数据。

揭示 "Token 杰利蝾螈 " 故障模式

OlmoCore 3 发布中最具价值的洞察之一是 Ai2 发现的 "Token 杰利蝾螈 "(Token Gerrymandering)现象。这是一种隐蔽的故障模式:旨在平衡专家负载的辅助损失指标可能显示改善,但实际的工作分布却变得更加不平衡。在昂贵的大规模训练中,这种 " 指标向好但行为退化 " 的现象极具误导性。

技术报告还记录了其他反直觉发现:降低单个专家的学习率并未改善 OlmO 系列模型的结果;在单独 GPU 流上重叠通信和计算有时反而拖慢端到端训练;以及 GPU 计算时间随输入值变化而非仅取决于矩阵维度。Ai2 选择公开这些通常在闭源实验室内部消化的负面案例,旨在帮助学术团队审计自身训练管道,识别潜在故障。

与 Megatron-Core 的定位差异

NVIDIA 的 Megatron-Core 是业界标准的通用 MoE 训练框架,适用于多供应商环境及数千块 GPU 集群,在 GB300 硬件上可实现每 GPU 超 1,200 TFLOPS 的吞吐量。相比之下,OlmoCore 3 在 B300 上的 858 TFLOPS 虽略低,但两者处于同一性能层级。

两者的核心区别在于生态集成。Megatron-Core 提供通用灵活性,而 OlmoCore 3 专为 OlmO 模型系列量身定制,随附官方预训练脚本(涵盖 OlmO 3 7B 和 32B 的中期训练及长上下文扩展)、真实训练日志、检查点转换工具及原生聊天界面。对于希望复现或扩展 Ai2 研究成果的开发者和研究者而言,OlmoCore 3 提供了开箱即用的完整起点。

开放基础设施的战略意义

作为由保罗 · 艾伦创立的非营利机构,Ai2 致力于推动 AI 透明度。继开放 OlmO 和 Molmo 模型的权重、训练数据及评估管道后,OlmoCore 3 进一步敞开了底层训练基础设施。2025 年 8 月,Ai2 曾获美国国家科学基金会(NSF)和英伟达共同出资 1.52 亿美元,用于构建完全开放的多模态 AI 模型。

Ai2 认为,只有当背后的分布式系统设计和工程决策同样开放时,模型权重才更具价值。下一代 OlmO 模型将基于此框架,在 Ai2 迄今最大的数据集上训练,并支持更长的上下文窗口。OlmoCore 3 已通过 PyPI 以 ai2-olmo-core 包名发布,采用 Apache 2.0 许可证,代码托管于 GitHub。

【星途科讯 图文丨赵晶 首发于 ZAKER 科技,转载请注明出处】

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

吞吐量 开源 gpu 建和 研究所
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论