Ai2开源Olmo-core 3训练栈:专家规模可以扩展,万亿参数测试仍不等于模型训练完成
2026年10月1日,Ai2发布Olmo-core 3,为大型混合专家模型重做了一套开放训练基础设施。它面向研究者训练和修改自己的MoE,发布内容包含代码与技术报告;下一代Olmo模型仍在建设之中。因此,这次新闻的主体是训练工具,不能把框架支持的参数容量写成已经交付的模型能力。
专家变多之后,数据怎样找到它们
MoE只让一部分专家处理每个词元,但全部专家的参数仍要存储和更新。Ai2介绍,新实现让专家常驻GPU,把相关数据送到专家所在位置,减少反复收集权重的开销。官方在8张B300上的初步测试中,470亿参数配置的每卡吞吐约为旧实现的2.7倍;这是发布方对自家前后实现的比较。
AI模型生成的概念配图,表现数据选择部分计算模块,并非真实硬件照片或系统拓扑。
读性能数字,先看测试完成了哪一步
官方还披露了万亿参数级测试,但作了两项重要限定:1.2万亿参数配置使用随机路由考察系统性能;2.38万亿参数配置属于短时容量测试,没有完成整轮训练。它们能够说明系统探索了多大规模,无法单凭这些数字判断训练后模型的准确性或持续运行成本。
以下为本文分析。可以把训练栈想成一间大型工作室:增加专业工位,既需要安排任务,也要保证各工位不会相互等待。更多工位能够被系统管理,只回答了容量问题;相同时间能完成多少合格作品,还涉及任务分配、材料流转和返工。
小团队更值得复查的三件事
首先确认自己的瓶颈。若训练主要卡在数据读取,更换专家通信实现可能不会带来同样收益。其次让比较条件可重现,记录硬件、模型规模、输入长度和精度,再观察端到端训练步骤,而不是挑出最快的一个算子。最后把保存检查点和恢复训练纳入演练,确认中断后可以继续推进。
一项可行的试用设计,是先用已有小模型和固定数据跑出旧配置基线,再替换训练实现。除了每秒词元数,还检查损失曲线、显存峰值和运行失败次数。速度上升而训练行为明显变化时,应先解释变化来源,再决定是否扩大规模。这些是本文提出的验证方法,本文未执行该框架实测。
来源与核验
Ai2公告日期为2026年10月1日,说明发布内容、测试配置与边界;官方代码仓库提供实现入口。资料于北京时间2026年10月2日核验,性能数据均归属于Ai2公布的结果。


