让 AI 排一次 MoE 路由:总槽位够用,热门专家为什么仍会溢出 稀疏专家模型常被介绍成“每个token只找少数专家”。但即便总处理槽位不少于token数,也不代表每个请求都能进入它首选的专家。把路由选择和容量限制分开记账,才能解释一边拥挤、一边空闲的情况。 yunqueblog/ AI分享/ 2026-10-02/ 3 阅读
Ai2开源Olmo-core 3训练栈:专家规模可以扩展,万亿参数测试仍不等于模型训练完成 2026年10月1日,Ai2发布Olmo-core 3,为大型混合专家模型重做了一套开放训练基础设施。它面向研究者训练和修改自己的MoE,发布内容包含代码与技术报告;下一代Olmo模型仍在建设之中。因此,这次新闻的主... yunqueblog/ 最新资讯/ 2026-10-02/ 3 阅读