2026年8月20日,蚂蚁百灵inclusionAI正式开源Ling-3.0-flash-base——Ling-3.0系列的大尺寸基座模型。总参数124B,每token仅激活5.1B,采用512路由专家加1共享专家的Hybrid-linear MoE架构,稀疏度约1/64。此次开源一次性放出预训练、中期训练与WSM合并3个checkpoint,采用MIT许可证,在MATH500、LongBench等多项基座基准上取得第一。
一、三个训练节点权重全开放,覆盖不同开发阶段
Ling-3.0-flash-base此次开源把关键节点的checkpoint全部开放,共3个权重,对应不同开发阶段:
预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练,适合需要从头注入领域数据的继续预训练场景
中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练,适合在已有中期能力基础上做定向增强
WSM合并检查点base:完成加权检查点合并,即最终基座模型,适合直接作为后训练起点
WSM(Warmup-Stable and Merge)策略用加权检查点合并取代学习率衰减,让基座更适合持续预训练与动态数据扩展,详见arXiv:2507.17634。这种“按阶段开放”的设计,让研究者可以根据自己的需求选择合适的介入节点,而非只能使用最终版本。
二、高度稀疏MoE与原生混合线性注意力
Ling-3.0-flash-base采用官方称为“高度稀疏”的混合专家架构:512个路由专家与1个共享专家,每token仅激活8个路由专家,稀疏度约1/64。总参124B但激活仅5.1B,推理成本接近5B稠密模型,但知识容量远超。同时原生采用KDA与Gated MLA混合线性注意力,在LongBench、LEval长文基准上大幅领先。
这种“大容量、低激活”的设计,使其在算力有限的开源社区环境中具备了独特的实用价值。相比于那些动辄激活数十B参数的模型,Ling-3.0-flash-base用更少的激活参数实现了更强的基准表现。
三、与同类大尺寸基座模型的正面交锋
| 对比维度 | Ling-3.0-flash-base | Ling-2.5-flash-base | Hy3-preview-base |
|---|---|---|---|
| 总参数/激活参数 | 124B / 5.1B | 104B / 7.4B | 295B / 21B |
| HumanEval-Plus | 81.10 | 80.49 | 79.27 |
| LiveCodeBench | 40.09 | 33.04 | 35.90 |
| MMLU-Pro | 67.74 | 61.36 | 66.44 |
| MATH500 | 79.00 | 74.00 | 60.60 |
| LongBench | 52.62 | 42.81 | 20.58 |
| 许可证 | MIT | 开源 | 开源 |
以最少的激活参数(5.1B)拿下知识、数学、代码、长文多数第一:MMLU-Pro、MATH500、LiveCodeBench、LongBench全面领先,LongBench优势超过32个百分点。值得注意的是,基座模型不适合直接对话部署,对话与智能体能力需使用8月7日开源的Ling-3.0-flash推理版。
四、应用场景与适用人群
大规模继续预训练:WSM合并版未经历学习率衰减,可注入领域语料
代码方向后训练:多项代码基准领先,适合代码SFT与RL实验
长上下文研究:LongBench、LEval大幅领先,适合长文任务选型
MoE系统研究:512路由专家、1/64稀疏度是研究负载均衡的典型样本
蒸馏教师模型:124B容量可作知识蒸馏教师,向小模型输出能力
在AI开源模型生态中,Ling-3.0-flash-base填补了一个重要空白:它既提供了大容量基座的知识储备,又通过稀疏激活控制了推理成本。对于需要在开源基座上做领域定制的团队而言,这套权重组合为从预训练到后训练的完整链路提供了可复现的起点。同时,MIT许可证意味着商用与研究均无限制——这在当前开源基座模型中并不多见。对于关注AI工具导航中“开源基座模型”类目的开发者,Ling-3.0-flash-base值得纳入选型对比列表。
五、如何使用Ling-3.0-flash-base
权重托管在HuggingFace与ModelScope,MIT许可证下无需申请即可下载全部3个checkpoint。官方ling-cookbook仓库提供微调与继续预训练示例。建议先在tiny-base验证策略,再放大到flash-base,对照推理版评估效果。
六、开源许可与成本
开源时间:2026年8月20日,与tiny-base共6个checkpoint一次性开放
许可证:MIT License,商用与研究均无限制
附带版本:另有fp8/fp4量化版与dspark变体
价格:权重免费,成本仅在算力
