2026年8月20日,蚂蚁百灵inclusionAI正式开源Ling-3.0-tiny-base——Ling-3.0系列的轻量基座模型。总参数7.9B,每token仅激活1.3B,采用128路由专家加1共享专家的Hybrid-linear MoE架构。此次开源同步放出预训练、中期训练与WSM合并3个训练节点checkpoint,采用MIT许可证,代码能力在HumanEval-Plus等基准上大幅领先同尺寸模型,适合继续预训练与MoE消融研究等低成本场景。
一、三个训练节点权重全开放,覆盖不同介入阶段
Ling-3.0-tiny-base此次开源把训练过程的关键节点checkpoint全部开放,共3个权重,对应不同开发阶段:
预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练,适合从头注入领域语料的继续预训练
中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练,适合在已有中期能力基础上做定向增强
WSM合并检查点base:完成加权检查点合并,即最终基座模型,适合直接作为后训练起点
WSM(Warmup-Stable and Merge)策略用加权检查点合并取代学习率衰减,让基座更适合持续预训练与动态数据扩展,技术细节见arXiv:2507.17634。这种"多节点开放"的设计在开源基座中并不多见——大多数项目只发布最终权重,而Ling-3.0-tiny-base让研究者可以回溯到训练的不同阶段,进行对比实验或从特定节点继续开发。
二、高度稀疏MoE与原生混合线性注意力
Ling-3.0-tiny-base采用高度稀疏的混合专家架构:128个路由专家与1个共享专家,每个token仅激活8个路由专家,总参数7.9B但激活参数只有1.3B。这种"大容量、低激活"的设计使其推理成本接近1.3B稠密模型,但知识容量远超。同时在预训练一开始就原生采用KDA与Gated MLA结合的混合线性注意力,兼顾长上下文效率与推理速度。
在AI开源模型生态中,7.9B总参、1.3B激活的规模恰好处于一个"甜点区间"——既足够大以容纳丰富的知识,又足够小以在单卡上完成微调和推理。对于算力有限的学术团队和中小型企业,这意味着可以在不投入多卡集群的前提下,完整走完从基座下载到领域微调的全流程。
三、尺寸无缝扩展的实验路径
Ling-3.0-tiny-base与同日开源的Ling-3.0-flash-base(124B/A5.1B)共享同一套训练配方。开发者可以先在7.9B的tiny上低成本验证策略,再扩展到124B的flash,大幅降低试错成本。这与蚂蚁百灵开源Ling-2.6-1T、Ling-2.6-flash的路线一致——以小尺寸验证、大尺寸投产。
四、与同类轻量基座模型对比
| 对比维度 | Ling-3.0-tiny-base | Ling-2.5-mini-base | Qwen3.5-9B-base |
|---|---|---|---|
| 总参数/激活参数 | 7.9B / 1.3B | 16B / 1.4B | 9B(稠密) |
| HumanEval-Plus | 79.27 | 76.22 | 52.44 |
| LiveCodeBench | 24.23 | 22.91 | 18.06 |
| BigCodeBench | 42.89 | 42.54 | 29.39 |
| MATH500 | 65.60 | 68.40 | 55.20 |
| 许可证 | MIT | 开源 | 开源 |
代码能力是最突出的长板:HumanEval-Plus、LiveCodeBench、BigCodeBench等代码基准全部领先,HumanEval-Plus对Qwen3.5-9B-base优势接近27个百分点;知识与数学基准上互有胜负。值得注意的是,基座模型不适合直接对话部署,正式对话与智能体能力需使用8月11日开源的Ling-3.0-tiny推理版。
在AI基座模型选型的维度上,Ling-3.0-tiny-base提供了一个差异化的选择:如果你需要做代码方向的SFT或RL实验,它的代码基准表现明显优于同尺寸竞品;如果你需要长上下文能力,它的原生混合线性注意力设计也提供了更好的效率基础。同时,MIT许可证意味着商用与研究均无限制,这在当前开源基座中并不多见。
五、应用场景与适用人群
代码方向后训练研究:多项代码基准领先,适合代码SFT与RL后训练实验
继续预训练:WSM合并版未经历学习率衰减,可直接注入领域语料
MoE消融实验:128路由专家的小规模让路由与负载均衡实验成本可控
蒸馏研究:官方推荐用途,可结合Ling系列大模型开展知识蒸馏
适用人群:大模型研究者、后训练工程师、开源社区开发者,以及算力有限、希望在Ling-3.0体系内验证训练策略的高校与小团队。
六、如何使用Ling-3.0-tiny-base
权重托管在HuggingFace与ModelScope,MIT许可证下无需申请即可下载全部3个checkpoint。官方ling-cookbook仓库提供微调与继续预训练示例。建议先在tiny-base上验证策略,再扩展到124B的Ling-3.0-flash-base,对照推理版评估效果。
七、开源许可与成本
开源时间:2026年8月20日,与flash-base共6个checkpoint一次性开放
许可证:MIT License,商用与研究均无限制
推理版对照:Ling-3.0-tiny推理版已于8月11日开源,上线OpenRouter
价格:权重免费,成本仅在算力
