蚂蚁百灵开源7.9B轻量MoE基座,MIT许可、代码能力领先

流云 2026-08-24 1091 0条评论
摘要:    2026年8月20日,蚂蚁百灵inclusionAI正式开源Ling-3.0-tiny-base——Ling-3.0系列的轻量基座模型。总参数7.9B,每...

   2026年8月20日,蚂蚁百灵inclusionAI正式开源Ling-3.0-tiny-base——Ling-3.0系列的轻量基座模型。总参数7.9B,每token仅激活1.3B,采用128路由专家加1共享专家的Hybrid-linear MoE架构。此次开源同步放出预训练、中期训练与WSM合并3个训练节点checkpoint,采用MIT许可证,代码能力在HumanEval-Plus等基准上大幅领先同尺寸模型,适合继续预训练与MoE消融研究等低成本场景。

一、三个训练节点权重全开放,覆盖不同介入阶段

Ling-3.0-tiny-base此次开源把训练过程的关键节点checkpoint全部开放,共3个权重,对应不同开发阶段:

  • 预训练检查点base-30T:完成大规模预训练,未经历中期训练、WSM合并与后训练,适合从头注入领域语料的继续预训练

  • 中期训练检查点base-midtrain:完成中期训练,未做WSM合并与后训练,适合在已有中期能力基础上做定向增强

  • WSM合并检查点base:完成加权检查点合并,即最终基座模型,适合直接作为后训练起点

WSM(Warmup-Stable and Merge)策略用加权检查点合并取代学习率衰减,让基座更适合持续预训练与动态数据扩展,技术细节见arXiv:2507.17634。这种"多节点开放"的设计在开源基座中并不多见——大多数项目只发布最终权重,而Ling-3.0-tiny-base让研究者可以回溯到训练的不同阶段,进行对比实验或从特定节点继续开发。

二、高度稀疏MoE与原生混合线性注意力

Ling-3.0-tiny-base采用高度稀疏的混合专家架构:128个路由专家与1个共享专家,每个token仅激活8个路由专家,总参数7.9B但激活参数只有1.3B。这种"大容量、低激活"的设计使其推理成本接近1.3B稠密模型,但知识容量远超。同时在预训练一开始就原生采用KDA与Gated MLA结合的混合线性注意力,兼顾长上下文效率与推理速度。

在AI开源模型生态中,7.9B总参、1.3B激活的规模恰好处于一个"甜点区间"——既足够大以容纳丰富的知识,又足够小以在单卡上完成微调和推理。对于算力有限的学术团队和中小型企业,这意味着可以在不投入多卡集群的前提下,完整走完从基座下载到领域微调的全流程。

三、尺寸无缝扩展的实验路径

Ling-3.0-tiny-base与同日开源的Ling-3.0-flash-base(124B/A5.1B)共享同一套训练配方。开发者可以先在7.9B的tiny上低成本验证策略,再扩展到124B的flash,大幅降低试错成本。这与蚂蚁百灵开源Ling-2.6-1T、Ling-2.6-flash的路线一致——以小尺寸验证、大尺寸投产。

四、与同类轻量基座模型对比

对比维度Ling-3.0-tiny-baseLing-2.5-mini-baseQwen3.5-9B-base
总参数/激活参数7.9B / 1.3B16B / 1.4B9B(稠密)
HumanEval-Plus79.2776.2252.44
LiveCodeBench24.2322.9118.06
BigCodeBench42.8942.5429.39
MATH50065.6068.4055.20
许可证MIT开源开源

代码能力是最突出的长板:HumanEval-Plus、LiveCodeBench、BigCodeBench等代码基准全部领先,HumanEval-Plus对Qwen3.5-9B-base优势接近27个百分点;知识与数学基准上互有胜负。值得注意的是,基座模型不适合直接对话部署,正式对话与智能体能力需使用8月11日开源的Ling-3.0-tiny推理版。

在AI基座模型选型的维度上,Ling-3.0-tiny-base提供了一个差异化的选择:如果你需要做代码方向的SFT或RL实验,它的代码基准表现明显优于同尺寸竞品;如果你需要长上下文能力,它的原生混合线性注意力设计也提供了更好的效率基础。同时,MIT许可证意味着商用与研究均无限制,这在当前开源基座中并不多见。

五、应用场景与适用人群

  • 代码方向后训练研究:多项代码基准领先,适合代码SFT与RL后训练实验

  • 继续预训练:WSM合并版未经历学习率衰减,可直接注入领域语料

  • MoE消融实验:128路由专家的小规模让路由与负载均衡实验成本可控

  • 蒸馏研究:官方推荐用途,可结合Ling系列大模型开展知识蒸馏

适用人群:大模型研究者、后训练工程师、开源社区开发者,以及算力有限、希望在Ling-3.0体系内验证训练策略的高校与小团队。

六、如何使用Ling-3.0-tiny-base

权重托管在HuggingFace与ModelScope,MIT许可证下无需申请即可下载全部3个checkpoint。官方ling-cookbook仓库提供微调与继续预训练示例。建议先在tiny-base上验证策略,再扩展到124B的Ling-3.0-flash-base,对照推理版评估效果。

七、开源许可与成本

  • 开源时间:2026年8月20日,与flash-base共6个checkpoint一次性开放

  • 许可证:MIT License,商用与研究均无限制

  • 推理版对照:Ling-3.0-tiny推理版已于8月11日开源,上线OpenRouter

  • 价格:权重免费,成本仅在算力

文章版权及转载声明:

作者:流云本文地址:https://www.sanwenge.com/post/1373.html发布于 2026-08-24
文章转载或复制请以超链接形式并注明出处三文阁