模型简介:Ling‑3.0‑tiny 是蚂蚁集团百灵 InclusionAI 团队发布的轻量级 MoE 混合推理大模型,主打低算力本地 / 边缘部署,总参数 7.9B,推理仅激活 1.3B 参数,兼顾推理速度、Agent 工具调用、代码生成与长文本处理能力,适合开发者、中小团队做私有化离线 AI 应用开发。
开发机构:蚂蚁百灵 InclusionAI(蚂蚁集团 AI 实验室)发布时间:2026‑08‑11,Hugging Face 正式开源发布模型定位:轻量原生混合推理 MoE 大语言模型,面向端侧、本地离线、低算力环境、轻量智能体场景权重版本:BF16、FP8、INT4 三套量化权重,适配不同硬件配置上下文窗口:支持 256K 上下文长度硬件适配:已验证 NVIDIA DGX Spark、Apple Silicon MacBook、Mac mini;M4 Pro 实测 86‑90 token/s,8K 上下文峰值内存约 8.34GiB获取方式:Hugging Face 下载模型权重;OpenRouter、Novita AI、Vercel AI Gateway 可 API 调用体验价格说明:上线初期平台提供免费调用(有速率限制),正式商业定价以平台官方为准Novita AI
核心优势
- MoE 稀疏混合专家架构,低激活参数高性能总参数量 79 亿,每一个 Token 推理仅激活 13 亿参数,大幅降低 GPU 显存与算力消耗;评测在 Artificial Analysis Intelligence Index 拿到 25 分,综合能力优于 Qwen3.5‑9B、Gemma‑4‑12B 等模型,接近 26B 级别模型水准36氪。
- 原生混合推理双模式自由切换支持
enable_thinking参数控制,一键切换快速响应 Instant 模式与深度思考 Thinking 模式。简单对话、摘要直接秒回;复杂推理、代码、多步骤任务开启思考模式做链式推理,同一个模型兼顾速度与深度能力36氪。 - 优秀本地 & 边缘部署能力消费级 Mac、普通 PC 即可本地跑通,支持完全离线运行,数据不出设备,非常看重隐私的私有化场景友好;多套量化版本,低配硬件也可落地developer....。
- 原生智能体与工具调用能力内置函数调用,支持工具调用、UI 自动化,适合搭建本地 Agent、知识库问答、自动化工作流,在轻量模型中 Agent 任务表现突出。
- 长上下文处理优化采用 KDA+MLA 按 3:1 交替堆叠的混合线性注意力架构,搭配 128 路由专家稀疏 MoE 网络,高效处理长文档、长代码库解析、大知识库检索任务。
主要能力
典型应用场景
本地离线 AI 助手:个人电脑本地大模型,保护文档隐私,处理办公文档、代码分析
轻量智能体开发:中小团队搭建私有化 Agent、RAG 知识库问答系统
边缘设备 AI 应用:端侧程序、本地客户端 AI 功能,不需要高算力服务器
代码辅助工具:轻量化本地代码助手,脚本生成、代码阅读
文档批量处理:长文本解析、合同、技术文档批量摘要问答
企业私有化部署:对数据安全敏感,不希望业务数据外传到公有云的业务场景
使用注意事项
虽综合评测优秀,属于轻量级模型,超复杂数学、超高难度工业代码任务效果不及旗舰大模型。
INT4 量化版本会损失少量精度,追求效果优先选择 FP8/BF16。
离线本地部署依旧需要一定显存,低配设备优先使用 INT4 权重。
API 免费体验存在限流,生产业务务必参考官方正式定价。
和同类轻量模型简要对比
表格
| 对比维度 | Ling‑3.0‑tiny | Qwen3.5‑9B | Gemma‑4‑12B |
|---|---|---|---|
| 架构 | MoE 混合专家,7.9B 总 / 1.3B 激活 | 稠密 9B | 稠密 12B |
| 推理开销 | 低,消费级 Mac 可流畅跑 | 中等 | 中等偏高 |
| 推理模式 | 原生双模式:快速 / 深度思考 | 单推理模式 | 单推理模式 |
| Agent 工具调用 | 原生优化 | 支持 | 支持 |
| 部署形态 | 开源权重 + API | 开源权重 + API | 开源权重 + API |
小结:Ling‑3.0‑tiny 最大亮点是MoE 混合推理 + 双思考模式 + 优秀 Agent 能力,极低激活参数适合本地私有化落地;如果你想要本地跑大模型、做轻量智能体,优先测试;重度超复杂任务建议选用更大参数旗舰底座。
长尾关键词:Ling‑3.0‑tiny 蚂蚁百灵 蚂蚁 Ling‑3.0‑tiny 模型 Ling‑3.0‑tiny 本地部署 Ling‑3.0‑tiny MoE 混合推理 Ling‑3.0‑tiny HuggingFace 下载 Ling‑3.0‑tiny 参数 轻量本地大模型 蚂蚁百灵大模型 InclusionAI Ling‑3.0‑tiny
