2026年8月14日,小红书dots.studio正式开源dots3-note preview——一款总参数280B的MoE(混合专家)全模态大模型预览版。它每次推理仅激活16B参数,却拥有512K超长上下文窗口,原生支持文本、视觉、语音三模态,在Terminal-Bench 2.1终端任务基准上取得75.1分,超越此前美国开放权重模型的最高分4.9分。更值得关注的是,它在开源当天即完成华为昇腾Atlas 800A3/900A3的Day 0适配,成为“国产模型+国产算力”组合的标杆案例。
MoE架构:280B的容量,16B的成本
MoE的核心经济账在于每次推理仅激活16B参数。280B总参数提供了旗舰级的知识容量,而每个token只路由到少量专家,推理显存和计算量接近16B密集模型——知识面接近旗舰,部署成本接近中型模型。对于希望在自有算力上运行Agent任务的企业团队,这一特性具有直接的落地价值。
512K上下文与全模态能力
512K token约合百万汉字级别,可一次性处理整部长篇小说或中大型代码库。长上下文对Agent场景尤为关键——任务执行中工具返回、日志、中间结果持续累积,窗口不足会导致“失忆”。模态层面,文本、视觉、语音原生打通,同一会话内可完成看图、读文档、听语音指令等跨模态交互。
TEMPO强化学习与Terminal-Bench成绩
Terminal-Bench 2.1(考察真实命令行环境中的任务完成能力)75.1分,较此前美国开放权重模型最高分高出4.9分。这一成绩源于TEMPO训练方法——针对长时程Agent任务做强化学习,优化的是“多步骤任务最终完成率”而非单轮问答准确率,这正是Agent落地最核心的指标。
昇腾Day 0适配
开源当天即完成华为昇腾Atlas 800A3/900A3适配:vLLM-Ascend推理框架、MTP投机解码加速、FUSED_MC2算子融合全部就绪。在英伟达供应受限的背景下,“国产模型+国产算力”的完整技术栈对政企、金融、能源等信创场景具有特殊意义,也是dots3-note区别于其他开源MoE的鲜明标签。
与同代开源模型对比
| 维度 | dots3-note preview | Muse Glimmer | Qwen3.8-27B |
|---|---|---|---|
| 开发方 | 小红书dots.studio | Meta | 阿里通义 |
| 架构 | MoE 280B(激活16B) | Dense 30B | Dense 27B |
| 上下文窗口 | 512K | 131K | 262K |
| 支持模态 | 文本+视觉+语音 | 文本+视觉 | 原生多模态 |
| Agent专项成绩 | Terminal-Bench 2.1 75.1 | 51.7 | 未公布同级数据 |
| 国产算力适配 | 昇腾Day 0 | 无 | 部分支持 |
| 许可证 | 预览版条款见官方仓库 | Apache 2.0 | Apache 2.0 |
三者定位清晰:Muse Glimmer是消费级单卡本地Agent模型;Qwen3.8-27B是均衡的中型主力;dots3-note preview则以512K上下文、全模态和昇腾适配瞄准企业级Agent部署。
应用场景与目标用户
企业Agent平台:长时程任务执行(Terminal-Bench 75.1)配合512K上下文,适合代码助手、运维自动化、流程托管等场景。
信创与国产算力部署:昇腾Day 0适配,政企、金融、能源等国产化要求场景可直接落地。
超长文档与代码库理解:整库代码审查、长报告分析、多文档交叉引用,一次读取无需分段。
多模态研究与应用:文视音三模态统一建模,适合跨模态检索、音视频理解等研究原型。
在AI生产力工具的大版图中,dots3-note preview区别于AI写作工具(文本创作)、AI PPT(演示生成)、AI表格工具(数据处理)和AI简历生成(求职文档)等轻量办公应用——它定位更偏向企业级Agent基础设施,可作为AI办公软件推荐中面向技术团队的智能运维和自动化组件。在AI工具导航的分类体系里,它属于“大模型底座”而非“终端应用”,适合有自研能力的技术团队作为底层能力接入。
适合人群:有自有算力(尤其昇腾)的企业技术团队、Agent应用开发者、大模型研究者。非急用场景可等待正式版发布;280B MoE权重对下载和存储压力较大,单机用户需谨慎评估。
如何使用dots3-note preview
权重下载:Hugging Face搜索
dots-studio/dots3-note-prev,或从国内镜像拉取。API试用:已上架OpenRouter,无需本地部署即可调用体验。
昇腾部署:Atlas 800A3/900A3环境使用vLLM-Ascend加载,开启MTP投机解码与FUSED_MC2获得完整性能。
英伟达部署:参考仓库vLLM部署指引,注意280B MoE的多卡显存需求。
开源状态与已知局限
预览版的定位需要清醒认知:能力强但版本迭代快速。正式版发布后预览权重可能不再维护,生产接入建议锚定正式版;商用条款以官方仓库最新说明为准,预览版许可可能与正式版存在差异。
局限方面:preview阶段文档和社区资料有限,问题解决主要依赖官方issue;多语种、对话、创作等通用能力官方尚未给出完整评测,主打场景为Agent和长上下文;512K满血推理对显存要求高,实际部署建议按需截断上下文;语音模态的细节能力(克隆、情感)官方材料着墨不多,相关需求建议实测验证。
常见问题
硬件要求:280B MoE需多卡环境(英伟达多卡A100/H100;昇腾Atlas 800A3/900A3已适配),不想部署可直接用OpenRouter API。
商用授权:研究和技术评估可用,商用以官方仓库最新许可为准,预览版条款可能与正式版不同,生产接入建议等正式版并通读协议。
是否免费:权重在Hugging Face免费开放,API通过OpenRouter按量计费,本地部署免费但算力成本自担。
与Qwen、GLM对比:dots3-note主打Agent长时程任务、512K上下文和昇腾适配;Qwen、GLM在通用对话和中文创作生态上更成熟,按场景选型。
512K上下文用途:约百万汉字级别,整本书、中大型代码库、数百页报告一次读入,Agent场景下工具调用和日志持续累积也不“失忆”,实际使用建议按需控制长度以节省显存。
