dots3-note preview 深度解读:小红书开源的280B MoE全模态Agent模型

流云 2026-08-19 1168 0条评论
摘要:    2026年8月14日,小红书dots.studio正式开源dots3-note preview——一款总参数280B的MoE(混合专家)全模态大模型预览版...

   2026年8月14日,小红书dots.studio正式开源dots3-note preview——一款总参数280B的MoE(混合专家)全模态大模型预览版。它每次推理仅激活16B参数,却拥有512K超长上下文窗口,原生支持文本、视觉、语音三模态,在Terminal-Bench 2.1终端任务基准上取得75.1分,超越此前美国开放权重模型的最高分4.9分。更值得关注的是,它在开源当天即完成华为昇腾Atlas 800A3/900A3的Day 0适配,成为“国产模型+国产算力”组合的标杆案例。

MoE架构:280B的容量,16B的成本

MoE的核心经济账在于每次推理仅激活16B参数。280B总参数提供了旗舰级的知识容量,而每个token只路由到少量专家,推理显存和计算量接近16B密集模型——知识面接近旗舰,部署成本接近中型模型。对于希望在自有算力上运行Agent任务的企业团队,这一特性具有直接的落地价值。

512K上下文与全模态能力

512K token约合百万汉字级别,可一次性处理整部长篇小说或中大型代码库。长上下文对Agent场景尤为关键——任务执行中工具返回、日志、中间结果持续累积,窗口不足会导致“失忆”。模态层面,文本、视觉、语音原生打通,同一会话内可完成看图、读文档、听语音指令等跨模态交互。

TEMPO强化学习与Terminal-Bench成绩

Terminal-Bench 2.1(考察真实命令行环境中的任务完成能力)75.1分,较此前美国开放权重模型最高分高出4.9分。这一成绩源于TEMPO训练方法——针对长时程Agent任务做强化学习,优化的是“多步骤任务最终完成率”而非单轮问答准确率,这正是Agent落地最核心的指标。

昇腾Day 0适配

开源当天即完成华为昇腾Atlas 800A3/900A3适配:vLLM-Ascend推理框架、MTP投机解码加速、FUSED_MC2算子融合全部就绪。在英伟达供应受限的背景下,“国产模型+国产算力”的完整技术栈对政企、金融、能源等信创场景具有特殊意义,也是dots3-note区别于其他开源MoE的鲜明标签。

与同代开源模型对比

维度dots3-note previewMuse GlimmerQwen3.8-27B
开发方小红书dots.studioMeta阿里通义
架构MoE 280B(激活16B)Dense 30BDense 27B
上下文窗口512K131K262K
支持模态文本+视觉+语音文本+视觉原生多模态
Agent专项成绩Terminal-Bench 2.1 75.151.7未公布同级数据
国产算力适配昇腾Day 0部分支持
许可证预览版条款见官方仓库Apache 2.0Apache 2.0

三者定位清晰:Muse Glimmer是消费级单卡本地Agent模型;Qwen3.8-27B是均衡的中型主力;dots3-note preview则以512K上下文、全模态和昇腾适配瞄准企业级Agent部署。

应用场景与目标用户

  • 企业Agent平台:长时程任务执行(Terminal-Bench 75.1)配合512K上下文,适合代码助手、运维自动化、流程托管等场景。

  • 信创与国产算力部署:昇腾Day 0适配,政企、金融、能源等国产化要求场景可直接落地。

  • 超长文档与代码库理解:整库代码审查、长报告分析、多文档交叉引用,一次读取无需分段。

  • 多模态研究与应用:文视音三模态统一建模,适合跨模态检索、音视频理解等研究原型。

在AI生产力工具的大版图中,dots3-note preview区别于AI写作工具(文本创作)、AI PPT(演示生成)、AI表格工具(数据处理)和AI简历生成(求职文档)等轻量办公应用——它定位更偏向企业级Agent基础设施,可作为AI办公软件推荐中面向技术团队的智能运维和自动化组件。在AI工具导航的分类体系里,它属于“大模型底座”而非“终端应用”,适合有自研能力的技术团队作为底层能力接入。

适合人群:有自有算力(尤其昇腾)的企业技术团队、Agent应用开发者、大模型研究者。非急用场景可等待正式版发布;280B MoE权重对下载和存储压力较大,单机用户需谨慎评估。

如何使用dots3-note preview

  • 权重下载:Hugging Face搜索dots-studio/dots3-note-prev,或从国内镜像拉取。

  • API试用:已上架OpenRouter,无需本地部署即可调用体验。

  • 昇腾部署:Atlas 800A3/900A3环境使用vLLM-Ascend加载,开启MTP投机解码与FUSED_MC2获得完整性能。

  • 英伟达部署:参考仓库vLLM部署指引,注意280B MoE的多卡显存需求。

开源状态与已知局限

预览版的定位需要清醒认知:能力强但版本迭代快速。正式版发布后预览权重可能不再维护,生产接入建议锚定正式版;商用条款以官方仓库最新说明为准,预览版许可可能与正式版存在差异。

局限方面:preview阶段文档和社区资料有限,问题解决主要依赖官方issue;多语种、对话、创作等通用能力官方尚未给出完整评测,主打场景为Agent和长上下文;512K满血推理对显存要求高,实际部署建议按需截断上下文;语音模态的细节能力(克隆、情感)官方材料着墨不多,相关需求建议实测验证。

常见问题

  • 硬件要求:280B MoE需多卡环境(英伟达多卡A100/H100;昇腾Atlas 800A3/900A3已适配),不想部署可直接用OpenRouter API。

  • 商用授权:研究和技术评估可用,商用以官方仓库最新许可为准,预览版条款可能与正式版不同,生产接入建议等正式版并通读协议。

  • 是否免费:权重在Hugging Face免费开放,API通过OpenRouter按量计费,本地部署免费但算力成本自担。

  • 与Qwen、GLM对比:dots3-note主打Agent长时程任务、512K上下文和昇腾适配;Qwen、GLM在通用对话和中文创作生态上更成熟,按场景选型。

  • 512K上下文用途:约百万汉字级别,整本书、中大型代码库、数百页报告一次读入,Agent场景下工具调用和日志持续累积也不“失忆”,实际使用建议按需控制长度以节省显存。

文章版权及转载声明:

作者:流云本文地址:https://www.sanwenge.com/post/1354.html发布于 2026-08-19
文章转载或复制请以超链接形式并注明出处三文阁