2026年,小红书dots团队携手上海交通大学X-LANCE实验室正式开源dots.tts——一款参数量达20亿的全连续自回归TTS模型。它摒弃了主流方案中“离散token”的量化路径,直接在连续潜空间中生成音频,以48kHz高采样率输出,首包延迟仅54.4毫秒,并在Seed-TTS-Eval基准上取得中文CER 0.94%、音色相似度81.0的SOTA成绩。该模型采用Apache 2.0许可证,全套6个检查点开放,适用于有声书、配音、播客及实时语音交互等中文语音生产场景。
核心技术:全连续自回归路线
当前多数TTS系统先将音频量化为离散token再预测,量化过程不可避免地损失信息。dots.tts反其道而行——通过AudioVAE(编码器为HoliTok)将音频映射至连续潜空间,以Qwen2.5语言模型为骨干,采用BPE方式读取连续表征,并由流匹配(Flow Matching)解码头直接输出波形。整条管线无离散化瓶颈,这是其在自然度和相似度上刷新开源纪录的架构根源。
性能成绩单:中文开源最强
根据官方技术报告(Seed-TTS-Eval评测),dots.tts的核心数据如下:
| 评测维度 | 成绩 | 说明 |
|---|---|---|
| 中文CER(字错误率) | 0.94% | 每万字错误不足百字 |
| 中文SIM(音色相似度) | 81.0 | 克隆音色与原声高度接近 |
| 平均WER(词错误率) | 2.95% | 多语种综合水平 |
| 平均SIM | 79.2 | 多语种音色保持 |
横向对比:MiniMax闭源模型在24语种中19个第一,但dots.tts在中文单项上领先;开源阵营内,相比CosyVoice 3公开数据(WER约3.06%、SIM约75.3),dots.tts全面占优。
为实时场景优化的工程性能
首包延迟:1T1A双流架构(内容流+声学流)实现54.4毫秒首包,达对话级响应。
高并发:SGLang优化后,单张H100可支持16路并发,每秒4.76个请求。
加速档位:提供MeanFlow(4步)、sCM(2步)、DMD(1步)三档加速,按需取舍速度与质量。
语音编辑:配套dots.tts.edit支持替换、插入、删除、情感修改四类局部编辑,无需整段重录。
与CosyVoice 3对比
| 维度 | dots.tts | CosyVoice 3 |
|---|---|---|
| 开发方 | 小红书+上交X-LANCE | 阿里通义 |
| 参数量 | 2B | 1.5B |
| 技术路线 | 全连续自回归 | 离散token+流匹配 |
| 平均WER | 2.95% | 约3.06% |
| 平均SIM | 79.2 | 约75.3 |
| 首包延迟 | 54.4ms(双流) | 未公布同级数据 |
| 输出采样率 | 48kHz | 24kHz |
| 开源程度 | 全套6个检查点 | 部分开源 |
| 许可证 | Apache 2.0 | Apache系 |
两者同为中文开源TTS第一梯队,CosyVoice生态成熟,dots.tts则以指标领先、高采样率和Apache 2.0全套开源见长。同期还有B站IndexTTS-2.5(0.8B高效率路线),可按部署条件灵活选择。
应用场景与适用人群
有声书与长音频生产:0.94%的字错误率使万字文本几乎无需校对,批量生产效率突出。
实时语音交互:54.4ms首包配合高并发,适用于数字人、语音助手等场景。
配音与播客后期:dots.tts.edit局部修改功能,改词或换情感无需整段重录。
二次开发与商用:Apache 2.0全套开源,商用改造零阻碍。
在更广泛的AI工具生态中,dots.tts可视为AI工具导航中语音合成类的优质开源选项。与常见的AI写作工具(文本生成)、AI PPT(演示制作)、AI表格工具(数据处理)、AI简历生成(求职文档)等办公类AI不同,dots.tts专注于音频内容的智能生产,但同样可作为AI办公软件推荐中的音频处理组件,与文档、表格、演示工具形成互补,完善企业内容工作流。
适合人群:以中文为主的内容生产团队、对延迟敏感的实时语音应用开发者、需要深度定制的语音产品团队。合规提醒:零样本克隆他人声音须获本人授权,商用前务必确权。
如何使用dots.tts
获取权重:Hugging Face或魔搭ModelScope搜索dots团队仓库,全套6个检查点免费下载。
推理部署:使用官方推理脚本及SGLang优化;加速档位按需选择。
实时启用:开启1T1A双流模式获得54.4ms首包,配合SGLang实现高并发。
语音编辑:调用dots.tts.edit接口,指定编辑类型与目标片段即可局部重生成。
开源许可与已知局限
Apache 2.0是该项目最实在的诚意——全套6个检查点均在此许可下开放,商用、修改、分发无附加条件,比社区许可(限制营收或地域)干净得多。
局限方面:强项集中在中文,多语种平均分被MiniMax闭源模型压过;2B参数对显存有要求,极端低端设备可考虑IndexTTS-2.5的0.8B方案;1步加速(DMD)模式可能存在质量损失,需自行评估;作为学术合作项目,工程文档和社区响应节奏与商业产品不同,深度集成需做好自查准备。
常见问题
本地部署配置:2B模型,主流消费级显卡可运行批量生成,实时性能建议A100/H100配合SGLang。
商用授权:Apache 2.0,免费商用,但克隆他人声音需授权。
费用:完全免费开源,无API强制收费。
与CosyVoice 3选型:中文质量优先选dots.tts,生态成熟度优先选CosyVoice。
语音编辑支持:支持替换、插入、删除、情感修改四类编辑。
