2026年8月10日,B站IndexSpeech团队正式开源IndexTTS-2.5——一款参数量仅8亿的零样本语音克隆TTS模型。它仅需约3秒参考音频即可克隆音色,支持中、英、日、西、阿5种语言及跨语种迁移,推理速度达前代2.28倍,并提供了4条情感控制路径。在CV3-Eval评测中,这款0.8B小模型凭借GRPO强化学习训练,反超参数量10倍于它的Moss-TTS 1.5(8B),延续了IndexSpeech团队“小而准”的技术路线,GitHub仓库已收获22.7k stars。
核心架构:三段式流水线与强化学习优化
IndexTTS-2.5采用T2S(文本转语义)→ S2M(语义转梅尔)→ 声码器的三段式架构,在性能与质量之间取得平衡:
T2S阶段:将文本映射至50Hz语义表征,再压缩至25Hz,序列长度减半,推理速度翻倍。
S2M阶段:采用Zipformer结构,官方盲测中56%的听感偏好超过U-DiT的40%。
声码器阶段:将梅尔谱还原为音频波形。
训练层面引入GRPO(组相对策略优化)强化学习,以可听度奖励直接优化最终听感,而非仅优化中间损失。这是其以小胜大的关键。
零样本克隆与多语种能力
约3秒参考音频即可完成音色克隆,且支持跨语种迁移——用一段中文参考音频直接生成日语、英语、西班牙语或阿拉伯语语音,音色保持一致。这对多语种内容本地化是刚需功能。发音控制层面,中文支持拼音标注、英文支持CM音标、日文支持假名控制,遇到多音字、专有名词或外语名时可手动指定读音。
四条情感控制路径
情感表达提供四种方式,按精度递进:
参考音频:直接用带情感的音频样本传递情绪。
八维情感向量:精确量化情绪强度。
文本推断:由文本自动推断情感(如问句自动带疑问语气)。
情感描述文本:用自然语言描述(如“激动地说”)。
配合0.5×至2.0×的语速调节,一个模型覆盖了配音表达的大部分需求。
CV3-Eval实测:小模型碾压大模型
以下数据来自官方技术报告的CV3-Eval评测(WER越低越好,SIM越高越好):
| 模型 | 参数量 | WER(词错误率) | SIM(音色相似度) |
|---|---|---|---|
| IndexTTS-2.5-RL | 0.8B | 6.00 | 73.63 |
| IndexTTS-2.5 | 0.8B | 6.75 | 73.18 |
| VoxCPM2 | 2B | 7.22 | 72.02 |
| Moss-TTS 1.5 | 8B | 9.40 | 68.56 |
强化学习版IndexTTS-2.5-RL在两项指标上全面领先。对比参数量10倍于它的Moss-TTS 1.5,词错误率低3.4个百分点,音色相似度高5个点。推理速度同样出色:RTF(实时率)为0.2065@RTX 4090,即生成1秒语音仅需约0.2秒计算,是前代的2.28倍。
与主流开源TTS横向对比
| 维度 | IndexTTS-2.5 | CosyVoice 3 | Moss-TTS 1.5 |
|---|---|---|---|
| 开发方 | B站 | 阿里通义 | MiniMax系 |
| 参数量 | 0.8B | 1.5B | 8B |
| WER | 6.00(RL版) | 约6-7区间 | 9.40 |
| SIM | 73.63 | 约72区间 | 68.56 |
| 推理速度 | RTF 0.2065@4090 | 中等 | 较慢 |
| 语种 | 中英日西阿5种 | 多语种 | 中英为主 |
| 许可证 | Bilibili Model License | Apache系 | 各自社区许可 |
当前开源TTS赛道三强并立:CosyVoice生态成熟、工具链完整;IndexTTS-2.5胜在单位参数效率、强化学习带来的自然度和B站社区活跃度(22.7k stars);dots.tts则在中文Seed-TTS-Eval上分数更高。用户可按语种需求和部署条件灵活选择。
应用场景与目标用户
有声书与长文本配音:RTF 0.2的高推理速度适合批量生成长音频,语速和情感可控保证听感稳定。
多语种内容本地化:一个中文音色直接产出英、日、西、阿四语语音,省去每语种重新录音的成本。
视频配音与角色音色:零样本克隆结合多情感路径,适合需要多角色、多情绪的短视频和动画配音。
语音应用开发:开源权重+WebUI(默认7860端口)+可商用许可(需遵守Bilibili Model License),便于集成到自有产品。
在更广泛的AI生产力工具生态中,IndexTTS-2.5是AI工具导航中语音合成类的优质开源选项。它不同于AI写作工具(文本内容生成)、AI PPT(演示文稿制作)、AI表格工具(数据处理与可视化)或AI简历生成(求职文档撰写)等办公场景AI,而是专注音频内容的智能生产。在AI办公软件推荐的完整工具链中,IndexTTS-2.5可作为音频处理组件,与文档、表格、演示工具形成互补,共同完善企业级内容生产工作流。
适合人群:需要高质量多语种TTS的内容创作者、有本地部署需求的语音开发者、希望控制成本的有声书团队。合规提醒:克隆他人声音需获得授权,声音权益受法律保护,商用前务必确权,并通读Bilibili Model License条款确认使用范围。
如何使用IndexTTS-2.5
在线体验:官方及社区提供的WebUI演示可直接试听,上传3秒参考音频即可克隆。
本地部署:克隆GitHub仓库,安装依赖后启动WebUI(默认7860端口),RTX 4090上bf16推理RTF约0.2,消费级显卡亦可运行。
API式调用:仓库提供推理脚本,支持指定参考音频、情感向量、语速和拼音/音标标注,便于接入批量生产管线。
模型获取:权重托管于Hugging Face和魔搭ModelScope,国内用户推荐ModelScope加速下载。
开源许可与已知局限
IndexTTS-2.5采用Bilibili Model License,允许商用但有附加条件(如署名要求等),与Apache 2.0这类宽松许可不同,使用前应通读协议原文,确认自身场景符合条款。
局限方面:5语种之外的语言暂不支持;0.8B体量在极端复杂情感表达上与更大模型仍有差距;参考音频质量直接影响克隆效果,噪音素材需预处理;八维情感向量调参有一定学习成本,新手建议从文本推断路径入手。
常见问题
本地硬件要求:0.8B模型门槛不高,RTX 4090上RTF约0.2,主流消费级显卡均可运行,权重从ModelScope下载速度更优。
商用授权:允许商用,但须遵守Bilibili Model License附加条件,部署前务必阅读官方最新协议原文。
是否免费:开源免费,本地部署无费用,在线体验及社区演示同样免费。
支持语种:中、英、日、西、阿5种,支持跨语种迁移——中文参考音色可直接生成其他语种语音。
与CosyVoice、dots.tts选型:中文极致自然度看dots.tts;生态成熟度看CosyVoice;追求单位参数效率、推理速度和社区活跃度选IndexTTS-2.5,建议用自有素材实测对比。
