2026 年 8 月,开源语音合成(TTS)赛道像被按下了加速键:三家背景迥异的团队,几乎在同一周拿出了让人眼前一亮的模型。对普通创作者来说,这些论文和榜单上的名字或许陌生,但它们背后的能力——更快、更自然、更会「跨语种」——正在以极快速度下沉到像逗哥配音这样的日常工具里。本文把这三款模型拆开看,并聊聊它们对你意味着什么。
Cartesia Sonic-3.6:把「首字延迟」打到 90 毫秒内
Cartesia 在 8 月发布的 Sonic-3.6,同时登顶 Artificial Analysis 的两大 TTS 榜单,首字音频延迟低于 90 毫秒,每秒可生成 136 个字符(对比 ElevenLabs 的 46.7),而价格只有后者的一半,覆盖 44 种语言。它延续了状态空间模型(SSM)路线,在速度和成本上给了闭源巨头实实在在的压力。
对逗哥配音用户而言,「低延迟 + 低成本 + 多语种」正是短视频批量出片最需要的组合:同样一条脚本,生成英、日、西多个语言版本,成本可控、等待极短。
Audio8 TTS Preview 0.1B:170M 参数的开源多语种模型
Audio8 在 8 月 20 日放出 TTS Preview 0.1B,仅 1.7 亿参数,却支持多语种与零样本(zero-shot)声音克隆——也就是不给参考文本、只给一小段音频就能复刻音色。小参数意味着它能在消费级显卡甚至端侧跑起来,进一步降低部署门槛。
有道子曰 4.0(Confucius4-TTS):14 语种跨语种无口音
国产方面,网易有道在 6 月开源的「子曰 4.0」TTS 引擎 Confucius4-TTS,是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可克隆的开源模型。3 秒音频复刻音色、相似度超 85%,并已全量开源、商用无限制。它让「用中文声音流利说日语」从 demo 变成可落地的功能。
这些突破如何落到逗哥配音
开源模型的集体进化,给逗哥配音这样的产品带来两重利好。其一,跨语种无口音让出海短剧、跨境电商的「一份原声、多语分发」成为现实,逗哥配音可借此把多语种旁白做得更地道;其二,零样本克隆 + 小参数让声音克隆更安全、更可控,逗哥配音能在合规前提下,为用户提供稳定的品牌声音资产。
当然,技术越强,越要守住合规底线:开源不等于无约束,商业使用仍需确保素材授权与 AI 生成标注。
写在最后
开源与闭源的竞速,最终受益的是创作者。当顶尖语音能力以更低成本、更快速度可用,像逗哥配音这样的工具,就是把这些能力翻译成「上传文案、一键出音」日常生产力的桥梁。
常见问题(FAQ)
Q:逗哥配音用的是开源语音模型吗? A:逗哥配音持续跟踪并吸收包括开源 TTS 在内的前沿语音技术,目标是为用户提供稳定、自然、可批量出片的配音能力;具体引擎组合属于产品实现细节。
Q:逗哥配音支持跨语种声音克隆吗? A:逗哥配音支持多语种配音与声音克隆相关能力,可在合规前提下帮助用户生成跨语种、音色一致的声音,适合出海内容保持品牌声音统一。
Q:零样本克隆是什么?对普通用户有用吗? A:零样本克隆指只需一小段音频即可复刻音色、无需长篇训练。对用户而言,这意味着更快得到专属声音,省去复杂训练流程。
Q:开源语音模型免费,为什么还要用逗哥配音? A:开源模型需要部署、调参与工程化,普通创作者难以直接使用;逗哥配音把这些能力封装成网页端一键操作,并提供合规商用音色与稳定服务。
Q:逗哥配音的声音克隆合规吗? A:逗哥配音仅提供合规商用音色与在用户授权素材上的克隆能力,并倡导对 AI 生成内容进行标注,规避声纹侵权风险。




