Breeze-TTS-2开源了:能克隆、能捏声,权重却不能商用

开源的是推理代码和权重,不是一张商用许可证

BreezeBlue 放出 Breeze-TTS-2 的模型权重和 PyTorch 推理代码。公司由前 MiniMax 技术合伙人杨斌创立,做实时语音交互。中英都能读,宣传里把语音克隆、按描述捏声、指挥情绪语速、以及括号里的笑声叹气都写进同一套模型。仓库许可证要先读完:推理代码走 Apache 2.0,权重、衍生模型和自托管输出只允许研究与非商用。

参数大约 3B,官方推理需要一块能跑 CUDA 的英伟达卡。常规路径大约占用 8GB 显存,加速路径更高。托管 API 另算,公开标价大约每百万字符 34 美元。把 GitHub 克隆下来,不等于可以把生成的声音拿去接客服或卖有声书。

Breeze-TTS-2开源了:能克隆、能捏声,权重却不能商用

四项能力,对应四种输入

克隆声音要同时给清晰录音和一字不差的文稿,模型按音色和口气续读新文本。设计声音不需要样本,直接写「声音温暖、语气平静的年轻女生」这类句子,生成一条新声线。指挥情绪和语速是在已有声音上加指令:慢一点、严肃一点、再热情一些;中文稿就用中文写指令。语气事件写在正文里:英文用括号,如 (laugh)、(sigh)、(clears throat);中文用方括号,如 [笑]、[叹气]、[清嗓子]。

公司还公开过语音设计、语音指挥和延迟评测集。Artificial Analysis 的 Provider Voices 赛道上,开源权重组里它一度排到前列,大约 1215 Elo,高于 Fish Audio S2 Pro 一带。总榜仍有闭源系统压在前面。官方还写过预热后的首包音频延迟,那是实验室卡上的快路径,笔记本上的数字会差一截。

你想做的事 需要准备什么 别踩的线
克隆一条声线 干净录音加对齐文稿 未授权去仿真人、公众人物
从零捏声 一段角色描述 描述越空,声线越飘
改情绪和语速 同一条声音加指令 指令语言最好和正文一致
加笑声叹气 按中英格式写进稿子 事件堆太多会像音效轨
上线收费产品 走官方 API 或另签商用授权 自托管输出默认不能商用

实时交互和内容生产不是同一条部署

模型冲着语音助手、边说边出声去的,WebSocket 可以跨轮次保持连接。做视频配音、有声书,更在乎稳定和授权,不一定要上最低延迟那条快路径。社区已有 ComfyUI 节点,方便把克隆、设计和指挥接进现有出图出视频工作流,许可证并不因此变松。

开源降低的是把玩和复现的门槛。声线好不好听,听一段就知道;能不能拿去赚钱,看的是权重协议和录音权利。先确认样本来自本人同意,再决定是本地研究,还是付托管接口的钱。