Breeze-TTS-2开源了:能克隆、能捏声,权重却不能商用
BreezeBlue 开源 Breeze-TTS-2,覆盖中英语音克隆、按描述捏声、情绪语速指挥和稿内笑声叹气。推理代码是 Apache 2.0,权重与自托管输出仅限研究非商用。本地大约 3B 参数、需要英伟达显卡;要上线产品需走官方 API 或另签授权。
专注分享 AI 工具、效率软件、开源项目、自动化工作流,数字游民、宝藏资源和实用技术指南
分享 AI音频、语音、配音、音乐生成和声音处理工具与应用案例。
BreezeBlue 开源 Breeze-TTS-2,覆盖中英语音克隆、按描述捏声、情绪语速指挥和稿内笑声叹气。推理代码是 Apache 2.0,权重与自托管输出仅限研究非商用。本地大约 3B 参数、需要英伟达显卡;要上线产品需走官方 API 或另签授权。
Whisper 突然降低免费使用门槛,背后并不只是一次简单的价格调整。本文从本地 Whisper、Google 云端语音识别和 Superwhisper 的产品策略出发,分析免费模型、订阅服务与 AI 语音入口之间的新竞争关系,并讨论普通用户究竟该选择本地方案还是付费云端工具。
语音克隆工具Voicebox免费开源,支持Windows和macOS本地运行。几秒钟音频即可克隆任何声音,无需Python与云端,录音棚级多声道编辑。
VoiceCraft是一个AI驱动的免费语音处理平台,提供高质量文字转语音(TTS)和语音转文字(STT)功能,支持多语言、多音色自然发音,无需注册即可使用。
FireRedTTS2是由FireRed Team开发的开源长对话流式语音合成系统,专为多说话人场景设计,能生成自然流畅的连续对话,支持中文、英文、日文、韩文、法文、德文、俄文等多种语言。
Readify 是一款强大的文本转语音软件,支持 iOS、Android 和 Chrome 平台,能够将网页内容和多种文档格式(EPUB、PDF、DOCX)转换为音频。支持超过 30 种语言的自然语音合成,提供实时 TTS 功能
Fish Audio 是一款开源免费的 AI 工具,专注于高质量文本转语音和语音克隆,采用 VQ-GAN、Llama 和 VITS 等前沿技术,生成逼真的语音,适合内容创作、教育和虚拟助手等场景。
VideoLingo 是一款开源工具,支持从视频下载、音频转录、翻译到字幕生成和个性化配音的全流程操作,生成高质量字幕,支持本地部署,适合内容创作者和语言学习者使用。
EVI采用了一种被称为情感大语言模型(eLLM)的多模态生成AI技术。这种技术结合了大型语言模型(LLMs)的语言理解能力和表情测量技术的情感感知能力。使EVI能像真人一样聊天,还能感知你说话时的细微情绪,并作出相应的反应。
一款免费文字转语音工具/文本转语音工具,提供语音合成服务,支持多种语言,包括英语、法语、德语、西班牙语、阿拉伯语、中文、日语、韩语等,以及多种语音风格,目前覆盖160+种声音选择
现已支持 B 站、油管、小红书、抖音、快手、推特、小宇宙、苹果播客、谷歌播客、阿里云盘、百度网盘、本地视频、本地音频、微信公众号或文章等任意网页链接。
aimoneyhunter-AI副业赚钱资讯合集,是一个网友整理的GitHub仓库,关于ai副业赚钱资讯信息的大合集,将在全网搜索并整理ai副业赚钱的相关方法、技术、工具、以及一些可以赚钱的平台和渠道。 期望能在AI时代,打破信息茧房,让大家都能在这个时代利用AI智能化做副业,赚取工作之余的额外收益。
一个开源的AI语音克隆工具,可以通过一段参考说话人的音频,复制他们的声音并生成多种语言的语音。精准地克隆参考音色,并生成多种语言和口音的语音。可以控制声音的风格,如情感、口音、节奏、停顿和语调。
整理这个项目的初衷是方便同学们快速开启人工智能自学计划,在学习过程中少走弯路用最快的效率入门Ai并开始实战项目, 提供了近200个Ai实战案例和项目,这些并不是网上搜集来的,而是我这五年线上线下教学所开发和积累的案例。
AI 生成功能:借助由 Adobe Firefly 提供支持的 AI 生成功能,仅提供文字描述便可立即生成出色的文字效果和图片。支持 100 多种语言的文本提示。
Rask AI 是一种一站式本地化工具,创作者只需点击几下即可将他们的视频翻译成 60 多种语言。利用“文字转语音”和“语音克隆”技术,无需聘请配音演员即可添加专业的旁白。
它提供了全球功能、内嵌功能和菜单栏快速访问,以及网页或本地应用的选择。您可以轻松复制整个对话,还可以使用对话模式通过语音与 ChatGPT 进行交流。同时,MacGPT 还可在 iPhone 上使用,名为 GeePeeTee。