yovoice 推荐,模型全在本地跑的开源配音工具

给视频配音,云端 TTS 按字符收费,音色还未必可克隆,本地跑模型又嫌部署麻烦。九月下旬小众软件发现频道第一名的 yovoice 冲着这个痛点来,开源、本地推理、支持音色复刻,这三件事凑齐的免费工具不多。我把它的仓库、发布记录和论坛反馈都过了一遍,这个月的迭代速度值得单独一说,先给结论,方向对、完成度中上、更新勤。细节往下看。

主要功能

它是一个图形界面应用,macOS 与 Windows 双平台,推理引擎基于 GGML 生态的纯 C++ 音频引擎,那套引擎本身也有三千多星,模型走 GGUF 格式,应用内直接下载或本地导入。支持的模型一串,IndexTTS 2.0 与 2.5、VoxCPM2、OmniVoice,还有阿里开源的 Qwen3-TTS 家族,模型本身是 Apache 协议放出来的,零点六 B 与一点七 B 版做音色克隆,内置九种音色的定制版,另有一个用文字描述直接生成音色的设计版,末尾再挂个轻量级的 Kokoro,含一个中文特调版,全家桶开箱即用,不用自己找模型文件。加速方面苹果芯片走 Metal,Windows 支持 NVIDIA 显卡与实验性的 Vulkan,都能回退 CPU,量化档位从四档到八档都有,显存紧张就压低档位。

功能围绕配音工作流。参考音频导入或现场录制做音色复刻,情绪调节依赖模型的属性参数与参考音频实现,注意各家模型支持程度不一,官网没有夸口成任意模型可调。声音设计是特色,用一句话描述想要的声音直接生成音色,比如输入温和的中年女声、语速偏慢,它就照描述捏一个。作品与音色库管理、命令行工具、给代理用的技能包都在,技能包意味着可以让 AI 帮你写配音脚本再一键生成,工作流能串起来。界面是中文的,社区贡献的英文翻译已经合并,Linux 用户也有独立的命令行包可用。

解决了什么需求

做视频搬运、有声书、播客片头的人对这类工具的期待很具体,能克隆、能调情绪、不按字符交钱。小众软件论坛里用户 kat 的留言算标准用户画像,正愁 IndexTTS 2.5 跑得慢,作者就推了新模型支持;用户 ppmsn2005 求字幕文件直接转配音,作者回复下个版本加。GitHub 上的响应同样快,有用户建议支持 Qwen3-TTS 与多角色配音,两周内落在版本里,响应速度是这类工具最稀缺的品质;一位 Mac 用户连报七个问题,从录制崩溃到克隆失败,绝大部分已修复关闭,还剩两个界面小毛病挂着。英文社区目前没什么讨论,反馈集中在国内论坛与 issue 区,如实交待,论坛里作者的回复跟进得也勤。

版本与作者

仓库九月中创建,一个月内从 v0.1.2 走到 v0.1.4,从九月十九日的第二版到二十六日的第四版,三个版本分别把新模型、代理设置与角色库补了进来,节奏摆在这。最新版加了角色库与 Kokoro 模型,安装包从三十二兆的 Mac 镜像到七十五兆的 Windows 安装器都带校验文件,官方发布页是唯一下载口,没有商店上架。数据存在用户目录的独立文件夹里,Windows 端依赖系统自带的 WebView2 组件。作者 leemysw 在广州,论坛与 GitHub 同名自荐,代码与模型清单一一对应,没画饼。二百四十星起步,对一个垂直工具来说不算冷清,九天三版的节奏在开源个人项目里少见。

注意事项

代码 Apache 2.0 开源,模型许可各自不同,OmniVoice 的权重是非商业授权,商用配音前先核对每个模型的条款,商用场景列个模型清单逐一查授权,别偷懒。硬件门槛官方没给数字,零点六 B 到一点七 B 的量化模型,八吉起步的内存应该有得谈,这条属于我的推断,以实测为准,跑不动就降档,模型下载体积不小,首次配置留足磁盘。Intel 版苹果电脑不支持,Linux 只有命令行版,英文界面要等社区翻译的完整度。

总结

中文界面、本地推理、克隆与设计音色齐全,迭代勤快,是近期配音工具里完成度靠前的一个。免费尝鲜没有负担,商用场景把模型许可核清楚再上,白嫖党与尝鲜党没有理由不试,字幕转配音功能落地后,视频搬运的流程就齐了。

来源

  • 开源仓库 https://github.com/leemysw/yovoice
  • 小众软件发现频道 https://www.appinn.com/faxian-top10-2638/
  • 论坛自荐帖 https://meta.appinn.net/t/91962