AI文摘 此内容由AI根据文章内容自动生成
AI Summary
项目介绍
语音克隆 · 语音设计 · 视频配音 — 支持 646 种语言,100% 本地运行,永久免费。
项目特点
- 桌面语音全能工具箱,零样本克隆多语配音,本地运行零成本
- 646种语言随意切换,录音转录自动粘贴,说话人识别人声提取
- 无需密钥告别按月付费,跨平台全兼容,开源免费想咋用咋用
项目截图
![]() 语音克隆: 上传一段 3 秒音频片段 → 镜像任何声音。支持 646 种语言,零失败。 | ![]() 语音设计 从零开始构建新的声音——性别、年龄、口音、音调、风格。 |
![]() 视频配音: 上传或粘贴 YouTube 视频链接。转录、翻译、重新配音、导出。 | ![]() Voice Gallery 搜索 YouTube,浏览类别,下载片段,建立您的媒体库。 |
![]() 设置 → 模型 15 种模型。一键安装。自动检测您的平台(CUDA / MPS / CPU)。 | ![]() 项目 配音项目、语音配置文件、生成历史记录、导出内容——全部可搜索。 |
![]() 设置 → 日志 实时后端、前端和 Tauri 运行时日志。筛选、刷新、清除。 | |
核心管道
- 视频配音——转录→翻译→合成→复用回MP4。一键完成端到端操作。
- 人声隔离——Demucs 实现人声/音乐分离。背景音频自动保留。
- 语音克隆——从3秒钟的视频片段中克隆任何声音。无需录制,支持600多种语言。
- 多说话人分割——Pyannote + WhisperX 融合可自动识别说话人并分配独特的语音配置文件。
Studio Tools
- 语音预览— 用于即时进行 8 步 TTS 测试的浮动控件。无需离开工作区即可试用各种语音。
- 多语言批量配音——选择多种目标语言,一次性配音完成。
- 批量队列——拖放式批量视频处理,采用顺序 GPU 执行。
- 语音库— 浏览、收藏、标记和将图库片段转换为永久语音配置文件。
- A/B 对比——并排进行声音试听,以辅助选角决定。
生产出口
- 选择性导出音轨— 选择要包含在最终 MP4 中的语言音轨。
- 字幕导出——与配音视频一起生成 SRT 和 VTT 字幕。
- 分轨导出——将人声和背景音频分离成单独的文件。
- 按段混合——每个段可进行 0-200% 的增益控制,以实现广播级平衡。
技术的
- 跨平台 GPU — 自动检测 CUDA、Apple Silicon (MPS)、ROCm 或 CPU。包含自动 cuDNN 8/9 兼容性处理。
- 支持显存感知——在配备≤8 GB GPU 的设备上,转录过程中自动将 TTS 任务卸载到 CPU。无需配置。
- 实时遥测——实时 CPU/RAM/VRAM 统计信息,并带有模型预热指示器。
- 键盘优先——
⌘+Enter生成、⌘+S保存、⌘+Z/⌘+⇧+Z撤销/重做。
人工智能溯源
- 隐形水印——由 AudioSeal 提供支持的(Meta)神经水印,嵌入到每个生成的音频中。人眼无法察觉,即使经过压缩/编辑也能保留。
- 检测 API — 上传任何音频以
/watermark/detect验证 OmniVoice 来源并给出置信度评分。 - 视频品牌标识——在导出的 MP4 文件中可选择添加徽标叠加(5 秒淡出,右下角)。
- 可配置——在“设置”→“隐私”中独立切换不可见/可见水印。
© 版权声明
NOTICE
1240555208@qq.com|Copyright © 2023~2026
01
DISCLAIMER
本站资源大多来自网络,如有侵犯权益请联系管理员,我们会第一时间审核删除。站内资源仅供学习测试,未经许可禁止商用,请在24小时内删除。
02
VIP PRIVILEGE
遇到付费内容?升级终身VIP即可全站免费畅享所有资源,可以联系我的微信进行开通。
大海聊天 QQ 3群:478065589
THE END

















子比主题美化
精品源码资源 

暂无评论内容