OmniVoice Studio 免费本地离线 AI 语音克隆
浏览:37 留言:0
手机扫我访问

OmniVoice Studio 免费本地离线 AI 语音克隆

项目介绍 语音克隆 · 语音设计 · 视频配音 — 支持 646 种语言,100% 本地运行,永久免费。 项目 […]

相关标签:人工智能

OmniVoice Studio 免费本地离线 AI 语音克隆

AI
AI文摘 此内容由AI根据文章内容自动生成
AI Summary

项目介绍

语音克隆 · 语音设计 · 视频配音 — 支持 646 种语言,100% 本地运行,永久免费。

项目特点

  • 桌面语音全能工具箱,零样本克隆多语配音,本地运行零成本
  • 646种语言随意切换,录音转录自动粘贴,说话人识别人声提取
  • 无需密钥告别按月付费,跨平台全兼容,开源免费想咋用咋用

项目截图

语音克隆
语音克隆:
上传一段 3 秒音频片段 → 镜像任何声音。支持 646 种语言,零失败。
语音设计
语音设计
从零开始构建新的声音——性别、年龄、口音、音调、风格。
视频配音
视频配音:
上传或粘贴 YouTube 视频链接。转录、翻译、重新配音、导出。
语音库
Voice Gallery
搜索 YouTube,浏览类别,下载片段,建立您的媒体库。
设置 — 模型
设置 → 模型
15 种模型。一键安装。自动检测您的平台(CUDA / MPS / CPU)。
项目
项目
配音项目、语音配置文件、生成历史记录、导出内容——全部可搜索。
设置 — 日志
设置 → 日志
实时后端、前端和 Tauri 运行时日志。筛选、刷新、清除。

核心管道

  • 视频配音——转录→翻译→合成→复用回MP4。一键完成端到端操作。
  • 人声隔离——Demucs 实现人声/音乐分离。背景音频自动保留。
  • 语音克隆——从3秒钟的视频片段中克隆任何声音。无需录制,支持600多种语言。
  • 多说话人分割——Pyannote + WhisperX 融合可自动识别说话人并分配独特的语音配置文件。

Studio Tools

  • 语音预览— 用于即时进行 8 步 TTS 测试的浮动控件。无需离开工作区即可试用各种语音。
  • 多语言批量配音——选择多种目标语言,一次性配音完成。
  • 批量队列——拖放式批量视频处理,采用顺序 GPU 执行。
  • 语音库— 浏览、收藏、标记和将图库片段转换为永久语音配置文件。
  • A/B 对比——并排进行声音试听,以辅助选角决定。

生产出口

  • 选择性导出音轨— 选择要包含在最终 MP4 中的语言音轨。
  • 字幕导出——与配音视频一起生成 SRT 和 VTT 字幕。
  • 分轨导出——将人声和背景音频分离成单独的文件。
  • 按段混合——每个段可进行 0-200% 的增益控制,以实现广播级平衡。

技术的

  • 跨平台 GPU — 自动检测 CUDA、Apple Silicon (MPS)、ROCm 或 CPU。包含自动 cuDNN 8/9 兼容性处理。
  • 支持显存感知——在配备≤8 GB GPU 的设备上,转录过程中自动将 TTS 任务卸载到 CPU。无需配置。
  • 实时遥测——实时 CPU/RAM/VRAM 统计信息,并带有模型预热指示器。
  • 键盘优先——⌘+Enter生成、⌘+S保存、⌘+Z/⌘+⇧+Z撤销/重做。

人工智能溯源

  • 隐形水印——由 AudioSeal 提供支持的(Meta)神经水印,嵌入到每个生成的音频中。人眼无法察觉,即使经过压缩/编辑也能保留。
  • 检测 API — 上传任何音频以/watermark/detect验证 OmniVoice 来源并给出置信度评分。
  • 视频品牌标识——在导出的 MP4 文件中可选择添加徽标叠加(5 秒淡出,右下角)。
  • 可配置——在“设置”→“隐私”中独立切换不可见/可见水印。
© 版权声明
THE END
点赞9分享
及时反馈~ 抢沙发

请登录后发表评论

    暂无评论内容