Spark-TTS,极简版音频克隆
软件类

Spark-TTS,极简版音频克隆

傻木
2025-03-06 / 2 评论 / 1,116 阅读 / 正在检测是否收录...

Spark-TTS:极简版音频克隆

核心功能

如果你是播客主,或者经常在 B 站发布视频解说,可以使用这款工具:

  • 音色克隆:录制一段你说话的录音,即可用你的音色生成任意文本的音频。
  • 趣味应用:你可以让“猪八戒”给你讲故事,实现极具个性化的语音输出。

使用方法非常简单:

  1. 上传一段参考音频或者录制你自己的声音。
  2. 输入你想转换成音频的文本。
  3. 点击开始克隆即可。

技术原理与优势

Spark-TTS 是一款先进的文本转语音(Text-to-Speech,TTS)系统,它利用大型语言模型(Large Language Model,LLM)的强大功能,实现了高度准确且自然流畅的语音合成。该系统旨在为研究和生产使用提供高效、灵活且强大的解决方案。

  • 简洁与高效:完全基于 Qwen2.5 构建,无需额外的生成模型(如流匹配模型等)。通过直接从 LLM 预测的代码中重构音频,简化了流程,提高了效率并降低了复杂性。
  • 零样本语音克隆 (Zero-Shot Voice Cloning):支持在无需特定训练数据的情况下复制说话者的声音。这在跨语言和代码切换场景中尤为有用,允许在不同语言和声音之间无缝切换。
  • 多语言与个性化:支持中文和英文。通过调整性别、音调和语速等参数,可以创建虚拟说话者,提供个性化的语音合成体验。
注意:Spark-TTS 主要用于学术研究、教育目的及合法应用(如辅助技术、语言学研究等)。用户应遵守法律法规,不得用于未经授权的冒充、欺诈、深度伪造或任何非法活动。

版本优化说明

下载地址: jian27打包

我在 jian27 打包的基础上进行了“二次负优化”:

  • 瘦身减重:删减了不需要的 Web 界面及冗余文件(原包 5.99GB $\rightarrow$ 本站优化后 4.11GB)。
  • Bug 修复:修复了原版文本输入框中含有“回车换行”时,仅能生成第一句的问题。本版本已支持回车不影响音频生成。
  • 性能优化:增加了显存回收功能。

效果预期:

  • 音质大概能达到原音参考音频的 7 成左右。
  • 某些情况下转换出的音频语速会较快。

硬件要求

  • 显卡:需要 NVIDIA 显卡(黄皮显卡)。
  • 显存:4GB 以上即可,推荐 6GB 以上

运行界面.jpg

提示: 回复后刷新可以看见下载链接。

0

评论 (2)

取消
  1. 头像
    啊啊啊
    Windows 10 · Google Chrome

    太棒了,真是不错的工具。

    回复
  2. 头像
    123321
    Windows 10 · Google Chrome

    做自媒体绝对是个好帮手,感谢分享

    回复