Spark-TTS:极简版音频克隆
核心功能
如果你是播客主,或者经常在 B 站发布视频解说,可以使用这款工具:
- 音色克隆:录制一段你说话的录音,即可用你的音色生成任意文本的音频。
- 趣味应用:你可以让“猪八戒”给你讲故事,实现极具个性化的语音输出。
使用方法非常简单:
- 上传一段参考音频或者录制你自己的声音。
- 输入你想转换成音频的文本。
- 点击开始克隆即可。
技术原理与优势
Spark-TTS 是一款先进的文本转语音(Text-to-Speech,TTS)系统,它利用大型语言模型(Large Language Model,LLM)的强大功能,实现了高度准确且自然流畅的语音合成。该系统旨在为研究和生产使用提供高效、灵活且强大的解决方案。
- 简洁与高效:完全基于 Qwen2.5 构建,无需额外的生成模型(如流匹配模型等)。通过直接从 LLM 预测的代码中重构音频,简化了流程,提高了效率并降低了复杂性。
- 零样本语音克隆 (Zero-Shot Voice Cloning):支持在无需特定训练数据的情况下复制说话者的声音。这在跨语言和代码切换场景中尤为有用,允许在不同语言和声音之间无缝切换。
- 多语言与个性化:支持中文和英文。通过调整性别、音调和语速等参数,可以创建虚拟说话者,提供个性化的语音合成体验。
注意:Spark-TTS 主要用于学术研究、教育目的及合法应用(如辅助技术、语言学研究等)。用户应遵守法律法规,不得用于未经授权的冒充、欺诈、深度伪造或任何非法活动。
版本优化说明
下载地址: jian27打包
我在 jian27 打包的基础上进行了“二次负优化”:
- 瘦身减重:删减了不需要的 Web 界面及冗余文件(原包 5.99GB $\rightarrow$ 本站优化后 4.11GB)。
- Bug 修复:修复了原版文本输入框中含有“回车换行”时,仅能生成第一句的问题。本版本已支持回车不影响音频生成。
- 性能优化:增加了显存回收功能。
效果预期:
- 音质大概能达到原音参考音频的 7 成左右。
- 某些情况下转换出的音频语速会较快。
硬件要求
- 显卡:需要 NVIDIA 显卡(黄皮显卡)。
- 显存:4GB 以上即可,推荐 6GB 以上。

提示: 回复后刷新可以看见下载链接。
太棒了,真是不错的工具。
做自媒体绝对是个好帮手,感谢分享