GPT-SoVITS：把小说变成自然语音的有声书

GPT-SoVITS的功能？

零样本文本到语音 (TTS): 输入 5 秒的声音样本, 即刻体验文本到语音转换。

少样本 TTS: 仅需 1 分钟的训练数据即可微调模型, 提升声音相似度和真实感。

跨语言支持: 支持与训练数据集不同语言的推理, 目前支持英语、日语、韩语、粤语和中文。

WebUI 工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注, 协助初学者创建训练数据集和 GPT/SoVITS 模型。

运行环境

Windows10，显存至少6G，内存至少16G

操作步骤

1.下载GPT-SoVITS（GPT-SoVITS/docs/cn/README.md at main · RVC-Boss/GPT-SoVITS · GitHub）。

2.解压压缩包。

3.运行go-webui.bat。

4.启用推理。

5.上传主参考音频。音频需人声清晰，去掉除人声以外所有声音，音频控制在10秒以内。

6.开始合成音频。

参数设置

GPT模型列表：使用V3底模效果最佳。

SoVITS模型列表：使用v2ProPlus底模效果最佳。

使用方式：直接使用底模+上传参考音频方式合成效果最佳。不要自行训练，自行训练除非硬件条件非常好，且数据样本质量非常高，数据标注非常好，否则自行训练的模型不如底模直接合成音频声音自然。

如何切分：作者建议每四句一切。

并行推理：建议关闭。实际测试同等条件下并行推理速度更慢，消耗内存更多，在有限内存下能够合成的文字数更少。

模型对比

V1：支持语种为中日英。GPT训练集时长约2k小时。SoVITS训练集时长约2k小时。参数量为90M+77M。

V2：支持语种为中日英韩粤。GPT训练集时长约2.5k小时。SoVITS训练集时长约5k小时。参数量为90M+77M。

V3：支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为330M+77M。

V4：支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为330M+77M。

V2Pro：支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为133M+77M。

V2ProPlus：支持语种为中日英韩粤。GPT训练集时长约7k小时。SoVITS训练集时长约7k小时。参数量为152M+77M。

总结

从benchmark跑分看，没有必要再用V3或V4，因为V2Pro系列和v2硬件需求一样，但是zero shot相似度和V3或V4同一水平线。

实际使用记录

RTX2060-6G+32G内存

注：每次最多合成约35万字，目前每次合成约30万字。

合成22万字

约耗时3小时，占用内存16G，推理约70it/s。

合成30万字

约耗时4.5小时，占用内存20G，推理约70it/s。

GTX1060-6G+16G内存

注：每次最多合成约15万字，目前每次合成约15万字。

合成15万字

约耗时5小时，占用内存11G，推理约26it/s。

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

GPT-SoVITS：把小说变成自然语音的有声书

GPT-SoVITS的功能？

运行环境

操作步骤

参数设置

模型对比

总结

实际使用记录

RTX2060-6G+32G内存

合成22万字

合成30万字

GTX1060-6G+16G内存

合成15万字

评论(0)

提示：请文明发言取消回复

文章展示

2026年6月文字转语音工具选型指南

五家文字转语音网站横评，给真正需要的人

三款免费文字转语音网站实测，总有一款适合你

免费文字转语音 – 浮云梦配音

浮云梦配音 fuym.cn：一个没有付费入口的文字转语音网站

分享四个文字转语音网站

排行榜展示

Index TTS2本地部署教程（附安装包）

MiniMax Speech 2.6：最强 Voice Agent 来袭

Agnes AI

免费文字转语音 – 浮云梦配音

IndexTTS2 – B站开源的最新文本转语音模型