目前顶级的 AI 音频 / 声音克隆模型,建议收藏备用
目前顶级的 AI 音频 / 声音克隆模型,建议收藏备用:1)MiniMax Speech / Audio —— 中文表现很强,支持音色克隆、长文本 TTS,适合小说、有声书、视频配音等长音频生产。
官网: https://minimax.io/audio
2)Qwen3-TTS —— 阿里通义开源 TTS,主打多语言、音色克隆和语音生成,本地部署党可以重点关注。
GitHub: https://github.com/QwenLM/Qwen3-TTS
3)ElevenLabs —— AI 配音领域的第一梯队,自然度和情绪表现非常强,声音克隆也成熟,做有声书、剧情旁白尤其合适。
官网: https://elevenlabs.io
4)Fish Audio —— 开源声音克隆热门方案,多语言、情感表现和流式生成都不错,想自己部署非常香。
GitHub: https://github.com/fishaudio/fish-speech
5)Microsoft VibeVoice —— 微软的开源长音频模型,重点就是超长文本 + 多人对话,TTS 模型最高可生成约 90 分钟、支持最多 4 个说话人。
GitHub: https://github.com/microsoft/VibeVoice
要中文选 MiniMax/Qwen,追求自然度看 ElevenLabs,想本地部署看 Fish Audio/VibeVoice。
页:
[1]