Fish Audio Voice Clone API
上传清晰录音创建可复用的 Fish Audio Voice ID,再作为 reference_id 用于 TTS;网站 Free Tier 目前提供 3 个公开音色槽。
更新于 2026/7/152 个代码示例
关于该模型
为什么选择 Fish Audio S2.1 Pro?
如果你希望用同一个模型生成多语言自然语音,而不想分别维护多套语言模型,S2.1 Pro 很合适。它会自动识别输入语言,并覆盖 83 种语言。
核心优势
- 自然语言控制: 直接在文本中加入
[whispers sweetly]、[laugh]、[sigh]等描述。 - 音色可复用: 声音克隆后会得到 Voice ID,后续作为
reference_id使用。 - 免费模型同等质量:
s2.1-pro-free与s2.1-pro使用相同的模型质量和语言覆盖。
免费依据
API 模型 s2.1-pro-free 面向开发和测试,在未公开具体数值的 fair-use 限制内为 $0,且不承诺 TTFA 或 DPA。它与网站 Free Tier 是两套口径:后者目前列出每月 8,000 credits、约 7 分钟、单次 500 字符和 3 个公开音色槽。
注册 Fish Audio 并获取 API Key:https://fish.audio/?aff=QNLX47TF37QU6
如何免费接入 (通过 Fish Audio)
为什么创建持久声音克隆?
持久克隆会把一段或多段录音转成可复用的 Voice ID,用于品牌、旁白、角色或本地化音色。
录音建议
- 支持 WAV、MP3、M4A 或 Opus,录音中应只有一位清晰说话人。
- 至少准备 10 秒;一到两分钟的干净语音能提高相似度。
- 避免音乐、混响、底噪和多人重叠;对应文本有助于改善发音。
免费依据
网站 Free Tier 目前列出无需信用卡的增强声音克隆与 3 个公开音色槽。这一额度与 $0 fair-use 的 s2.1-pro-free API 模型不同。本条目提供完整 multipart 示例,但不进入本站 Playground,因为录音上传与声音模型管理需要独立的授权和存储流程。
注册 Fish Audio 并获取 API Key:https://fish.audio/?aff=QNLX47TF37QU6
在浏览器里试用
选个模型、粘贴你自己的免费 Key,即可运行。你的 Key 只用于调用一次该提供商,绝不存储在我们的服务器上。
选个模型、粘贴你自己的免费 Key,即可运行。你的 Key 只用于调用一次该提供商,绝不存储在我们的服务器上。
调用代码示例
curl
curl --request POST https://api.fish.audio/model \
--header "Authorization: Bearer $FISH_API_KEY" \
--form type=tts \
--form title="My Voice" \
--form "description=Cloned from a clean sample" \
--form visibility=public \
--form train_mode=fast \
--form enhance_audio_quality=true \
--form voices=@sample.wavpython
import os
import requests
with open("sample.wav", "rb") as audio:
response = requests.post(
"https://api.fish.audio/model",
headers={"Authorization": f"Bearer {os.environ['FISH_API_KEY']}"} ,
data={"type": "tts", "title": "My Voice",
"visibility": "public", "train_mode": "fast",
"enhance_audio_quality": "true"},
files={"voices": ("sample.wav", audio, "audio/wav")},
timeout=60,
)
response.raise_for_status()
print(response.json()["_id"])限制与注意事项
上传录音前须知
- 只能克隆自己的声音或已取得明确书面授权的声音;不要擅自复制网络音频或公众人物声音。
- 在安静环境中录制至少 10 秒且只有一位清晰说话人;两到三段 15–20 秒录音是更稳妥的起点。
- Create Model 使用 multipart;让 HTTP 客户端自动设置 boundary。公开音色需要封面图。
- 把返回的
_id保存为 Voice ID。网站 Free Tier 的 3 个公开音色槽与 $0 TTS API 模型分开计算。查看官方声音克隆指南。
社区反馈
评论与你的 GitHub 账号绑定,登录后即可参与讨论。