Fish Audio Voice Clone API

上传清晰录音创建可复用的 Fish Audio Voice ID,再作为 reference_id 用于 TTS;网站 Free Tier 目前提供 3 个公开音色槽。

更新于 2026/7/152 个代码示例
加载评分…

关于该模型

为什么选择 Fish Audio S2.1 Pro?

如果你希望用同一个模型生成多语言自然语音,而不想分别维护多套语言模型,S2.1 Pro 很合适。它会自动识别输入语言,并覆盖 83 种语言。

核心优势

  • 自然语言控制: 直接在文本中加入 [whispers sweetly][laugh][sigh] 等描述。
  • 音色可复用: 声音克隆后会得到 Voice ID,后续作为 reference_id 使用。
  • 免费模型同等质量: s2.1-pro-frees2.1-pro 使用相同的模型质量和语言覆盖。

免费依据

API 模型 s2.1-pro-free 面向开发和测试,在未公开具体数值的 fair-use 限制内为 $0,且不承诺 TTFA 或 DPA。它与网站 Free Tier 是两套口径:后者目前列出每月 8,000 credits、约 7 分钟、单次 500 字符和 3 个公开音色槽。

注册 Fish Audio 并获取 API Key:https://fish.audio/?aff=QNLX47TF37QU6

如何免费接入 (通过 Fish Audio)

为什么创建持久声音克隆?

持久克隆会把一段或多段录音转成可复用的 Voice ID,用于品牌、旁白、角色或本地化音色。

录音建议

  • 支持 WAV、MP3、M4A 或 Opus,录音中应只有一位清晰说话人。
  • 至少准备 10 秒;一到两分钟的干净语音能提高相似度。
  • 避免音乐、混响、底噪和多人重叠;对应文本有助于改善发音。

免费依据

网站 Free Tier 目前列出无需信用卡的增强声音克隆与 3 个公开音色槽。这一额度与 $0 fair-use 的 s2.1-pro-free API 模型不同。本条目提供完整 multipart 示例,但不进入本站 Playground,因为录音上传与声音模型管理需要独立的授权和存储流程。

注册 Fish Audio 并获取 API Key:https://fish.audio/?aff=QNLX47TF37QU6

在浏览器里试用

选个模型、粘贴你自己的免费 Key,即可运行。你的 Key 只用于调用一次该提供商,绝不存储在我们的服务器上。

选个模型、粘贴你自己的免费 Key,即可运行。你的 Key 只用于调用一次该提供商,绝不存储在我们的服务器上。

调用代码示例

curl
curl --request POST https://api.fish.audio/model \
  --header "Authorization: Bearer $FISH_API_KEY" \
  --form type=tts \
  --form title="My Voice" \
  --form "description=Cloned from a clean sample" \
  --form visibility=public \
  --form train_mode=fast \
  --form enhance_audio_quality=true \
  --form voices=@sample.wav
python
import os
import requests

with open("sample.wav", "rb") as audio:
    response = requests.post(
        "https://api.fish.audio/model",
        headers={"Authorization": f"Bearer {os.environ['FISH_API_KEY']}"} ,
        data={"type": "tts", "title": "My Voice",
              "visibility": "public", "train_mode": "fast",
              "enhance_audio_quality": "true"},
        files={"voices": ("sample.wav", audio, "audio/wav")},
        timeout=60,
    )
response.raise_for_status()
print(response.json()["_id"])

限制与注意事项

上传录音前须知

  • 只能克隆自己的声音或已取得明确书面授权的声音;不要擅自复制网络音频或公众人物声音。
  • 在安静环境中录制至少 10 秒且只有一位清晰说话人;两到三段 15–20 秒录音是更稳妥的起点。
  • Create Model 使用 multipart;让 HTTP 客户端自动设置 boundary。公开音色需要封面图。
  • 把返回的 _id 保存为 Voice ID。网站 Free Tier 的 3 个公开音色槽与 $0 TTS API 模型分开计算。查看官方声音克隆指南

社区反馈

评论与你的 GitHub 账号绑定,登录后即可参与讨论。