Fish Audio 是什么?免费 S2.1 Pro TTS 与声音克隆指南

Fish Audio 是什么?免费 S2.1 Pro TTS 与声音克隆指南 — Free AI API

Fish Audio 是一个 AI 语音平台,可以把文字转换为自然语音,也可以把一个音色保存下来,在不同产品和内容中反复使用。它最实用的工作流很直接:用 S2.1 Pro 生成语音,创建或选择音色,再把 Voice ID 传给后续请求。

为什么值得尝试 Fish Audio?

  • 一个模型覆盖 83 种语言: S2.1 Pro 会自动识别输入语言,适合多语言产品、出海内容和中外文混合文本。
  • 直接用文字描述表演方式: 在正文中加入 [whispers sweetly][laugh][excited],即可控制表达,不需要维护固定的情绪枚举。
  • 音色可以复用: 完成一次声音克隆后会得到 Voice ID,后续作为 reference_id 传给 TTS。
  • 从想法到 MP3 的路径很短: Free AI API Playground 支持默认音色或可选 Voice ID,生成后可以直接播放和下载 MP3。

它适合做什么?

  • 为视频、播客、课程和产品演示制作多语言旁白。
  • 为游戏角色、AI 陪伴应用和对话 Agent 配置稳定音色。
  • 制作无障碍朗读、通知播报和语音交互原型。
  • 在拥有声音权利或取得明确授权的前提下,为重复内容保持一致的品牌声音。

“免费”其实有两套口径

Fish Audio 目前有两种容易混淆的免费方式:

  • API 开发模型: s2.1-pro-free 的价格是每百万 UTF-8 bytes 为 $0,与 s2.1-pro 使用相同的模型质量和语言覆盖。但它受 fair-use 限制,也不提供 TTFA 或 DPA 保证,更适合评估、原型、开发和较小规模的业务。
  • Fish Audio 网站 Free Tier: 套餐页目前列出每月 8,000 credits、约 7 分钟生成时长、单次 500 字符和 3 个公开音色槽,而且无需信用卡。

$0 API 模型并不等于无限生产容量。如果项目需要稳定延迟或服务保证,应先测量真实负载,再考虑生产模型。

四步开始使用

只克隆你拥有或已经取得明确授权的声音。干净的参考录音比昂贵设备更重要;Fish Audio 建议至少录制 10 秒,并尽量选择安静、少混响的环境。

在 Free AI API 继续了解

查看 Fish Audio Provider 页面S2.1 Pro 模型页面,以及官方的模型说明价格说明。准备好后,可以注册账号并立即尝试

fish.audio

Fish Audio

Fish Audio 提供多语言文本转语音与可复用的声音克隆 API。S2.1 Pro 支持 83 种语言、自动语言识别和自然语言情绪提示。注册账号:https://fish.audio/?aff=QNLX47TF37QU6

Fish Audio
Text to Speech

Fish Audio S2.1 Pro

面向生产的多语言 TTS,支持 83 种语言、自然语言情绪控制与可复用克隆音色;s2.1-pro-free 在 fair-use 范围内为 $0。

Fish Audio

Fish Audio S2.1 Pro TTS

使用 $0 fair-use 的 s2.1-pro-free API 模型生成 MP3,覆盖 83 种语言,可用默认音色或可选 Fish Audio Voice ID。

Fish Audio

Fish Audio Voice Clone API

上传清晰录音创建可复用的 Fish Audio Voice ID,再作为 reference_id 用于 TTS;网站 Free Tier 目前提供 3 个公开音色槽。

社区反馈

评论与你的 GitHub 账号绑定,登录后即可参与讨论。