Fish Audio Voice Clone API

Tải mẫu sạch để tạo Voice ID tái sử dụng làm reference_id; website hiện có 3 ô giọng công khai.

Cập nhật 15/7/20262 ví dụ mã
加载评分…

Về mô hình

Vì sao nên chọn Fish Audio S2.1 Pro?

Chọn S2.1 Pro khi bạn cần giọng nói tự nhiên ở nhiều ngôn ngữ mà không phải duy trì mô hình riêng cho từng ngôn ngữ. Mô hình tự động nhận diện ngôn ngữ đầu vào và hỗ trợ 83 ngôn ngữ.

Điểm mạnh chính

  • Điều khiển bằng ngôn ngữ tự nhiên: chèn các chỉ dẫn như [whispers sweetly], [laugh] hoặc [sigh] trực tiếp vào văn bản.
  • Tái sử dụng giọng nói: tạo bản sao giọng một lần rồi gửi Voice ID dưới dạng reference_id trong các yêu cầu TTS sau.
  • Mô hình miễn phí có cùng chất lượng: s2.1-pro-free có chất lượng và phạm vi ngôn ngữ giống s2.1-pro.

“Miễn phí” nghĩa là gì

Mô hình API s2.1-pro-free có giá $0 cho phát triển và thử nghiệm trong giới hạn fair-use chưa công bố con số cụ thể. Mô hình không có cam kết TTFA hoặc DPA. Đây là chính sách riêng với Free Tier trên website, hiện gồm 8.000 credit mỗi tháng, khoảng 7 phút, 500 ký tự mỗi lượt và 3 vị trí giọng công khai.

Tạo tài khoản và API Key Fish Audio: https://fish.audio/?aff=QNLX47TF37QU6

Cách truy cập miễn phí (thông qua Fish Audio)

Vì sao nên tạo bản sao giọng lâu dài?

Bản sao lâu dài chuyển một hoặc nhiều bản thu thành Voice ID có thể tái sử dụng, giúp duy trì giọng thương hiệu, người dẫn chuyện, nhân vật hoặc bản địa hóa nhất quán.

Hướng dẫn thu âm

  • Tải WAV, MP3, M4A hoặc Opus chỉ có một người nói rõ ràng.
  • Chuẩn bị ít nhất 10 giây; một đến hai phút lời nói sạch giúp tăng độ giống.
  • Tránh nhạc, tiếng vang, tạp âm và giọng chồng lấn. Bản chép lời khớp với âm thanh có thể cải thiện phát âm.

“Miễn phí” nghĩa là gì

Free Tier trên website hiện có tính năng nhân bản giọng nâng cao và 3 vị trí giọng công khai mà không cần thẻ tín dụng. Hạn mức này tách biệt với mô hình API s2.1-pro-free giá $0 theo fair-use. Endpoint này có ví dụ multipart đầy đủ nhưng không nằm trong Playground vì tải bản thu, xin phép và quản lý mô hình cần một quy trình riêng.

Tạo tài khoản và API Key: https://fish.audio/?aff=QNLX47TF37QU6

Dùng thử ngay trên trình duyệt

Chọn một mô hình, dán khóa miễn phí của riêng bạn và chạy. Khóa của bạn được gửi một lần để gọi nhà cung cấp và không bao giờ được lưu trên máy chủ của chúng tôi.

Chọn một mô hình, dán khóa miễn phí của riêng bạn và chạy. Khóa của bạn được gửi một lần để gọi nhà cung cấp và không bao giờ được lưu trên máy chủ của chúng tôi.

Ví dụ mã

curl
curl --request POST https://api.fish.audio/model \
  --header "Authorization: Bearer $FISH_API_KEY" \
  --form type=tts \
  --form title="My Voice" \
  --form "description=Cloned from a clean sample" \
  --form visibility=public \
  --form train_mode=fast \
  --form enhance_audio_quality=true \
  --form voices=@sample.wav
python
import os
import requests

with open("sample.wav", "rb") as audio:
    response = requests.post(
        "https://api.fish.audio/model",
        headers={"Authorization": f"Bearer {os.environ['FISH_API_KEY']}"} ,
        data={"type": "tts", "title": "My Voice",
              "visibility": "public", "train_mode": "fast",
              "enhance_audio_quality": "true"},
        files={"voices": ("sample.wav", audio, "audio/wav")},
        timeout=60,
    )
response.raise_for_status()
print(response.json()["_id"])

Hạn chế & Lưu ý

Trước khi tải âm thanh lên

  • Chỉ nhân bản giọng của bạn hoặc giọng có sự cho phép rõ ràng bằng văn bản; không sao chép giọng trên mạng hay người nổi tiếng khi chưa được đồng ý.
  • Thu một người nói rõ ràng ở nơi yên tĩnh trong ít nhất 10 giây; hai hoặc ba đoạn 15–20 giây là điểm bắt đầu tốt hơn.
  • Create Model dùng multipart; để HTTP client tự đặt boundary. Chế độ public yêu cầu ảnh bìa.
  • Lưu _id trả về làm Voice ID. Ba vị trí giọng công khai của Free Tier trên website tách biệt với mô hình TTS API giá $0. Đọc hướng dẫn nhân bản giọng chính thức.

Phản hồi từ cộng đồng

Bình luận được liên kết với tài khoản GitHub của bạn — đăng nhập để tham gia thảo luận.