Fish Audio Voice Clone API

อัปโหลดเสียงสะอาดเพื่อสร้าง Voice ID ที่ใช้เป็น reference_id ซ้ำได้; เว็บไซต์มี 3 ช่องเสียงสาธารณะ

อัปเดตเมื่อ 15/7/2569ตัวอย่างโค้ด 2 รายการ
加载评分…

เกี่ยวกับโมเดล

ทำไมควรเลือก Fish Audio S2.1 Pro?

เลือก S2.1 Pro เมื่อต้องการเสียงพูดเป็นธรรมชาติในหลายภาษาโดยไม่ต้องดูแลโมเดลแยกตามภาษา ระบบตรวจจับภาษาของข้อความโดยอัตโนมัติและรองรับ 83 ภาษา

จุดเด่นหลัก

  • ควบคุมด้วยภาษาธรรมชาติ: ใส่คำบรรยายอย่าง [whispers sweetly], [laugh] หรือ [sigh] ลงในข้อความได้โดยตรง
  • นำเสียงกลับมาใช้ซ้ำ: สร้างเสียงโคลนครั้งเดียว แล้วส่ง Voice ID เป็น reference_id ในคำขอ TTS ครั้งถัดไป
  • โมเดลฟรีมีคุณภาพเท่ากัน: s2.1-pro-free ใช้คุณภาพโมเดลและความครอบคลุมภาษาเดียวกับ s2.1-pro

คำว่า “ฟรี” หมายถึงอะไร

โมเดล API s2.1-pro-free มีราคา $0 สำหรับการพัฒนาและทดสอบภายใต้ข้อจำกัด fair-use ที่ไม่ได้ประกาศตัวเลขชัดเจน และไม่มีการรับประกัน TTFA หรือ DPA ซึ่งแยกจาก Free Tier บนเว็บไซต์ที่ปัจจุบันระบุ 8,000 เครดิตต่อเดือน ประมาณ 7 นาที 500 ตัวอักษรต่อครั้ง และช่องเสียงสาธารณะ 3 ช่อง

สร้างบัญชีและ API Key ของ Fish Audio: https://fish.audio/?aff=QNLX47TF37QU6

วิธีเข้าถึงฟรี (ผ่าน Fish Audio)

ทำไมต้องสร้างเสียงโคลนแบบถาวร?

เสียงโคลนแบบถาวรจะแปลงไฟล์บันทึกหนึ่งไฟล์หรือหลายไฟล์เป็น Voice ID ที่ใช้ซ้ำได้ เพื่อรักษาเสียงของแบรนด์ ผู้บรรยาย ตัวละคร หรือเนื้อหาหลายภาษาให้สม่ำเสมอ

คำแนะนำในการบันทึก

  • อัปโหลด WAV, MP3, M4A หรือ Opus ที่มีผู้พูดชัดเจนเพียงคนเดียว
  • เตรียมเสียงอย่างน้อย 10 วินาที และใช้เสียงสะอาดหนึ่งถึงสองนาทีเพื่อเพิ่มความเหมือน
  • หลีกเลี่ยงดนตรี เสียงก้อง เสียงรบกวน และเสียงพูดทับกัน ข้อความถอดเสียงที่ตรงกันช่วยปรับการออกเสียงได้

คำว่า “ฟรี” หมายถึงอะไร

Free Tier บนเว็บไซต์ปัจจุบันมีการโคลนเสียงแบบปรับปรุงและช่องเสียงสาธารณะ 3 ช่องโดยไม่ต้องใช้บัตรเครดิต โควตานี้แยกจากโมเดล API s2.1-pro-free ราคา $0 ภายใต้ fair-use Endpoint นี้มีตัวอย่าง multipart ครบถ้วน แต่ไม่เปิดใน Playground ของเรา เพราะการอัปโหลดเสียง ความยินยอม และการจัดการโมเดลต้องใช้ขั้นตอนเฉพาะ

สร้างบัญชีและ API Key: https://fish.audio/?aff=QNLX47TF37QU6

ทดลองใช้ในเบราว์เซอร์

เลือกโมเดล วางคีย์ฟรีของคุณเอง แล้วรันได้เลย คีย์ของคุณถูกส่งเพียงครั้งเดียวเพื่อเรียกผู้ให้บริการ และจะไม่ถูกเก็บไว้บนเซิร์ฟเวอร์ของเรา

เลือกโมเดล วางคีย์ฟรีของคุณเอง แล้วรันได้เลย คีย์ของคุณถูกส่งเพียงครั้งเดียวเพื่อเรียกผู้ให้บริการ และจะไม่ถูกเก็บไว้บนเซิร์ฟเวอร์ของเรา

ตัวอย่างโค้ด

curl
curl --request POST https://api.fish.audio/model \
  --header "Authorization: Bearer $FISH_API_KEY" \
  --form type=tts \
  --form title="My Voice" \
  --form "description=Cloned from a clean sample" \
  --form visibility=public \
  --form train_mode=fast \
  --form enhance_audio_quality=true \
  --form voices=@sample.wav
python
import os
import requests

with open("sample.wav", "rb") as audio:
    response = requests.post(
        "https://api.fish.audio/model",
        headers={"Authorization": f"Bearer {os.environ['FISH_API_KEY']}"} ,
        data={"type": "tts", "title": "My Voice",
              "visibility": "public", "train_mode": "fast",
              "enhance_audio_quality": "true"},
        files={"voices": ("sample.wav", audio, "audio/wav")},
        timeout=60,
    )
response.raise_for_status()
print(response.json()["_id"])

ข้อจำกัดและข้อควรระวัง

ก่อนอัปโหลดเสียง

  • โคลนเฉพาะเสียงของตนเองหรือเสียงที่ได้รับอนุญาตเป็นลายลักษณ์อักษร ห้ามคัดลอกเสียงออนไลน์หรือบุคคลสาธารณะโดยไม่ได้รับความยินยอม
  • บันทึกผู้พูดคนเดียวในที่เงียบอย่างน้อย 10 วินาที; สองถึงสามคลิปยาว 15–20 วินาทีเป็นจุดเริ่มต้นที่ดีกว่า
  • Create Model ใช้ multipart; ให้ HTTP client ตั้งค่า boundary อัตโนมัติ การเผยแพร่แบบ public ต้องมีภาพปก
  • บันทึก _id ที่ได้รับเป็น Voice ID ช่องเสียงสาธารณะ 3 ช่องของ Free Tier บนเว็บไซต์แยกจากโมเดล TTS API ราคา $0 อ่านคำแนะนำการโคลนเสียงอย่างเป็นทางการ

ความคิดเห็นจากชุมชน

ความคิดเห็นผูกกับบัญชี GitHub ของคุณ — เข้าสู่ระบบเพื่อร่วมพูดคุย