Fish Audio Voice Clone API
อัปโหลดเสียงสะอาดเพื่อสร้าง Voice ID ที่ใช้เป็น reference_id ซ้ำได้; เว็บไซต์มี 3 ช่องเสียงสาธารณะ
เกี่ยวกับโมเดล
ทำไมควรเลือก Fish Audio S2.1 Pro?
เลือก S2.1 Pro เมื่อต้องการเสียงพูดเป็นธรรมชาติในหลายภาษาโดยไม่ต้องดูแลโมเดลแยกตามภาษา ระบบตรวจจับภาษาของข้อความโดยอัตโนมัติและรองรับ 83 ภาษา
จุดเด่นหลัก
- ควบคุมด้วยภาษาธรรมชาติ: ใส่คำบรรยายอย่าง
[whispers sweetly],[laugh]หรือ[sigh]ลงในข้อความได้โดยตรง - นำเสียงกลับมาใช้ซ้ำ: สร้างเสียงโคลนครั้งเดียว แล้วส่ง Voice ID เป็น
reference_idในคำขอ TTS ครั้งถัดไป - โมเดลฟรีมีคุณภาพเท่ากัน:
s2.1-pro-freeใช้คุณภาพโมเดลและความครอบคลุมภาษาเดียวกับs2.1-pro
คำว่า “ฟรี” หมายถึงอะไร
โมเดล API s2.1-pro-free มีราคา $0 สำหรับการพัฒนาและทดสอบภายใต้ข้อจำกัด fair-use ที่ไม่ได้ประกาศตัวเลขชัดเจน และไม่มีการรับประกัน TTFA หรือ DPA ซึ่งแยกจาก Free Tier บนเว็บไซต์ที่ปัจจุบันระบุ 8,000 เครดิตต่อเดือน ประมาณ 7 นาที 500 ตัวอักษรต่อครั้ง และช่องเสียงสาธารณะ 3 ช่อง
สร้างบัญชีและ API Key ของ Fish Audio: https://fish.audio/?aff=QNLX47TF37QU6
วิธีเข้าถึงฟรี (ผ่าน Fish Audio)
ทำไมต้องสร้างเสียงโคลนแบบถาวร?
เสียงโคลนแบบถาวรจะแปลงไฟล์บันทึกหนึ่งไฟล์หรือหลายไฟล์เป็น Voice ID ที่ใช้ซ้ำได้ เพื่อรักษาเสียงของแบรนด์ ผู้บรรยาย ตัวละคร หรือเนื้อหาหลายภาษาให้สม่ำเสมอ
คำแนะนำในการบันทึก
- อัปโหลด WAV, MP3, M4A หรือ Opus ที่มีผู้พูดชัดเจนเพียงคนเดียว
- เตรียมเสียงอย่างน้อย 10 วินาที และใช้เสียงสะอาดหนึ่งถึงสองนาทีเพื่อเพิ่มความเหมือน
- หลีกเลี่ยงดนตรี เสียงก้อง เสียงรบกวน และเสียงพูดทับกัน ข้อความถอดเสียงที่ตรงกันช่วยปรับการออกเสียงได้
คำว่า “ฟรี” หมายถึงอะไร
Free Tier บนเว็บไซต์ปัจจุบันมีการโคลนเสียงแบบปรับปรุงและช่องเสียงสาธารณะ 3 ช่องโดยไม่ต้องใช้บัตรเครดิต โควตานี้แยกจากโมเดล API s2.1-pro-free ราคา $0 ภายใต้ fair-use Endpoint นี้มีตัวอย่าง multipart ครบถ้วน แต่ไม่เปิดใน Playground ของเรา เพราะการอัปโหลดเสียง ความยินยอม และการจัดการโมเดลต้องใช้ขั้นตอนเฉพาะ
สร้างบัญชีและ API Key: https://fish.audio/?aff=QNLX47TF37QU6
ทดลองใช้ในเบราว์เซอร์
เลือกโมเดล วางคีย์ฟรีของคุณเอง แล้วรันได้เลย คีย์ของคุณถูกส่งเพียงครั้งเดียวเพื่อเรียกผู้ให้บริการ และจะไม่ถูกเก็บไว้บนเซิร์ฟเวอร์ของเรา
เลือกโมเดล วางคีย์ฟรีของคุณเอง แล้วรันได้เลย คีย์ของคุณถูกส่งเพียงครั้งเดียวเพื่อเรียกผู้ให้บริการ และจะไม่ถูกเก็บไว้บนเซิร์ฟเวอร์ของเรา
ตัวอย่างโค้ด
curl --request POST https://api.fish.audio/model \
--header "Authorization: Bearer $FISH_API_KEY" \
--form type=tts \
--form title="My Voice" \
--form "description=Cloned from a clean sample" \
--form visibility=public \
--form train_mode=fast \
--form enhance_audio_quality=true \
--form voices=@sample.wavimport os
import requests
with open("sample.wav", "rb") as audio:
response = requests.post(
"https://api.fish.audio/model",
headers={"Authorization": f"Bearer {os.environ['FISH_API_KEY']}"} ,
data={"type": "tts", "title": "My Voice",
"visibility": "public", "train_mode": "fast",
"enhance_audio_quality": "true"},
files={"voices": ("sample.wav", audio, "audio/wav")},
timeout=60,
)
response.raise_for_status()
print(response.json()["_id"])ข้อจำกัดและข้อควรระวัง
ก่อนอัปโหลดเสียง
- โคลนเฉพาะเสียงของตนเองหรือเสียงที่ได้รับอนุญาตเป็นลายลักษณ์อักษร ห้ามคัดลอกเสียงออนไลน์หรือบุคคลสาธารณะโดยไม่ได้รับความยินยอม
- บันทึกผู้พูดคนเดียวในที่เงียบอย่างน้อย 10 วินาที; สองถึงสามคลิปยาว 15–20 วินาทีเป็นจุดเริ่มต้นที่ดีกว่า
- Create Model ใช้ multipart; ให้ HTTP client ตั้งค่า boundary อัตโนมัติ การเผยแพร่แบบ public ต้องมีภาพปก
- บันทึก
_idที่ได้รับเป็น Voice ID ช่องเสียงสาธารณะ 3 ช่องของ Free Tier บนเว็บไซต์แยกจากโมเดล TTS API ราคา $0 อ่านคำแนะนำการโคลนเสียงอย่างเป็นทางการ
ความคิดเห็นจากชุมชน
ความคิดเห็นผูกกับบัญชี GitHub ของคุณ — เข้าสู่ระบบเพื่อร่วมพูดคุย