สิ่งที่เปลี่ยนวันนี้
- บริษัทนี้บอกว่าเป็นโมเดลรับรู้เสียงแบบเรียลไทม์ตัวแรกจาก Meta Superintelligence Labs (บล็อก Meta)
- เป็นมัลติโมดัลแบบออโต้รีเกรสซีฟในตระกูล Muse Spark ทำงานโดยหั่นเสียงเป็นชิ้นสั้น ๆ ละ 80 มิลลิวินาที แล้วค่อยคิด (บล็อก Meta)
- ถอดเสียงสดแบบสตรีม คือพูดไปตัวอักษรโผล่ไป (บล็อก Meta)
- แยกคนพูดได้เกิน 20 คน คือรู้ว่าใครพูดตอนไหน (บล็อก Meta)
- จับจบประโยคได้ในตัว คือรู้ว่าคนพูดหยุดแล้ว ไม่ต้องไปต่อระบบจับเสียงพูดเอง (บล็อก Meta)
- มี adaptive delay คือรอนานสั้นตามความยากของคำ (บล็อก Meta)
- สลับภาษาในประโยคเดียวกันได้ ดึงให้ถูกคำด้วยภาษา คำสำคัญ หรือบริบทที่เรากำหนด (บล็อก Meta)
- ฝึกมา 70 กว่าภาษา ตรวจแน่น 25 ภาษารวมไทย (บล็อก Meta)

ใช้ยังไงได้บ้าง
- ใช้ผ่าน Meta Model API ด้วยรหัส muse-voice-transcribe-1.0 (หน้าเอกสาร Meta)
- เสียงสดต่อที่ wss://api.meta.ai/v1/asr/realtime มีโหมด PUSH_TO_TALK เป็นค่าเริ่ม กับโหมด ENDPOINTING กับ DIARIZATION ให้เลือก (หน้าเอกสาร Meta)
- ไฟล์ที่อัดไว้ส่งผ่าน POST ที่ api.meta.ai/v1/asr/transcribe ยาวสุด 10 นาที คำขอไม่เกิน 32 MB (หน้าเอกสาร Meta)
- เซสชันเสียงสดสูงสุด 60 นาที หมดแล้วต่อเซสชันใหม่ (หน้าเอกสาร Meta)
- บล็อกบริษัทบอกว่าโมเดลรองรับเสียงยาวเกิน 1 ชั่วโมง ผู้พูดเกิน 20 คน ไม่ต้องไปตัดต่อทีหลัง (บล็อก Meta)
- ขับการพิมพ์ด้วยเสียงใน Meta AI บนแมค กับใน Muse Code โดยกดค้างปุ่ม Fn (หน้าเอกสาร Meta)
- น้ำหนักปิด คือไม่ปล่อยไฟล์โมเดลให้เอาไปลงเครื่องเอง ต้องใช้ผ่าน Meta Model API กับแอป Meta AI บนแมคกับ Muse Code เท่านั้น (บล็อก Meta)
ราคาและกติกา
- 0.18 ดอลลาร์ต่อชั่วโมงเสียงที่ประมวลแล้ว เท่ากับ 3 ดอลลาร์ต่อเสียง 1,000 นาที (หน้าเอกสาร Meta)
- สตรีมกับส่งไฟล์ราคาเท่ากัน ZDR ราคาเท่า Standard (หน้าเอกสาร Meta)
- คิดตามเสียงที่ประมวลจริง ปัดลงเป็นวินาทีเต็ม เช่น 30.4 วินาทีคิดเป็น 30 วินาที (หน้าเอกสาร Meta)
- คำขอที่พังก่อนได้ถอด กับคำขอที่โดน 429 ไม่คิดเงิน เครดิตขั้นฟรีของแพลตฟอร์มใช้ได้ (หน้าเอกสาร Meta)
- เพดานต่อผู้เช่าคือสตรีมพร้อมกันได้ 8 เส้น เปิดใหม่ได้ 1,000 เส้นต่อชั่วโมง (หน้าเอกสาร Meta)
คำอ้างอันดับของบริษัท
- Meta บอกเองว่าอยู่อันดับ 1 บน Artificial Analysis ฝั่งถอดเสียงสด ข้อมูล ณ 1 ก.ย. 2026 (บล็อก Meta)
- บริษัทนี้บอกด้วยว่าอันดับ 1 บนกระดานแยกคนพูดสาธารณะ วันเดียวกัน (บล็อก Meta)
- ทั้งหมดเป็นคำอ้างของ Meta ไม่ใช่ผลวัดของโต๊ะข่าวนี้
อย่าปนกับตัวอื่น
- ไม่ใช่ Gemini 3.5 Transcribe ของกูเกิล ข่าวที่ฝั่งเราเคยลงไว้ (a/424) ยังอยู่สถานะพรีวิว
- ไม่ใช่โมเดล Muse ด้านรูปภาพที่กระจายบน fal ก่อนหน้านี้ อย่าสับสนตอนแชร์

ยังไม่มีในตัว
- ไม่มีเวลาแบบต่อคำ มีแค่เวลาต่อท่อนพูด (หน้าเอกสาร Meta)
- ไม่มีคะแนนความมั่นใจ ไม่จับเสียงสิ่งของ ไม่จับอารมณ์ ไม่จัดรูปประโยคใหม่ให้ (หน้าเอกสาร Meta)
สรุป
ราคา 3 ดอลลาร์ต่อเสียง 1,000 นาที บวกภาษาไทยที่บริษัทนี้ตรวจแน่น คนนั่งประชุมทั้งวันคงเริ่มคิดกันแล้วว่าจะเอาไปใช้ตอนไหน
แหล่ง: Meta · 1 ก.ย. 2026
