หัวข้อ
- เข้าถึงได้ผ่าน Gemini API ใน Google AI Studio และ Gemini Enterprise Agent Platform ในขั้นพรีวิวสาธารณะ
- ใช้ได้สองโหมด โหมดสตรีมคือถอดเสียงไปเรื่อยๆ ตอนพูดอยู่ ชื่อ gemini-3.5-transcribe-live ผ่าน Live API หน่วงต่ำกว่าหนึ่งวินาที
- โหมดอัดไว้ก่อนคือถอดไฟล์เสียงที่อัดเสร็จแล้ว ชื่อ gemini-3.5-transcribe ผ่าน Interactions API บอกด้วยว่าใครพูดและพูดตอนไหน
- ช่วยเก็บงานให้เอง ลบคำเติมอย่าง อืม ออก แก้คำที่พูดแล้วแก้ตัวเอง และจัดข้อความให้อ่านง่าย
- ตรวจภาษาอัตโนมัติ ถอดได้มากกว่า 85 ภาษา
- แยกผู้พูดในไฟล์อัดไว้ได้ถึงสามคน ถ้าเกินสามคนยังอยู่ในขั้นทดลอง
- ฝ่ายนอกอย่าง Artificial Analysis วัดอัตราผิดคำ คือเปอร์เซ็นต์ของคำที่ถอดผิด ได้ 4.0 เปอร์เซ็นต์แบบสตรีม และ 2.6 เปอร์เซ็นต์แบบอัดไว้ก่อน พร้อมได้ผลถอดสุดท้ายเร็วขึ้นราว 70 เปอร์เซ็นต์เทียบโมเดลก่อนหน้าของ Google
- ส่วนตัวเลขบนชุดทดสอบ FLEURS เป็นคะแนนที่ Google บอกเอง อัตราผิดคำ 5.50 เปอร์เซ็นต์แบบสตรีม และ 5.04 เปอร์เซ็นต์แบบอัดไว้ก่อน ดีกว่า Chirp 3
- ใช้จริงแล้วในแอป Rambler บน Android บางประเทศ แอป Gemini บน macOS ภาษาอังกฤษ และเร็วๆ นี้จะมาใน Chrome
- ยังไม่มีน้ำหนักโมเดลให้โหลดมาลงเครื่องตัวเอง ต้องใช้ผ่าน API กับผลิตภัณฑ์ของ Google เท่านั้น

สรุป
ถ้าใครถามว่าโหลดมาใช้เองได้ยัง ตอบว่ายังไม่ได้ครับ ตอนนี้ต้องใช้ผ่านบริการของ Google อย่างเดียว แต่ใครอยากลองความแม่นก็เข้าไปเล่นใน Google AI Studio ได้เลย
แหล่ง: บล็อก Google · 26 ส.ค. 2026
