เกิดอะไรขึ้น
- ค่ายบอกว่าโฟกัสเอเจนต์ที่ทำงานยาว วิจัยหลายขั้น ไล่โค้ดทั้งโปรเจกต์ และเปลี่ยนไอเดียเป็นแอปที่ใช้งานได้
- ไม่ได้ขายว่าฉลาดกระโดดจาก 4.5 แบบก้าวใหญ่ แต่ฝึกต่อนานขึ้นด้วยข้อมูลเหตุผล งานวิศวกรรม และการเรียนรู้แบบให้รางวัลในงานเอเจนต์
- งานที่ค่ายชูคือร่างแอปภาพและอินเทอร์แอคทีฟรอบแรกดีขึ้น และงานยาวเริ่มตรวจผลตัวเองก่อนเดินต่อ
- ใช้ได้แล้วใน Cursor, Grok Build, API และพาร์ทเนอร์อย่าง OpenRouter, Vercel, Cloudflare
- สัปดาห์แรกโควตาใน Cursor กับ Grok Build เพิ่มเป็น 2 เท่า
ตัวเลขอิสระจาก Artificial Analysis
- Grok 4.6 โหมด high ได้ดัชนีปัญญา 61 เสมอกับ GPT-5.6 Sol โหมดสูงสุด
- Claude Opus 5 โหมดสูงสุดยังนำที่ 63 · Fable 5 ได้ 62
- ต้นทุนต่องานราว 0.84 ดอลลาร์ ถูกกว่า Sol สูงสุด (1.23) และถูกกว่า Opus สูงสุด (2.34) กับ Fable (3.14)
- งานความรู้แบบเอเจนต์ GDPVal ได้ 1753 อยู่อันดับ 3 รองแค่ Opus 5 สองโหมดท็อป
- Kimi K3 เปิดน้ำหนักตามมาที่ 60 · Qwen3.8 Max ได้ 58 · Muse Spark 1.2 ได้ 57
- Google ยังตามอยู่ Gemini 3.6 Flash ได้ 52 · Gemini 3.1 Pro Preview ได้ 48

จุดเด่นจากชุดทดสอบของค่าย (เทียบ Fable 5 และ GPT Sol)
- ชนะงานเอกสาร/กฎหมาย Harvey LAB ที่ 15.8% สูงกว่า Sol ชัด
- นำ AA-Briefcase และ GDPVal ในชุดที่ค่ายเผย
- CursorBench 69.9% เกือบทัน Fable 70.5% และแซง Sol 67.2%
- ตามหลังชัดที่เทอร์มินัล (26% เทียบคู่แข่งราว 34%) และ DeepSWE (65.9% เทียบ Sol 73%)

คนใช้ต้องรู้อะไร
- ราคาเริ่มต้น 2 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 6 ดอลลาร์ขาออก รุ่นเร็วคิดเป็น 2 เท่า
- ถ้าพรอมต์ยาวเกิน 200,000 โทเคน ทั้งคำขอคิดราคาเป็น 4 / 12 ดอลลาร์
- หน้าต่างบริบท 500,000 โทเคน สั้นกว่าท็อปหลายค่ายที่ 1 ล้าน
- รับทั้งข้อความและรูป เลือกความพยายามคิดได้ 4 ระดับ ค่าเริ่มต้นคือ high
- น้ำหนักปิด ไม่ให้โหลดไปรันเอง ตัวเลขชุดใหญ่บางข้อมาจากค่ายเอง ต้องแยกจากคะแนนอิสระ

สรุป
Grok 4.6 ไม่ได้แย่งแชมป์ทุกข้อจาก Opus แต่ขึ้นไปอยู่ในกลุ่มท็อปแล้ว และเด็ดสุดตรงราคาต่อความเก่ง — ใครรันเอเจนต์ยาว ๆ ใน Cursor นี่คือตัวที่ทำให้บิลไม่พังง่ายอย่างคู่แข่งแถวหน้า
แหล่ง: xAI / Cursor / Artificial Analysis / เอกสารราคา xAI · 12 ส.ค. 2026
