กลับไปข่าว AI Game
ข่าวเกม AI

OpenGameEval ทดสอบเอเจนต์ทำงานใน Roblox Studio พบยังติดโจทย์สร้างเกมหลายแบบ

โดย GameSlash

ทดสอบโมเดล 13 ตัวกับงานหลัก 84 งานใน Roblox Studio วัดทั้งผลสำเร็จและการสำรวจฉาก พร้อมเปิดชุดทดสอบและปลั๊กอิน

AI Gameงานวิจัย

OpenGameEval นำเอเจนต์ภาษาไปทำงานใน Roblox Studio แล้วตรวจทั้งฉากที่แก้และผลระหว่างเล่นจำลอง งานวิจัยเผยแพร่บน arXiv วันที่ 1 ตุลาคม 2026 เพื่อวัดการสร้างเกมในสภาพแวดล้อมที่มีสถานะต่อเนื่อง แทนการดูโค้ดหรือคำตอบสุดท้ายเพียงอย่างเดียว

ฉากทดสอบใน Roblox Studio จากภาพประกอบงานวิจัย OpenGameEval
ภาพฉากทดสอบใน Roblox Studio จากงานวิจัย OpenGameEval | ที่มา: Eray Turkel และคณะ / Roblox, arXiv:2610.02563

ทีมทดสอบโมเดล 13 ตัวกับงานหลัก 84 งานที่คนคัดไว้ โดยทดลอง 16 ครั้งต่อโจทย์ โมเดลที่ดีที่สุดทำสำเร็จ 51.7% ในการลองครั้งเดียว และทำสำเร็จครบห้าครั้งจากห้าครั้งได้ 39.4% ยังมีหกโจทย์ที่ไม่มีโมเดลในชุดทดสอบทำสำเร็จ

สำรวจฉากก่อนแก้ ช่วยเพิ่มโอกาสผ่าน

ผลที่ทีมรายงานพบว่าเอเจนต์ซึ่งตรวจวัตถุที่เกี่ยวข้องก่อนลงมือแก้มีโอกาสผ่านมากกว่า นอกจากผลสุดท้าย กรอบทดสอบนี้จึงเก็บพฤติกรรมระหว่างทำงานด้วย เพื่อดูว่าเอเจนต์ค้นหาข้อมูลที่จำเป็นครบหรือไม่

ทีมเปิดชุดงาน ไฟล์ฉาก คำอธิบายรายงาน ปลั๊กอิน และตารางผลภายใต้ MIT ผู้พัฒนาจึงนำไปศึกษาหรือทดสอบต่อได้ โดยคะแนนที่รายงานยังเป็นผลของชุดโจทย์เฉพาะนี้

ข้อมูลและชุดทดสอบ: OpenGameEval บน arXiv · Roblox / open-game-eval บน GitHub

ดูแหล่งที่มา