OpenGameEval ทดสอบเอเจนต์ทำงานใน Roblox Studio พบยังติดโจทย์สร้างเกมหลายแบบ
โดย GameSlash
ทดสอบโมเดล 13 ตัวกับงานหลัก 84 งานใน Roblox Studio วัดทั้งผลสำเร็จและการสำรวจฉาก พร้อมเปิดชุดทดสอบและปลั๊กอิน
OpenGameEval นำเอเจนต์ภาษาไปทำงานใน Roblox Studio แล้วตรวจทั้งฉากที่แก้และผลระหว่างเล่นจำลอง งานวิจัยเผยแพร่บน arXiv วันที่ 1 ตุลาคม 2026 เพื่อวัดการสร้างเกมในสภาพแวดล้อมที่มีสถานะต่อเนื่อง แทนการดูโค้ดหรือคำตอบสุดท้ายเพียงอย่างเดียว

ทีมทดสอบโมเดล 13 ตัวกับงานหลัก 84 งานที่คนคัดไว้ โดยทดลอง 16 ครั้งต่อโจทย์ โมเดลที่ดีที่สุดทำสำเร็จ 51.7% ในการลองครั้งเดียว และทำสำเร็จครบห้าครั้งจากห้าครั้งได้ 39.4% ยังมีหกโจทย์ที่ไม่มีโมเดลในชุดทดสอบทำสำเร็จ
สำรวจฉากก่อนแก้ ช่วยเพิ่มโอกาสผ่าน
ผลที่ทีมรายงานพบว่าเอเจนต์ซึ่งตรวจวัตถุที่เกี่ยวข้องก่อนลงมือแก้มีโอกาสผ่านมากกว่า นอกจากผลสุดท้าย กรอบทดสอบนี้จึงเก็บพฤติกรรมระหว่างทำงานด้วย เพื่อดูว่าเอเจนต์ค้นหาข้อมูลที่จำเป็นครบหรือไม่
ทีมเปิดชุดงาน ไฟล์ฉาก คำอธิบายรายงาน ปลั๊กอิน และตารางผลภายใต้ MIT ผู้พัฒนาจึงนำไปศึกษาหรือทดสอบต่อได้ โดยคะแนนที่รายงานยังเป็นผลของชุดโจทย์เฉพาะนี้
ข้อมูลและชุดทดสอบ: OpenGameEval บน arXiv · Roblox / open-game-eval บน GitHub