نبرد مدلهای زبانی در بنچمارک LLM Skirmish: سرفصلی تازه برای دورههای آموزش هوش مصنوعی
۴ فوریه ۲۰۲۶ (۱۵ بهمن ۱۴۰۴): در جدیدترین تحولات دنیای فناوری، پژوهشگران بنچمارک نوآورانهای تحت عنوان LLM Skirmish را معرفی کردهاند که رویکردی کاملاً متفاوت برای ارزیابی مدلهای زبانی بزرگ (LLMs) ارائه میدهد. در این پلتفرم، مدلهای هوش مصنوعی پیشرو به جای پاسخگویی به سوالات متنی استاندارد، در یک بازی استراتژی همزمان (RTS) به صورت یک-به-یک با یکدیگر رقابت میکنند.
امروزه بررسی ساختار چنین رقابتهایی به یک ضرورت در سرفصلهای تخصصی آموزش هوش مصنوعی تبدیل شده است؛ چرا که به مهندسان، دانشجویان و توسعهدهندگان سیستمهای هوشمند نشان میدهد چگونه این مدلها در محیطهای پویا کدنویسی کرده و با یادگیری از خطاهای خود، استراتژیهایشان را در لحظه تغییر میدهند.
چرا بررسی بازیها در مسیر آموزش هوش مصنوعی اهمیت دارد؟
در سالهای اخیر، استفاده از بازیهای ویدیویی برای سنجش توانمندی هوش مصنوعی رواج زیادی یافته است. با این حال، کارشناسان همواره به یک تضاد عجیب اشاره میکردند: مدلهایی که قادر به نگارش پروژههای پیچیده برنامهنویسی هستند، گاهی در عبور از یک مرحله ساده در بازیهایی مانند Pokemon Red ناتوان میمانند. درک دلایل این شکستها، یکی از مباحث کلیدی در کلاسهای پیشرفتهی آموزش هوش مصنوعی برای عیبیابی (Debugging) سیستمهاست.
بنچمارک LLM Skirmish برای رفع این تضاد و با تمرکز بر مهارت اصلی این مدلها یعنی «کدنویسی» طراحی شده است. این بنچمارک با الهام از بازی متنباز Screeps (یک بازی استراتژی آنلاین ویژه برنامهنویسان) محیطی را فراهم کرده که در آن، مدلهای زبانی استراتژیهای جنگی خود را در قالب کدهای جاوا اسکریپت نوشته و در محیط بازی اجرا میکنند.
جدول ردهبندی مسابقات: پیشتازی کلود و چالشهای جمنای
بر اساس دادههای منتشر شده از این مسابقات، ردهبندی ۵ مدل برتر جهان در این بنچمارک به شرح زیر است:
| رتبه | مدل ارزیابیشده | پیروزی | شکست | درصد پیروزی | امتیاز ELO |
| ۱ | Claude Opus 4.5 | ۸۵ | ۱۵ | ۸۵٪ | ۱۷۷۸ |
| ۲ | GPT 5.2 * | ۶۸ | ۳۲ | ۶۸٪ | ۱۶۲۵ |
| ۳ | Grok 4.1 Fast | ۳۹ | ۶۱ | ۳۹٪ | ۱۴۲۷ |
| ۴ | GLM 4.7 | ۳۲ | ۶۸ | ۳۲٪ | ۱۳۷۲ |
| ۵ | Gemini 3 Pro | ۲۶ | ۷۴ | ۲۶٪ | ۱۲۹۷ |
(مدل GPT 5.2 در این ارزیابی با سطح استدلال “High” اجرا شده است).
ساختار مسابقات و آزمون «یادگیری درونمتنی»
قوانین بازی به این شکل است که هر بازیکن نبرد را با یک ساختمان تولید نیرو (Spawn)، یک واحد نظامی و سه واحد اقتصادی آغاز میکند و هدف نهایی، نابودی پایگاه حریف در کمتر از ۲۰۰۰ فریم است.
این تورنمنت در ۵ راند برگزار میشود. ویژگی کلیدی این مسابقات، سنجش قابلیت یادگیری درونمتنی (In-context Learning) است. از راند دوم به بعد، پلتفرم (که بر بستر محیط متنباز OpenCode اجرا میشود) لاگ و نتایج مسابقات قبلی را در اختیار مدلها قرار میدهد تا کدهای خود را اصلاح کنند. در صورت بروز خطا در کدنویسی، هر مدل تا ۳ بار فرصت دیباگ (رفع باگ) دارد.
نتایج نشان میدهد که ۴ مدل از ۵ مدل ارزیابی شده، با تحلیل دادههای مراحل قبل، درصد پیروزی خود را در راند پنجم نسبت به راند اول به شکل چشمگیری افزایش دادهاند (کلود ۲۰٪، جیالام ۱۶٪، جیپیتی ۷٪ و گراک ۶٪ رشد داشتهاند).
تحلیل رفتار مدلها؛ بهترین مطالعه موردی برای مهندسان فردا
اساتید و متخصصان فعال در حوزه آموزش هوش مصنوعی تاکید دارند که تحلیل لاگها و خطاهای این مدلها، بهترین مطالعه موردی (Case Study) برای برنامهنویسان آینده است:
-
مدل Claude Opus 4.5 (حاکم اواخر بازی): این مدل با استراتژی Kiting (عقبنشینی تاکتیکی همزمان با شلیک) از راند دوم به بعد به یک رقیب بلامنازع تبدیل شد و بالاترین امتیاز را کسب کرد، هرچند پرهزینهترین مدل این رقابتها بود (۴.۱۲ دلار در هر راند).
-
مدل GPT 5.2 (چالشگر قدرتمند): این مدل با تولید کدهای طولانی و استراتژی استفاده از زمینهای باتلاقی، تنها مدلی بود که توانست در راندهای پایانی کلود را شکست دهد. با این حال، تمایل این مدل به پیچیدهسازی بیش از حد کدها (Overengineering) در برخی مواقع باعث شکست آن شد؛ خطایی که بررسی آن در کارگاههای آموزش هوش مصنوعی بسیار آموزنده است.
-
مدل Grok 4.1 Fast (تاکتيسين اقتصادی): این مدل با مصرف توکنهای ارزان و استدلالهای کوتاه، با هزینهای ۳۷ برابر کمتر از مدل اول، جایگاه سوم را کسب کرد. استراتژی محبوب آن استفاده از نیروهای سریع با قدرت بالا اما آسیبپذیر (Glass Cannons) بود.
-
مدل GLM 4.7 (مینیمالیست عملگرا): این مدل بدون استفاده از استراتژیهای پیچیده و تنها با اولویتبندی صحیح تهدیدات، شیب یادگیری بسیار خوبی را به ثبت رساند.
-
مدل Gemini 3 Pro (شگفتیساز ناکام): این مدل در راند اول (۷۱٪ پیروزی) با استراتژیهای ساده و تهاجمی خود همه را غافلگیر کرد. اما در راندهای بعدی با پدیدهای موسوم به «پوسیدگی کانتکست» (Context Rot) مواجه شد؛ به این معنا که با تزریق بیش از حد اطلاعات راندهای قبلی به حافظه موقت خود، در پردازش اطلاعات دچار سردرگمی شد و افت شدیدی را تجربه کرد.
در رابطه با بازی جنگ میتوانید تلاش پنتاگون برای دستیابی به مدلهای بدون محدودیت را مطالعه کنید.
دیدگاهتان را بنویسید