مدل Soofi S پس از صدرنشینی در بنچمارکها با انتقاد آموزش بیشازحد مواجه شد
مدل زبانی Soofi S که توسط یک کنسرسیوم آلمانی با ۳۰ میلیارد پارامتر منتشر شده، پس از صدرنشینی در بنچمارکهای متنباز با انتقادهایی مواجه شده است. منتقدان استدلال میکنند که این مدل بهطور سنگینی با دادههای اضافی آموزش دیده و نتایج بنچمارک آن لزوماً بازتابدهنده عملکرد واقعی نیست.
ادعای آموزش بیشازحد
شواهد نشان میدهد که Soofi S با مجموعههای دادهای تمرینی گستردهای آموزش دیده که ممکن است شامل دادههای آزمون بنچمارکها نیز باشد. این انتقاد به مشکلی گستردهتر در جامعه هوش مصنوعی اشاره دارد که در آن بهینهسازی بیشازحد برای معیارهای ارزیابی میتواند تصویری غیرواقعی از توانایی مدل ایجاد کند.
چالش صداقت در بنچمارکها
این بحث بار دیگر ضرورت اصلاح معیارهای ارزیابی مدلهای زبانی را مطرح کرده است. بنچمارکهای فعلی ممکن است در برابر آموزش بیشازحد آسیبپذیر باشند و نتایج قابل اتکایی ارائه ندهند. جامعه پژوهشی نیاز به معیارهای جدیدی دارد که بتوانند عملکرد واقعی مدلها را در سناریوهای عملی ارزیابی کنند.
دیدگاهتان را بنویسید