Schema عملکرد ۹۹ درصدی خود در ARC-AGI-3 را گزارش کرد
سیستمی به نام Schema خود گزارش عملکرد ۹۸.۹۸ درصدی Relative Human Action Efficiency در مجموعه عمومی ARC-AGI-3 ارائه کرده که بسیار بالاتر از مدلهای مرزی موجود است. این سیستم از Opus 4.8 آنتروپیک به عنوان مدل پایه استفاده میکند و عملکرد قابل توجهی در حل مسائل استدلالی انتزاعی نشان داده است.
ARC-AGI-3 و معیارهای هوش عمومی
ARC-AGI-3 یکی از چالشبرانگیزترین بنچمارکها برای ارزیابی هوش عمومی مصنوعی است که بر حل مسائل جدید و انتزاعی تمرکز دارد. دستیابی به نزدیک ۹۹ درصد در این مجموعه دستاوردی بیسابقه محسوب میشود. با این حال، برخی کارشناسان در مورد اعتبار گزارشهای خودی تردید دارند و خواستار ارزیابی مستقل هستند.
شکاف بین عملکرد خودی و مستقل
سابقه نشان داده که نتایج خودگزارششده مدلها ممکن است با ارزیابیهای مستقل متفاوت باشد. جامعه هوش مصنوعی نیاز به پروتکلهای استاندارد ارزیابی دارد که از تورم نتایق جلوگیری کند. با این وجود، پیشرفتهای اخیر در توانایی استدلال انتزاعی مدلهای زبانی قابل توجه است و مسیر جدیدی را برای توسعه هوش مصنوعی عمومی نشان میدهد.
دیدگاهتان را بنویسید