آپدیت Gemini 3 Deep Think با ریتینگ نجومی در Codeforces
اگر فکر میکردید رقابت در دنیای هوش مصنوعی کمی آرام گرفته است، گوگل دیپمایند با انتشار آپدیت جدید برای حالت تخصصی استدلال خود یعنی Gemini 3 Deep Think، دوباره بازی را تغییر داد. این مدل توانسته در پیچیدهترین آزمونهای هوش مصنوعی و برنامهنویسی رقابتی، رکوردهایی ثبت کند که تا پیش از این دستنیافتنی به نظر میرسیدند.
درهمشکستن بنچمارکها؛ یک سر و گردن بالاتر از رقبا
بر اساس گزارش رسمی گوگل، نسخه جدید Deep Think در بنچمارکهای کلیدی به شکل چشمگیری از رقبای قدرتمندی مثل Claude Opus 4.6 پیشی گرفته است:
-
آزمون ARC-AGI-2: کسب امتیاز 84.6% (در مقایسه با امتیاز 68.8% کلود اپوس 4.6). این بنچمارک یکی از سختترین معیارها برای سنجش توانایی هوش مصنوعی در استنتاج و حل مسائل جدید است.
-
آزمون نهایی بشریت (Humanity’s Last Exam): ثبت امتیاز 48.4%.
-
المپیادهای علمی ۲۰۲۵: کسب نتایج معادل مدال طلا در المپیادهای فیزیک و شیمی.
ریتینگ 3,455 در Codeforces؛ رویای برنامهنویسان رقابتی
برای جامعه برنامهنویسان، جذابترین بخش این آپدیت، عملکرد مدل در پلتفرم Codeforces است. مدل Gemini 3 Deep Think توانسته به ریتینگ شگفتانگیز 3,455 Elo دست پیدا کند! (برای مقایسه، Claude Opus 4.6 ریتینگ 2,352 را ثبت کرده بود).
این اختلاف فاحش نشان میدهد که هوش مصنوعی گوگل دیگر فقط کدهای ساده تولید نمیکند، بلکه میتواند الگوریتمهای پیچیده و مسائل المپیادی ساختار داده را در سطح برترین نوابغ انسانی تحلیل و حل کند.
کاربرد در دنیای واقعی: مچگیری از داوران انسانی!
این توانایی استدلالی بالا فقط روی کاغذ نیست. در یکی از تستهای اولیه، ریاضیدانان دانشگاه راتگرز (Rutgers) از قابلیت Deep Think استفاده کردند تا یک نقص منطقی پنهان را در یک مقاله علمی پیدا کنند؛ نقصی که حتی داوران متخصص انسانی (Human Peer Review) هم در بررسیهای خود متوجه آن نشده بودند.
نحوه دسترسی (چالش همیشگی برای ما)
در حال حاضر، این قابلیت قدرتمند برای مشترکین Google AI Ultra فعال شده است. همچنین گوگل برای اولین بار، دسترسی به API این مدل استدلالی را برای گروه منتخبی از پژوهشگران و سازمانها (Enterprises) باز کرده است.
البته مثل همیشه، برنامهنویسان و پژوهشگران داخل ایران برای دسترسی به این ابزار نیازمند دور زدن محدودیتهای تحریمی و تهیه اشتراکهای ارزی خواهند بود، اما قطعاً استفاده از مدلی با این سطح از توانایی حل مسئله، ارزش این چالشها را دارد.
دیدگاهتان را بنویسید