مدل GLM-5 از z.ai: رکورد کمترین «توهم» در هوش مصنوعی
استارتاپ چینی z.ai (با نام شناختهشده Zhipu) به تازگی مدل GLM-5 را با ۷۴۴ میلیارد پارامتر و تحت لایسنس MIT (متنباز) منتشر کرده است. تیتر اصلی خبرها یک ادعای بزرگ است: کمترین نرخ توهم (Hallucination) در میان تمام مدلهای آزمایششده در بنچمارک معتبر Artificial Analysis. روی کاغذ همهچیز عالی به نظر میرسد؛ یک مدل متنباز که در بنچمارک توهم با اختلاف ۳۵ امتیاز رکورد میشکند و هزینهاش یکششمِ Claude Opus است. اما به عنوان توسعهدهنده، باید بدانیم زیر پوست این آمار چه میگذرد.
معماری: قدرت ۷۴۴ میلیاردی با هزینه مدلهای کوچک
این مدل از معماری «ترکیب خبرگان» (Mixture-of-Experts یا MoE) استفاده میکند. به این معنا که اگرچه مدل در مجموع ۷۴۴ میلیارد پارامتر دارد، اما برای تولید هر توکن تنها حدود ۴۰ میلیارد پارامتر (حدود ۵ درصد) آن فعال میشوند.
نتیجه؟ شما به دانش یک غول ۷۴۴ میلیاردی دسترسی دارید، اما هزینه پردازشی که میپردازید در حد یک مدل ۴۰ میلیاردی است. به همین دلیل است که z.ai میتواند برای هر یک میلیون توکن ورودی تنها ۰.۸۰ تا ۱ دلار هزینه دریافت کند؛ در حالی که این رقم برای مدلی مثل Claude Opus حدود ۵ دلار است.
معنی واقعی «رکورد کمترین توهم» چیست؟
امتیاز این مدل از پلتفرم مستقل Artificial Analysis و شاخص AA-Omniscience به دست آمده است. این شاخص دو فاکتور را میسنجد:
-
مدل چقدر در مواقعی که جواب را نمیداند از پاسخ دادن خودداری میکند (Abstention).
-
وقتی پاسخ میدهد، چقدر از نظر واقعی درست است.
مدل GLM-5 در این شاخص نمره ۱- را گرفت که ۳۵ امتیاز بهتر از نسل قبلی خود (GLM-4.5) است. اما دقت کنید: این به معنای این نیست که این مدل در پروژههای شما اصلاً توهم نخواهد داشت!
نکته ظریف اینجاست که امتیاز کلی GLM-5 (همان ۱-) از مدلهایی مثل Gemini 3 Pro Preview (با نمره ۱۳) یا Claude Opus 4.6 (با نمره ۱۱) پایینتر است. مدلهای دیگر چون به سوالات بیشتری پاسخ درست میدهند، نمره کلی بالاتری دارند. ادعای GLM-5 فقط مربوط به «نرخ توهم» است؛ یعنی این مدل استراتژی محافظهکارانهای دارد و ترجیح میدهد به جای حدس زدن و تولید اطلاعات غلط، خیلی راحت بگوید: «نمیدانم». این یک بدهبستان است: پاسخهای غلط کمتر، اما تعداد پاسخهای نهایی هم کمتر!
جایگاه واقعی GLM-5 در بازار کجاست؟
-
در برنامهنویسی: در بنچمارک SWE-bench Verified نمره ۷۷.۸ را کسب کرده که بسیار نزدیک به Claude Opus 4.5 (با نمره ۸۰.۹) است.
-
در عملکرد تجاری: در بنچمارک Vending Bench 2 (شبیهساز مدیریت یکساله یک کسبوکار)، در میان تمام مدلهای متنباز رتبه اول را کسب کرد.
-
نتیجهگیری: GLM-5 در حال حاضر احتمالاً بهترین مدل با وزنهای باز (Open-weight) است. آیا به پای بهترین مدلهای بسته میرسد؟ هنوز نه، اما فاصله در حال کم شدن است.
زبانهای غیرانگلیسی
یک ابهام بزرگ برای ما در ایران این است که عملکرد این مدل در زبانهای دیگر (مثل فارسی یا حتی خود چینی) چگونه است. وبلاگ z.ai جزئیاتی از تفکیک زبانها منتشر نکرده و عملکرد مدلهای MoE به شدت به ترکیب دادههای آموزشی آنها وابسته است.
فناوری زیرساختی: Slime چیست؟
یکی از بزرگترین دستاوردهای z.ai، توسعه زیرساخت آموزشی اختصاصی به نام Slime است. در روشهای سنتی یادگیری تقویتی (RL)، گلوگاههای تولید محتوا بیش از ۹۰٪ زمان آموزش را هدر میدهند.
فریمورک Slime (که روی گیتهاب متنباز شده) با اجرای غیرهمگام (Asynchronous)، این انتظار را از بین برده و به پردازندههای گرافیکی اجازه میدهد بدون بیکاری به کار خود ادامه دهند. این یعنی سرعت بالای آموزش و بهروزرسانی مدل.
آمار مستقل در برابر ادعاهای سازنده
برای اینکه دید واقعبینانهای داشته باشیم، باید آمار را تفکیک کنیم:
آنچه مستقلاً تایید شده (توسط Artificial Analysis):
-
معماری ۷۴۴ میلیارد پارامتری (۴۰ میلیارد فعال).
-
کمترین نرخ توهم در میان مدلهای تست شده.
-
شاخص هوش (Intelligence Index) برابر ۵۰ (اولین مدل متنباز که به این عدد میرسد).
-
رتبه سوم در ساختار ایجنتی (پشت سر Claude Opus 4.6 و GPT-5.2).
-
پشتیبانی صرفاً متنی (بدون تصویر) با پنجره کانتکست ۲۰۰ هزار توکنی.
-
حجم مدل حدود ۱.۵ ترابایت (نیاز به حدود ۱۴۹۰ گیگابایت حافظه VRAM برای اجرا در حالت BF16).
آنچه سازنده ادعا کرده (هنوز توسط جامعه کاربری اعتبارسنجی نشده):
-
نمرات بنچمارکهای SWE-bench و Vending Bench.
-
بهبود چشمگیر در برنامهنویسی فرانتاند و بکاند نسبت به نسل قبل.
-
افزایش دادههای پیشآموزش از ۲۳ تریلیون به ۲۸.۵ تریلیون توکن.
زنگ خطر برای APIهای گرانقیمت
استفاده از این مدل از طریق API رسمی z.ai تنها ۱ دلار برای ورودی و ۳.۲۰ دلار برای خروجی (به ازای هر یک میلیون توکن) هزینه دارد. لایسنس MIT به این معناست که شرکتها میتوانند بدون محدودیت تجاری آن را فاینتیون کرده و روی سرورهای خود دیپلوی کنند؛ مزیتی بزرگ برای شرکتهای ایرانی که با چالشهای تحریم و پرداخت ارزی مواجهاند.
نکته جذاب دیگر برای سازمانها، حالت Agentic بومی این مدل است که میتواند مستقیماً فایلهای docx.، pdf. و xlsx. را تولید کند.
GLM-5 در حال حاضر قویترین مدل متنباز بازار است. شاید هنوز به تاج و تخت مدلهای بسته نرسیده باشد، اما با توجه به قیمت یکپنجمی آن، اگر یک جهش دیگر مانند این رخ دهد، توجیه پرداخت ۵ تا ۲۵ دلار برای APIهای اختصاصی بسیار سخت خواهد شد.
منبع
دیدگاهتان را بنویسید