تحقیقات جدید: افزایش سرعت استنباط ۳ برابری با تغییر در وزنهای LLM بدون استفاده از دیکدینگ حدسی
تیمی از دانشگاه مریلند، Lawrence Livermore، Columbia و TogetherAI روشی نوین برای افزایش 3 برابری سرعت پردازش مدلهای LLM (مدلهای زبان بزرگ) توسعه دادهاند که با افزودن یک توکن خاص به معماری مدلهای موجود، به ۳ برابر افزایش توان پردازشی دست یافتهاند. این روش برخلاف دیکدینگ حدسی (speculative decoding) نیازی به مدل جداگانه برای پیشنویس یا زیرساخت اضافی ندارد.
این رویکرد به یک مشکل مهم در روندهای کاری هوش مصنوعی عاملانه (agentic AI) پرداخته است، جایی که مدلهای استدلال هزاران توکن زنجیرهای تولید میکنند تا به پاسخ نهایی برسند. یکی از همکاران این تحقیق گفته است که تأخیر (latency) به همان اندازه که توان پردازشی کلی (throughput) اهمیت پیدا کرده است، به خصوص با افزایش استفاده از ردیابیهای تفکر بلندمدت.
این پیشرفت میتواند به طور چشمگیری سرعت پردازش در پروژههای هوش مصنوعی و آموزش هوش مصنوعی در سطح مدلهای زبان بزرگ را بهبود بخشد، و تغییرات قابل توجهی در زمان پاسخدهی به مدلهای پیچیده ایجاد کند.
تیم اُنلیکدز در روزهای آینده یک مقاله تحلیلی درباره این روش منتشر خواهد کرد.
دیدگاهتان را بنویسید