مطالعه آنتروپیک درباره خودمختاری عاملها
خبرهای پراکنده زیادی در جریان است؛ از جذب سرمایههای عظیم ۱ میلیارد دلاری توسط World Labs (متعلق به فی-فی لی) و David Silver (از Era of Experience) گرفته تا مسدود کردن رسمی OpenClaw توسط آنتروپیک به دلیل استفاده از توکنهای OAuth کلود (مطابق با سیاستهای پس از OpenCode). جالب اینجاست که در همان روز، کارمندان OpenAI نیز با ادب و احترام به همه یادآوری کردند که میتوانند به جای آن از طرحهای OpenAI استفاده کنند (که البته مطمئنیم کاملاً تصادفی است!).
با این حال، همه اینها میگذرد. آنچه امروز میخواهیم مطرح کنیم، مطالعه آنتروپیک روی الگوهای استفاده از API خودش است: «سنجش خودمختاری عاملهای هوش مصنوعی در عمل». همانطور که انتظار میرود، بیشترین استفاده مربوط به کدنویسی است، اما با نگاهی به لیست سایر کاربردها، میتوان اهداف بعدی عاملهای هوش مصنوعی را پیشبینی کرد:
بخش عمده این پست درباره استفاده از Claude Code است. ما روایت آنتروپیک از «داستان افزایش خودمختاری» را میبینیم: شروع از ۲۵ دقیقه در ماه سپتامبر به بیش از ۴۵ دقیقه در ماه ژانویه؛ با یک افت که همزمان با جهش ناگهانی و ۲ برابری تعداد کاربران در ژانویه-فوریه ۲۰۲۶ بود و سپس با عرضه Opus 4.6 دوباره بهبود یافت.
این روایت تا حدودی متفاوت اما همسو با نمودار مشهور METR است. همانطور که در پادکست آیندهمان با آنها توضیح میدهیم، از آنجا که این نمودار به جای خودمختاریِ «دمدراز» (long tail) در اجرای خودکار Claude Code، نرخ موفقیت صدک ۵۰امِ «ساعتهای معادل انسانی» را در نظر میگیرد، روند بسیار متفاوت (و در نقاط نهایی، پرنوسان) را نشان میدهد که گویای انجام تقریباً ۵ ساعت کار انسانی توسط عاملهاست.

همانطور که آنتروپیک اشاره میکند:
«ارزیابی METR آنچه را که یک مدل در یک محیط ایدهآل، بدون تعامل انسانی و بدون پیامدهای دنیای واقعی قادر به انجامش است، ثبت میکند. اما اندازهگیریهای ما آنچه را در عمل اتفاق میافتد ثبت میکند؛ یعنی جایی که کلود برای دریافت بازخورد متوقف میشود و کاربران مداخله میکنند. همچنین، عدد پنج ساعتِ METR، دشواری وظیفه (مدت زمانی که یک انسان برای آن صرف میکند) را میسنجد، نه مدت زمانی که مدل واقعاً در حال اجراست.». اکثر نوبتهای (turns) Claude Code کوتاه هستند. میانه زمان هر نوبت حدود ۴۵ ثانیه است و این مدت زمان در چند ماه گذشته فقط نوسان جزئی داشته است (بین ۴۰ تا ۵۵ ثانیه). در واقع، تقریباً تمام صدکهای زیر ۹۹ام نسبتاً پایدار ماندهاند.
نکته دیگر اینکه چون آنتروپیک دسترسی کامل به تلهمتری (دورسنجی) Claude Code دارد، معیارهایی از خودمختاری را در اختیار دارد که هیچکس دیگری ندارد. برای مثال کاربران جدید با ۲۰٪ «تأیید خودکار» شروع میکنند و با کسب تجربه، این میزان به بیش از ۵۰٪ افزایش مییابد.

اگرچه آنها تقریباً دو برابر بیشتر از کاربران باسابقه، در کار مدل وقفه ایجاد میکنند:

همچنین تحلیل خوبی ارائه شده درباره اینکه چه زمانی «خودِ کلود» جریان کار را برای درخواست شفافسازی قطع میکند؛ این تحلیل شامل کالیبراسیون مناسب و دستهبندی دقیق دلایل همراه با فراوانی آنهاست.

باقی مطالب این پست بیشتر روی ایمنی (Safety) تمرکز دارد، اما مهندسان هوش مصنوعی میتوانند دادههای ارزشمند زیادی از همین آمار استفاده از عاملها استخراج کنند.
منبع: Anthropic
دیدگاهتان را بنویسید