مایکروسافت دو مدل تازه رونمایی کرد: MAI-Image-2.5-Pro و MAI-Voice-2-Flash
راستش رو بخوای، این روزها هر هفته یه خبر تازه از دنیای هوش مصنوعی میرسه که باید بشینی و ببینی به کارت میاد یا نه. یکی از خبرهایی که به نظرمون واقعاً ارزش وقت گذاشتن داره، اعلام دو مدل جدید تیم Microsoft AI است: MAI-Image-2.5-Pro برای تولید و ویرایش تصویر، و MAI-Voice-2-Flash برای تبدیل متن به گفتار. هر دو از پنجشنبه (۲۳ ژوئیه ۲۰۲۶) وارد پیشنمایش عمومی شدن. اگه تو مسیر مهندسی هوش مصنوعی هستی یا داری دنبال منابع خوب برای آموزش هوش مصنوعی میگردی، دونستن اینجور تحولات کمک میکنه انتخاب ابزار برات سادهتر بشه — چون قیمت و کیفیت این مدلها مستقیم روی تصمیمهایی که تو پروژههای واقعی میگیری اثر میذاره.
خلاصهی خیلی سریع
- MAI-Image-2.5-Pro: باکیفیتترین مدل تصویرسازی مایکروسافت تا امروز، مناسب ویرایش دقیق و رندر متن داخل تصویر. قیمت: ۵ دلار به ازای هر میلیون توکن متنی ورودی، ۸ دلار برای توکن تصویری ورودی، ۱۰۶ دلار برای هر میلیون توکن خروجی تصویری.
- MAI-Voice-2-Flash: نسخهی سریع و ارزانتر MAI-Voice-2، دو برابر سریعتر و ۳۲٪ ارزانتر (۱۵ دلار به ازای هر میلیون کاراکتر)، بدون افت محسوس در طبیعی بودن صدا.
- هر دو از طریق Microsoft Foundry در دسترساند و همین حالا در محصولاتی مثل Bing، PowerPoint، OneDrive و Dynamics 365 در حال کارن.
چرا مایکروسافت داره مدل خودشو میسازه؟
این خبر یهویی از آسمون نیفتاده. حدود یک سال پیش، مایکروسافت اعلام کرد میخواد بهجای تکیهی کامل به مدلهای شرکتهای دیگه (مثل خانوادهی GPT از OpenAI)، مدلهای خودش رو از صفر و روی دادههای تمیز و قابل ردیابیِ خودشون آموزش بده. اون موقع خیلیها این حرکت رو یه پروژهی جانبی میدیدن. الان اما دیگه اینطور نیست: طبق گفتهی خود مایکروسافت، این مدلها همین حالا میلیونها کاربر رو تو محصولات روزمرهشون پوشش میدن.
MAI-Image-2.5-Pro؛ وقتی کیفیت حرف اول رو میزنه
این مدل برای جاهایی طراحی شده که نمیشه سر کیفیت کوتاه اومد: تصاویر شاخص برای کمپینها، ویرایشهای ریز و دقیق، و از همه مهمتر، نوشتن متن داخل تصویر با دقتی که تا حالا کم دیده بودیم. یه نکتهی جالب اینه که این مدل دستورهای ویرایشی به زبان طبیعی رو میفهمه؛ یعنی میتونی به جای پرامپتنویسی فنی، با یه جملهی عادی بگی چی رو عوض کنه.
قیمتگذاریش هم اینطوریه:
- ۵ دلار به ازای هر ۱ میلیون توکن ورودی متنی
- ۸ دلار به ازای هر ۱ میلیون توکن ورودی تصویری
- ۱۰۶ دلار به ازای هر ۱ میلیون توکن خروجی تصویری
اگه بخوایم تاریخچهش رو مرور کنیم: نسخهی اول (MAI-Image-1) مهر ۱۴۰۴ اومد بیرون و تو رتبهبندی Arena نهم شد؛ MAI-Image-2 فروردین ۱۴۰۵ به رتبهی سوم رسید؛ و MAI-Image-2.5 اردیبهشت همون سال، هم تو تصویرسازی سوم شد هم تو ویرایش تصویر دوم. نسخهی Pro که تازه اومده، همون خط رو با یه پله کیفیت بالاتر ادامه میده.
MAI-Voice-2-Flash؛ این یکی سرعت رو انتخاب کرده
اگه MAI-Image-2.5-Pro دنبال حداکثر کیفیته، MAI-Voice-2-Flash دقیقاً برعکسشه: طراحیشده برای جاهایی که باید سریع جواب بدی و حجم بالا رو پوشش بدی — مثل مراکز تماس یا دستیارهای صوتی زنده. این مدل که اول تو رویداد Build معرفی شده بود، حالا وارد پیشنمایش عمومی شده.
دو برابر سریعتر از MAI-Voice-2 هست و ۳۲٪ ارزونتر تموم میشه (۱۵ دلار به ازای هر میلیون کاراکتر)، اما طبیعی بودن لحن و کیفیت صوتی رو حفظ کرده. از طریق Azure Speech و سرویس Azure Voice Live در دسترسه و برای ساخت ایجنتهای صوتیِ گفتگومحور مناسبه.
این مدلها الان دقیقاً کجا دارن کار میکنن؟
اینجا بود که کار جالب شد؛ مایکروسافت فقط اعلام نکرده «دو تا مدل جدید داریم»، بلکه نشون داده همین الان کجاها استفاده میشن:
- Bing Image Creator الان صددرصد روی MAI-Image-2.5 میچرخه.
- تو PowerPoint، قابلیت تصویر-به-تصویر با همین مدل، هزینهی GPU رو نسبت به GPT-Image-2 تا ۸۴٪ پایین آورده.
- تو OneDrive، این مدل الان پیشفرض ویرایش تصویره؛ نرخ ذخیرهسازی کاربرا ۲۶٪ رفته بالا و تأخیر هم حدود ۲۵٪ کم شده.
- MAI-Voice-2-Flash موتور صوتی Dynamics 365 Contact Center شده — همون پلتفرمی که شرکتهایی مثل T-Mobile و easyJet برای مرکز تماسشون استفاده میکنن — و هزینهی GPU رو تا ۸۹٪ کم کرده.
- تو حوزهی تخصصیتر، مدل رونویسی MAI-Transcribe-1.5 با Dragon Copilot (که ۱۷۰ هزار ارائهدهندهی خدمات درمانی ازش استفاده میکنن) ادغام شده و خطای رونویسی رو تو ۵۸ زبان تا ۵۰٪ کم کرده.
این خبر چه ربطی به آموزش هوش مصنوعی و کار عملی ما داره؟
خب، اینجا میرسیم به بخشی که برامون مهمتره. برای هرکسی که داره مهندسی هوش مصنوعی رو جدی دنبال میکنه — چه با ابزارهای آماده کار کنه چه بخواد ایجنت خودشو بسازه — این خبر یعنی یه گزینهی جدید رو میز اضافه شده. دقیقاً همونطور که تیمهایی مثل Black Forest Labs اسکیلهای تولید تصویر با FLUX رو برای Hermes Agent منتشر کردن، حالا مدلهای تازهی مایکروسافت هم از طریق Azure AI Foundry قابل وصلشدن به ایجنتها هستن. یعنی وقتی داری رو یه پروژهی واقعی تصمیم میگیری کدوم مدل تصویر یا صدا رو به ایجنتت وصل کنی، الان یه گزینهی رقابتیتر داری.
اگه تازه داری وارد این حوزه میشی و دنبال یه نقطهی شروع درست برای آموزش هوش مصنوعی هستی، دونستن اینکه چطور شرکتهای بزرگ مدلها رو قیمتگذاری، جابهجا و در محصول واقعی پیاده میکنن، دقیقاً همون چیزیه که تو دورههای عملی مهندسی هوش مصنوعی روش کار میشه — نه فقط تئوری، بلکه تصمیمگیری واقعی روی هزینه، سرعت و کیفیت.
سوالات متداول
MAI-Image-2.5-Pro دقیقاً چیه؟ باکیفیتترین مدل تصویرسازی مایکروسافت تا امروزه؛ برای تولید تصاویر حرفهای، ویرایش دقیق و نوشتن متن داخل تصویر ساخته شده و از طریق Microsoft Foundry در دسترسه.
هزینهی استفاده از MAI-Voice-2-Flash چقدره؟ ۱۵ دلار به ازای هر ۱ میلیون کاراکتر؛ نسبت به مدل استاندارد MAI-Voice-2، هم دو برابر سریعتره هم ۳۲٪ ارزونتر.
این مدلها رو از کجا میشه امتحان کرد؟ از طریق کاتالوگ مدلهای Microsoft Foundry، مستندات Microsoft Learn، یا مستقیم تو MAI Playground.
چه فرقی بین MAI-Image-2.5 و MAI-Image-2.5-Pro هست؟ نسخهی Pro، نسخهی سنگینتر و باکیفیتتر همون خانواده برای کاربردهای حرفهایه؛ MAI-Image-2.5 معمولی همچنان تو محصولاتی مثل Bing و PowerPoint فعاله.
این خبر چه ربطی به یادگیری مهندسی هوش مصنوعی داره؟ دنبال کردن اینجور رونماییها کمک میکنه یاد بگیری چطور بین مدلهای مختلف، بر اساس هزینه و سرعت و کیفیت، انتخاب درست بکنی — همون مهارتی که تو آموزش هوش مصنوعی عملی روش کار میشه.
منبع: بلاگ رسمی Microsoft AI، Microsoft Tech Community (Azure AI Foundry Blog)
دیدگاهتان را بنویسید