Microsoft вивів свої моделі MAI-Image і MAI-Voice у публічне прев’ю — економія до 89% проти OpenAI

3 хв. читання

Що сталося

23 липня 2026 року підрозділ Microsoft AI відкрив публічне прев’ю двох власних моделей — генератора зображень MAI-Image-2.5-Pro та голосової моделі MAI-Voice-2-Flash. Компанія заявила, що перехід частини продуктів на ці моделі знижує витрати на GPU-інфраструктуру на десятки відсотків порівняно з рішеннями на базі OpenAI. Це черговий крок Microsoft до зменшення залежності від партнерства з OpenAI, хоча саме партнерство залишається чинним.

Деталі

MAI-Image-2.5-Pro — найточніша за якістю картинки модель Microsoft на сьогодні: вміє детальну генерацію та редагування зображень, включно з точним рендером тексту всередині картинки. Ціна в Microsoft Foundry — $5 за 1 млн вхідних текстових токенів, $8 за 1 млн вхідних токенів зображення та $106 за 1 млн вихідних токенів зображення. За даними Microsoft на 23 липня 2026 року, у PowerPoint перехід з моделі GPT-Image-2 від OpenAI на MAI-Image-2.5 знизив витрати на GPU приблизно на 84%. Модель уже повністю обслуговує Bing Image Creator і використовується в OneDrive для редагування зображень.

MAI-Voice-2-Flash — модель синтезу мовлення для сценаріїв із великим обсягом запитів і низькою затримкою (кол-центри, голосові агенти): удвічі швидша за попередню MAI-Voice-2 і на 32% дешевша — $15 за 1 млн символів. У корпоративному продукті Dynamics 365 Contact Center перехід на неї, за заявою Microsoft на 23 липня 2026 року, скоротив витрати на GPU до 89% порівняно з попереднім рішенням на базі OpenAI.

Генеральний директор Microsoft AI Мустафа Сулейман заявив, що власні моделі компанії «працюють швидше, коштують дешевше й видають вищу якість генерації», ніж альтернативи OpenAI. За даними Thurrott (24 липня 2026), моделі лінійки MAI тепер задіяні більш ніж у половині продуктів Microsoft.

Що це означає

Новина стосується передусім розробників, які будують рішення на Azure AI Foundry та в екосистемі Copilot, а також корпоративних клієнтів Dynamics 365 і PowerPoint — їм стає доступнішою дешевша генерація зображень і голосу без прямого звернення до API OpenAI. Для ринку загалом це сигнал, що найбільший клієнт та інвестор OpenAI дедалі активніше замінює її своїми моделями в рутинних, але масових завданнях (зображення в презентаціях, голос у кол-центрах), залишаючи OpenAI та Anthropic для складних сценаріїв у Copilot. Можливість для бізнесу — економія на інфраструктурі вже зараз: прев’ю та ціни в Microsoft Foundry доступні з 23 липня 2026 року, а масова міграція корпоративних клієнтів очікується протягом найближчих місяців.

Контекст

Власні моделі лінійки MAI Microsoft розвиває з 2025 року під керівництвом Мустафи Сулеймана, прагнучи знизити залежність від багатомільярдного партнерства з OpenAI, не розриваючи його для дійсно складних завдань. Раніше в цьому ж напрямку компанія відкрила FastContext — компактну модель-«розвідника» репозиторію для агентів програмування, а сама OpenAI тим часом зіткнулася з обмеженнями на публічний реліз своєї наступної моделі GPT.

Поділитися
Зв'язатися:
Крипто- та data-аналітик, інженер-програміст (факультет комп'ютерних наук ХНУРЕ). В IT з 2008 року: адміністрував корпоративний моніторинг у «Vodafone Україна», сім років розробляв і просував веб-проєкти, п'ять років керував маркетингом на метриках — конверсія, CTR, ROI, LTV.Криптовалютними ринками займаюся з 2021 року: ончейн-метрики, токеноміка, макроекономічні індикатори. Розробив власну data-driven модель аналізу ринку на 30+ метрик. Стек — Python (pandas, NumPy, SciPy, matplotlib), математична статистика та EDA; збір і звірку даних автоматизую AI-агентами.Принцип — «Don't trust, verify»: кожна цифра перевірена за першоджерелом, ключові — щонайменше за двома незалежними; прогнози — лише сценарії з умовами. Теза без даних не публікується.