Що сталося
27 липня 2026 року Microsoft представила MAI-Cyber-1-Flash — свою першу модель, спеціально навчену під кібербезпеку, і Project Perception, платформу, де захистом займаються автономні агенти. Модель розробив власний ШІ-підрозділ компанії MAI.
Заявлений результат: звʼязка агентного сканера MDASH із новою моделлю набирає 96% на бенчмарку CyberGym — на 12 пунктів вище за Mythos від Anthropic — і при цьому коштує приблизно вдвічі дешевше в прогоні, ніж нинішня конфігурація MDASH.
Деталі
CyberGym — це набір із 1507 реальних завдань на відтворення вразливостей, зібраних по 188 проєктах із відкритим кодом з OSS-Fuzz. Перевіряється не ерудиція моделі, а здатність розібратися у великій чужій кодовій базі й знайти в ній справжню дірку. Попередня версія MDASH набирала на ньому 88,45%.
Сама модель — компактна похідна від MAI-Thinking-1, донавчена на коді та на власних записах Microsoft про знайдені експлойти та їх виправлення. Працює вона не наодинці: приблизно 90% навантаження закриває сама, а найважчі 10% передає на GPT-5.4 від OpenAI. Економія досягається саме цим розподілом — дорога фронтирна модель вмикається лише там, де без неї не обійтися.
Project Perception розкладає захист на три ролі: «червоні» агенти шукають шляхи зламу, «сині» розбирають сигнали й розставляють пріоритети, «зелені» пишуть і викочують виправлення. Публічне превʼю відкривається 3 серпня 2026 року — спершу всередині Microsoft Defender; тоді ж MAI-Cyber-1-Flash зʼявиться в Azure AI Foundry.
Попередня версія MDASH уже дала практичний результат: вона знайшла 16 раніше невідомих дірок у Windows, чотири з яких — критичні вразливості віддаленого виконання коду, закриті у травні 2026 року.
Що це означає
Теза Microsoft адресована тим, хто платить за ШІ в корпоративній безпеці: виграє не найбільша модель, а правильно зібрана звʼязка вузької та фронтирної. Перевірювана цифра тут — удвічі менша вартість прогону за вищого результату на бенчмарку, і це вже другий за місяць випадок, коли компанія продає економію на своїх моделях: у липні вона вивела у превʼю MAI-Image і MAI-Voice з тим самим аргументом.
Розробникам та адміністраторам варто тримати в голові застереження: 96% — це результат на публічному бенчмарку із завдань із відкритим кодом, а не гарантія на закритій корпоративній базі. Наскільки цифра переноситься на практику, буде видно з 3 серпня, коли превʼю стане доступним усім.
Горизонт найближчий: тиждень до превʼю, далі — питання, чи повторять незалежні команди заявлені відсотки на своїх кодових базах.

