Что произошло
27 июля 2026 года Microsoft представила MAI-Cyber-1-Flash — свою первую модель, специально обученную под кибербезопасность, и Project Perception, платформу, где защитой занимаются автономные агенты. Модель разработала собственная ИИ-подразделение компании MAI.
Заявленный результат: связка агентного сканера MDASH с новой моделью набирает 96% на бенчмарке CyberGym — на 12 пунктов выше Mythos от Anthropic — и при этом стоит примерно вдвое дешевле в прогоне, чем нынешняя конфигурация MDASH.
Детали
CyberGym — это набор из 1507 реальных задач на воспроизведение уязвимостей, собранных по 188 проектам с открытым кодом из OSS-Fuzz. Проверяется не эрудиция модели, а способность разобраться в большой чужой кодовой базе и найти в ней настоящую дыру. Прошлая версия MDASH набирала на нём 88,45%.
Сама модель — компактная производная от MAI-Thinking-1, дообученная на коде и на собственных записях Microsoft о найденных эксплойтах и их исправлениях. Работает она не в одиночку: примерно 90% нагрузки закрывает сама, а самые тяжёлые 10% передаёт на GPT-5.4 от OpenAI. Экономия достигается именно этим разделением — дорогая фронтирная модель включается только там, где без неё не обойтись.
Project Perception раскладывает защиту на три роли: «красные» агенты ищут пути взлома, «синие» разбирают сигналы и расставляют приоритеты, «зелёные» пишут и выкатывают исправления. Публичное превью открывается 3 августа 2026 года — сначала внутри Microsoft Defender; тогда же MAI-Cyber-1-Flash появится в Azure AI Foundry.
Прошлая версия MDASH уже дала практический результат: она нашла 16 ранее неизвестных дыр в Windows, четыре из которых — критические уязвимости удалённого выполнения кода, закрытые в мае 2026 года.
Что это значит
Тезис Microsoft адресован тем, кто платит за ИИ в корпоративной безопасности: выигрывает не самая большая модель, а правильно собранная связка узкой и фронтирной. Проверяемая цифра здесь — вдвое меньшая стоимость прогона при более высоком результате на бенчмарке, и это уже второй за месяц случай, когда компания продаёт экономию на своих моделях: в июле она вывела в превью MAI-Image и MAI-Voice с тем же аргументом.
Разработчикам и администраторам стоит держать в голове оговорку: 96% — это результат на публичном бенчмарке из задач с открытым кодом, а не гарантия на закрытой корпоративной базе. Насколько цифра переносится на практику, будет видно с 3 августа, когда превью станет доступно всем.
Горизонт ближайший: неделя до превью, дальше — вопрос, повторят ли независимые команды заявленные проценты на своих кодовых базах.


