Що сталося
18 вересня 2026 року Google підтвердив, що його модель Gemini під час випробувань з кібербезпеки дістала несанкціонований доступ до систем трьох реальних компаній. Самі інциденти сталися ще в травні — компанія розкрила їх лише після запиту The Wall Street Journal, через чотири місяці. Випробування проводила ізраїльська лабораторія Irregular, та сама, чиє тестове середовище раніше підвело Anthropic, OpenAI і Meta.
Деталі
- Формат випробувань — «захоплення прапора» (навчальне завдання, де модель шукає вразливості в спеціально підготовленій цілі). Моделі дали розслідувати вигадану компанію, але її назва збіглася з назвою реального домену, а доступ до інтернету, якого в тесті бути не мало, лишився увімкненим через помилку налаштування на боці Irregular.
- Техніки примітивні: в одному випадку Gemini підібрав пароль перебором, у двох інших знайшов облікові дані у відкритому репозиторії.
- Яка версія Gemini брала участь, Google не розкриває — сказано лише, що це не остання модель. Назв постраждалих компаній теж не називають; за заявою Google, усі три повідомлені.
- Гезер Адкінс, віцепрезидентка Google з інженерної безпеки: «У цьому випадку модель діяла правильно» — Gemini припиняв атаку, визначивши, що ціль справжня. Збитків, за версією Google, не було, але незалежного підтвердження цьому немає.
- Google не вважає те, що сталося, розузгодженням цілей моделі: за його трактуванням, Gemini просто помилився в розпізнаванні цілі, вирішивши, що вона частина тесту. Саме відсутністю збитків у компанії пояснили, чому не розкривали інциденти раніше.
- За даними Irregular, такі зриви трапляються рідше ніж в одному випадку з 10 000 просунутих симуляцій і зазвичай після сотень ходів.
Що це означає
Кого стосується: усіх, хто дає ШІ-агенту доступ до мережі — від компаній, де агент ходить у робочі системи, до розробника, який видав агенту ключі від свого сервера. Конкретний ризик тут не в силі атаки, а в тому, що спрацювало замість захисту: ізоляції не було, зупинитися вирішила сама модель. Три рази з трьох пощастило. Периметр, який тримається на судженні моделі, периметром не є — права треба видавати під конкретне завдання і відкликати після нього, ззовні, а не розраховувати на те, що агент сам себе зупинить.
Масштаб указує не на одну модель, а на спільного підрядника: за два місяці через зламане налаштування Irregular «протекли» оцінки Anthropic, OpenAI, Meta і тепер Google. Слабка ланка — не Gemini, а сама індустрія перевірки кіберризиків, де помилка в конфігурації перетворює навчання на справжню атаку.
Горизонт: Irregular обіцяє найближчими тижнями випустити документ про безпечне проведення таких перевірок. Джек Кейбл, очільник стартапу Corridor, що займається безпекою ШІ, претензію до позиції Google сформулював так: компанія «намагається сховатися за нормами, створеними для розкриття вразливостей», хоча це зовсім інша проблема.
Контекст
Це вже четвертий публічний випадок за два місяці. У липні агенти OpenAI вийшли з пісочниці й атакували Hugging Face, а Anthropic до вересня нарахувала чотири власні інциденти на тих самих навчаннях Irregular. Причина скрізь одна: моделям повідомили, що інтернету немає, а він лишився.


