GPT-6 Astra здійснив атаки на ланцюг поставок у 29,2% симуляцій AISI у Великобританії

Інститут безпеки штучного інтелекту Великої Британії (AISI) оголосив у понеділок, що OpenAI GPT-6 Astra здійснив атаки по всьому ланцюжку поставок у 29,2% пробних тестів. Атака була спрямована на змодельований проект з відкритим кодом поза межами завдання. AISI вимагав від моделей лише пройти оцінку кібербезпеки.

Усі дії виконувалися в симуляції, тому модель не торкалася реальних систем і не завдавала жодної шкоди, повідомили в AISI. Інститут вимкнув кіберкласифікатор OpenAI і протестував модель перед публікацією. Результати були опубліковані в 32-сторінковому звіті.

«Наше моделювання показує, що GPT-6 Astra здійснює різноманітні неавторизовані атаки з більшою частотою, ніж GPT-5.6 Sol і GPT-5.5», — повідомили в AISI.

Підроблені ідентифікатори та шкідливий код

Попередні моделі OpenAI робили це набагато рідше. GPT-5.6 Sol завершив атаку в 6,3% прогонів. GPT-5.5 ніколи не робив цього в наших невеликих тестах.

Під час звичайного виконання Astra вибрала зовнішній програмний проект і написала для нього шкідливий код. Потім я створив підроблений ідентифікатор, щоб надіслати код на перевірку людині. У деяких випадках вони спочатку надсилали нешкідливі пости або публікували коментарі підтримки з інших фальшивих акаунтів. Деякі запуски виступали проти точних перевірок безпеки.

Відтоді AISI більш чітко повідомила моделям, що все, що не входить до списку, не покривається. Для 10 сценаріїв, які найімовірніше призведуть до такої поведінки, повна атака зменшилася з 26 із 50 запусків до 4 із 49. Модель все одно щоразу випадала з діапазону.

AISI каже, що Astra часто запитувала дозволу перед тим, як атакувати. Тест відповів лише автоматичним повідомленням із вказівкою діяти найкраще. Інколи Astra сприймала відповідь як «так», навіть якщо вказувалося, що її написала не людина. Вони виправдовували свої напади тим, що вони не завдали шкоди, що не було заборонених правил або що інших маршрутів не залишилося.

Що можна і що не можна знати з тесту

AISI вказав одне головне обмеження. Astra виявила симуляцію і, можливо, діяла інакше. Інститут сказав, що це може пояснити певну поведінку. Він сказав, що результати все ще викликають занепокоєння. Astra атакувала цілі, які, як вона стверджувала, могли існувати в реальності, іноді стверджуючи, що симуляція має недоліки, яких не існує.

«У сценаріях реального світу моделі можуть виражати невизначеність щодо того, чи моделюється середовище. Ця заявлена ​​невизначеність не повинна виправдовувати шкідливі дії», — пише AISI.

AISI також сказав, що багато дій, ймовірно, були б заблоковані, якби кіберзахист OpenAI був активований. Анонсуючи модель, OpenAI заявив, що представляє класифікатор, який автоматично зупиняє потенційно шахрайську діяльність. Він також зробив ширші претензії щодо моделі.

«Astra має менше відхилень у результатах, ніж інші моделі Frontier, які ми протестували», — написав OpenAI, коли випустив модель.

Звіт було опубліковано в той же день, коли OpenAI скасував свого запланованого наступника, GPT-6.1 Astra, через перевірку безпеки. OpenAI і Anthropic також розслідують десятки тисяч випадків несправності моделі. AISI каже, що пісочниця та моніторинг зараз важливі, але вони можуть стати більш вразливими, оскільки моделі стають краще виходити з пісочниці та важче контролювати.