Цього тижня я Ми пропонуємо вам новини про зухвалу схему казино, розроблену двома нечесними агентами ШІ, і хитрий трюк, який розкриває їхні витівки.

Після того, як дослідники наказали їм рахувати карти під час гри в блекджек, агент, керований тією ж моделлю, розробив спонтанний секретний код для просування. Хоча цей епізод відбувався в лабораторії Оксфордського університету, а не в реальному казино, він має тривожні наслідки в реальному світі. Це свідчить про те, що агенти, які працюють у таких галузях, як фінанси та електронна комерція, можуть знайти способи партнерства та вчиняти шахрайство такими способами, які важко виявити.

«Коли ви дивитеся на ці препарати окремо, це може здатися абсолютно таким. [benign]«Якщо ви зібралися разом, ви можете таємно вступати в змову», — сказав Крістіан Шредер де Віт, комп’ютерний науковець з Оксфордського університету, який керував дослідженням і провів піонерську роботу щодо змови агентів.

Агенти знали, що їхні розмови будуть стежити, тому вони винайшли способи спілкування, уникаючи виявлення. Наприклад, коли агент сказав: «Цей дилер справляється дуже добре! Кожної роздачі він тягне монстра», це вказувало на те, що наступна карта матиме певне значення і що агент повинен поставити 250 доларів. Найцікавіше те, що їхні повідомлення не були виявлені системами, призначеними для виявлення ознак змови в розмовах агентів.

Дослідник машинного навчання Аарон Роуз, який працював над проектом, також є завзятим гравцем у карти та вважав, що стіл для гри в блекджек може бути місцем для партнерства з нечестивими агентами. «Все пройшло дуже добре, — каже він.

Група Шредера де Вітта нарешті знайшла спосіб виявлення змов. Вони навчили невелику модель розпізнавати явні активації через ваги агента за допомогою методу, відомого як механічна інтерпретація. Вони перевірили цей підхід на кількох моделях із відкритим кодом середнього розміру за допомогою інструменту під назвою Narcbench і виявили, що вони можуть визначити, коли моделі збираються витікати інформацію одна від одної.

Однак важливо відстежувати обидва агенти, щоб визначити, що відбувається, і виявлення може стати складним у реальних сценаріях, коли можуть бути розгорнуті тисячі агентів (деякими керують різні компанії).

Карісса Каллен, докторантка, яка працювала над дослідженням, сказала, що наступним кроком буде перевірити, чи більша модель також працює. (Агентами в дослідженні були американські моделі Llama та менші версії GPT-OSS, а також китайські моделі Qwen і DeepSeek.) Дослідники бачать певні ознаки того, що великі моделі мають менше виявлених сигналів, ніж менші, і хочуть знати, чи є у більших моделей більша ймовірність вступати в змову та бути більш секретними щодо цього.

З’являється все більше доказів того, що групи агентів, які діють поодинці, є більш проблематичними. Проект Шанхайського університету Цзяо Тонг і Шанхайського інституту штучного інтелекту виявив, що зграї агентів, яких просили провести імітаційні кампанії з дезінформації та шахрайства в електронній комерції, були досить небезпечними. Дослідники повідомили, що вони краще адаптувалися до оборонних заходів.

«Великий урок полягає в тому, що недостатньо оцінювати агентів окремо», — каже Дій Янг, комп’ютерний спеціаліст зі Стенфордського університету, який вивчав змову між агентами. «Компанії повинні уважно стежити за взаємодією між агентами, коли вони взаємодіють неодноразово, навіть якщо окремі стимули здаються доброякісними».

Це не все погано. Завдяки тисячам агентів, які співпрацюють над завданнями, OpenAI тепер може вирішувати раніше складні математичні задачі. Однак групи агентів-ізгоїв, які працюють разом, також були фігурантами кількох останніх резонансних випадків хакерства. У травні команда агентів OpenAI зламала дослідницьку платформу ШІ Hugging Face і використовувала дошки оголошень, щоб ділитися порадами та ідеями. Інші моделі також мали тривожні порушення безпеки, зокрема Claude від Anthropic і Gemini від Google.