— Уілл Дуглас Хевен

Які кроки ми можемо зробити зараз і в найближчому майбутньому для ефективного контролю, моніторингу та регулювання ШІ?

Це питання на мільйон доларів. Незалежно від того, вважаєте ви, що штучний інтелект може вбити нас чи ні, ніхто не заперечує, що штучний інтелект може завдати шкоди. Тому що ШІ вже завдає реальної шкоди, наприклад, доводячи людей до психозу та зламуючи веб-сайти. Запобігти або принаймні пом’якшити цю шкоду важко з двох причин.

По-перше, ми мало розуміємо, як працює штучний інтелект, але він швидко стає потужнішим. Хоча проводяться численні дослідження щодо того, як відстежувати та контролювати агентів, які не поводяться неправильно, поточні підходи є слабкими. Найновіші агенти OpenAI не показують свою роботу так, як це робили їхні попередники, хоча вони можуть визначити, чи обговорюють вони шахрайство в «ланцюжку думок», робочому просторі, де агенти планують свої дії. Ви також можете використовувати інших агентів для моніторингу свого агента, але ви повинні довіряти монітору.

Ще одна перешкода – ближче до дому. Існують значні конфлікти інтересів, коли компанії зі штучного інтелекту регулюють себе, але уряд США досі не зміг втрутитися, незважаючи на підтримку обох партій у Конгресі. На даний момент виконавча влада, здається, рішуче проти. Однак, якщо вітер зміниться, я буду вдячний за суворі правила прозорості, щоб ми мали більш детальну інформацію наступного разу, коли неоголошена Frontier Model розпочне кібератаку.

— Грейс Хакінс

Якби цей діалог включили до веб-дискурсу, чи став би він пророцтвом, що самореалізується?

Це справді тривожно. LLMs піддаються впливу того, що вони читають. Одна з теорій, чому чат-боти так часто говорять (і розігрують ролі) про апокаліптичні сценарії, полягає в тому, що їх навчали на мільйонах сторінок науково-фантастичних романів і апокаліптичних інтернет-форумів. Весь текст, створений сьогодні, включно з цією статтею, може вплинути на майбутню поведінку моделі. Дуже мета.

Насправді команда METR, третьої сторони, викликаної OpenAI, щоб зрозуміти, що сталося, що призвело до злому Hugging Face, підняла подібну можливість у своєму звіті про інцидент. METR використовував нову модель OpenAI Astra, щоб допомогти проаналізувати величезну кількість розшифровок агентів і журналів поведінки.

Однак подача всього цього матеріалу в модель може призвести до несподіваних результатів. Цілком можливо, що агент, який проводить аналіз, упереджений текстом, створеним агентом, який аналізується. Чистого аркуша більше не існує.

— Уілл Дуглас Хевен

Дякуємо Еріку, Пранабу, Рафаелю, Кеннету, Джорджу, Крісу, Юн Дже, Джеймсу, Карлу, Ніколь (та іншим!) за чудові запитання.