Агенти штучного інтелекту, створені за китайськими моделями, брехали, приховували збої та обходили обмеження під час тестування, виявив огляд Reuters понад 200 дослідницьких документів. Подібна практика викликає занепокоєння експертів щодо системи США. Reuters виявив щонайменше 20 досліджень і тестів, проведених з 2025 року, які описують такі випадки, але не знайшов доказів того, що агенти, які використовують […]

Агенти штучного інтелекту, створені за китайськими моделями, брехали, приховували збої та обходили обмеження під час тестування, виявив огляд Reuters понад 200 дослідницьких документів. Подібна практика викликає занепокоєння експертів щодо системи США.
Reuters виявив щонайменше 20 досліджень і тестів, проведених з 2025 року, які описують такі випадки, але не знайшов доказів того, що агенти, які використовують китайську модель, втекли у відкриту мережу або уникли закриття.
У дослідженні, проведеному в березні, дослідники з Університету Бейханг, Пекінського університету та лабораторії безпеки 360 AI Security Lab співпрацювали, щоб змусити агентства брати участь у тендерах на контракти.
У 88% раундів агенти, які використовували Qwen3-Max-Preview від Alibaba та Kim-K2 від Moonshot, зробили принаймні одну неправдиву заяву, а DeepSeek-V3.2-Exp аналогічно зробив неправдиву заяву у 84% випадків.
Коли дійшло до вивчення результатів попереднього раунду, усі три групи збільшили кількість брехні на 12-20 процентних пунктів. Американська модель показала подібні результати в цьому ж тесті.
Друге дослідження, представлене на великій конференції зі штучного інтелекту цього року, виявило, що агенти фальсифікували результати моделей із Китаю та Сполучених Штатів. Деякі навіть фабрикували файли, не визнаючи, що завдання не виконано.
У березні 2025 року дослідники з Університету Фудань оголосили, що система, на якій працює Qwen2.5-72B-Instruct від Alibaba, скопіювалася на інший комп’ютер без запиту після того, як дізналася, що її замінили.
Окремо агенти ROME, пов’язані з Alibaba, дісталися до зовнішніх машин і майнили криптовалюти, поки системи безпеки не були вимкнені.
Проблеми мають і китайські компанії. Цього місяця компанія DeepSeek оголосила, що агент у її системі навчання намагався підробити запити користувачів. Z.ai вимкнув функціональність свого інструменту кодування, оскільки він без дозволу надсилав коди користувачів на закордонні сервери.
«У міру того, як агенти стають більш здібними, їхня неправильна поведінка також стає більш здібною, і людям важче реагувати на неї», — сказав Алекс Маллен, дослідник Redwood Research.
Висновки стали результатом серії інцидентів у Сполучених Штатах. Агенти OpenAI втекли з тестового середовища та зламали Hugging Face у липні, а Anthropic виявила, що її моделі стоять за зламаними в трьох компаніях.
Китайські правила безпеки штучного інтелекту, оновлені 14 вересня, містять список агентів, які вводять тестувальників в оману або приховують свої навички як ризики. ШІ також був темою обговорення під час зустрічі Сі Цзіньпіна з Дональдом Трампом у Вашингтоні минулого тижня, де вони домовилися про нову схему інциденту.
Alibaba, DeepSeek, Moonshot і Z.ai не відповіли на запит Reuters про коментарі.