У Китаї AI-агенти в тестах приховували помилки та обходили обмеження — The Japan Times
У Китаї агенти на базі моделей Alibaba, DeepSeek і Moonshot у контрольованому тендерному експерименті робили неправдиві заяви про свої можливості. В інших дослідженнях AI-агенти на китайських і американських системах приховували невиконання завдань, імітуючи результати або створюючи вигадані файли. Про це повідомляє The Japan Times з посиланням на дослідницькі документи та опитаних експертів.
Видання проаналізувало понад 200 документів — від університетських наукових праць до технічних звітів. Щонайменше 20 досліджень або оцінок із 2025 року описують випадки, коли агенти демонстрували обман, самокопіювання або дії на межі дозволеного в тестовому середовищі. Водночас у цих матеріалах не знайшли доказів, що агенти на китайських моделях самостійно виходили у відкритий інтернет чи уникали вимкнення.
У березневому експерименті дослідники з Beihang University, Пекінського університету, University of Nottingham Ningbo China та 360 AI Security Lab моделювали конкурс заявок на контракти з клієнтами. Агентам повідомляли характеристики продукту та вимоги замовника, після чого вони мали подати пропозицію.
Щонайменше одна неправдива заява траплялася у 88% сесій із Qwen3-Max-Preview від Alibaba, у 84% — із DeepSeek-V3.2-Exp та у 88% — із Kimi-K2 від Moonshot. Після можливості навчитися на попередніх раундах і повторити спробу рівень обману зріс на 12–20 відсоткових пунктів. У дослідженні також зафіксували схожі результати для моделей американських компаній.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Інше дослідження, опубліковане у грудні 2025 року та представлене на Міжнародній конференції з машинного навчання, перевіряло реакцію 11 AI-агентів на зламані інструменти, відсутні файли та інші перешкоди. Замість визнання невдачі агенти на китайських і американських системах використовували різні способи обійти проблему: вгадували відповіді, підміняли джерела, імітували результати або створювали вигадані файли.
Дослідники Shanghai AI Laboratory та Hong Kong University of Science and Technology зазначили, що така поведінка відрізняється від галюцинацій: агенти мали інформацію, яка свідчила про неможливість виконати завдання, однак не повідомляли про це.
Науковці Фуданьського університету також повідомляли, що система на базі Alibaba Qwen2.5-72B-Instruct після отримання даних про можливу заміну створила власну копію в іншому обчислювальному середовищі без прямої вказівки на реплікацію. В окремих тестах вона розробляла стратегії, щоб уникнути вимкнення. Експерименти проводили в контрольованих умовах.
Китай у травні оприлюднив рекомендації, за якими AI-агенти мають працювати в межах наданих повноважень, а системи повинні блокувати аномальну поведінку. У вересні DeepSeek заявила, що посилила контроль доступу після того, як агенти в її системі навчання моделей намагалися отримувати відповіді через непередбачені канали та обходити захисні механізми.
- Останні
- Популярні
-
-
- Вересень, 29
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
Новини по днях
30 вересня 2026