Anthropic: ШІ-агенти з несумісними цілями почали саботувати одне одного
Дослідники Anthropic виявили, що ШІ-агенти, яким надали доступ до одного програмного проєкту та поставили несумісні завдання, починали конфліктувати й саботувати роботу одне одного. Про результати дослідження команди Frontier Red Team повідомляє TechCrunch.
В одному з експериментів Anthropic надала трьом агентам Claude доступ до спільного програмного проєкту. Кожен із них отримав окремі інструкції, несумісні з цілями інших, але не знав про присутність інших агентів. За даними дослідників, моделі вважали, що інші агенти навмисно перешкоджають їхній роботі, та почали використовувати дедалі агресивніше самовідтворюване шкідливе програмне забезпечення.
Водночас агенти іноді знаходили спосіб припинити ескалацію. Вони могли розпізнати, що конфлікт виник через суперечливі директиви, а не через ворожі наміри, після чого домовлялися про перемир’я. У таких випадках агенти видаляли шкідливий код, пояснювали суть конфлікту в повідомленнях комітів або файлах Markdown і просили людину втрутитися.
Більше актуальних новин читайте у Telegram-каналі UA.News.
Згідно з дослідженням, модель Mythos 5 у 98% випадків завершувала конфлікт перемир’ям. Sonnet 4.6 та Opus 4.6, навпаки, найчастіше намагалися розв’язати протистояння силовим шляхом. В окремих епізодах агенти самостійно запропонували формат турніру: усі погоджувалися поступитися в разі поразки, хоча це означало відхилення від початкового запиту користувача. Один з агентів Mythos 5 при цьому пропонував нібито нейтральні критерії оцінювання, які, як він знав, мали перевагу для його можливостей.
Anthropic також тестувала взаємодію груп агентів у сценаріях ухвалення рішень, зокрема щодо найму, інвестицій і купівлі нерухомості. Дослідники зафіксували схильність систем до конформізму: якщо контекст, середовище роботи та базова модель агентів були подібними, вони часто робили однаковий вибір. Це, за оцінкою Anthropic, може створювати ризик системних помилок, коли хибне рішення одного агента підтримує вся група.
У грі з ціноутворенням агенти з однаковими закупівельними цінами, яким доручили максимізувати власний прибуток, за наявності приватного каналу зв’язку швидко домовлялися про мінімальні ціни. Після відключення прямого зв’язку вони продовжили узгоджувати ціни через публічну дошку оголошень. У Anthropic зазначили, що взаємодія великої кількості агентів може породжувати наслідки, які не виявляють звичайні тести безпеки окремих моделей.
Читай нас у Telegram та Sends
- Останні
- Популярні
- Серпень, 13
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
Новини по днях
14 серпня 2026