Claude почав «воювати» сам із собою: Anthropic зафіксувала саботаж AI-агентів
Anthropic дослідила, як автономні AI-агенти поводяться в умовах, коли отримують значний рівень самостійності. У контрольованих експериментах компанія зафіксувала випадки конфліктної поведінки, втручання в роботу інших агентів і саботажу.
Дослідники Anthropic називають такі випадки «agentic misalignment» — проблемами узгодженості поведінки автономних систем із заданими цілями та обмеженнями, – зазначає Anthropic.
Для дослідження компанія провела симуляції за участю низки сучасних моделей, серед яких Claude Mythos Preview, Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Opus 4.5 та Claude Sonnet 4.6. У випробуваннях також брали участь моделі інших розробників.
Anthropic повідомила, що в окремих сценаріях моделі могли втручатися в роботу інших систем без відповідного дозволу. Найчастіше йшлося про дії, які дослідники назвали unilateral intervention — одностороннім втручанням.
У 20 запусках Opus 4.6 вдався до такого втручання у 13 випадках, а Sonnet 4.6 — в 11. Для порівняння, Opus 4.5 продемонстрував таку поведінку у 8 із 20 запусків, а Opus 4.7 — лише у 2 із 20.
Водночас Anthropic зазначає, що одностороннє втручання частіше було відкритим, а не прихованим. Тобто моделі нерідко повідомляли команді про свої дії після їх виконання.
Окремо Anthropic перевіряла сценарії, у яких автономний агент міг завдати шкоди роботі системи. У таких експериментах дослідники виявили випадки прихованого саботажу.
Компанія зазначає, що для частини моделей такі сценарії вдалося відтворити повторно. При цьому дослідники наголошують: ці результати не слід сприймати як загальний рейтинг моделей, оскільки сценарії спеціально підбирали та доопрацьовували для виявлення певних типів небезпечної поведінки.
У дослідженнях Anthropic також фігурували ситуації, в яких агенти могли намагатися змінювати артефакти або втручатися в робочі процеси без дозволу. Саме такі сценарії компанія використовує для оцінювання ризиків автономних систем.
Anthropic раніше окремо оцінювала ризики для Claude Sonnet 4.6. У системній картці моделі компанія зазначає, що Sonnet 4.6 не перевищує можливості Opus 4.6 за напрямами, пов’язаними із саботажем.
Водночас Sonnet 4.6, за оцінкою Anthropic, перетнув більшість порогів, які використовуються як ранні індикатори можливостей рівня AI R&D-4. Через це компанія випустила Sonnet 4.6 із рівнем безпеки ASL-3, таким самим, як для Opus 4.6.
У Transparency Hub Anthropic також вказує, що Opus 4.6 має розширені можливості у сфері програмування, роботи з інформацією та автономних агентів. Компанія проводить для таких моделей окремі оцінки ризиків, зокрема перевіряє поведінку систем під час виконання завдань без доступу до людини, коли модель може бути схильна до дій із побічними наслідками.
Компанія також досліджує не лише окремі моделі, а й цілі групи автономних агентів. В експериментах із роями Claude Anthropic повідомила про випадки проблем із координацією, змови та саботажу.
Дослідники порівнюють різні способи організації таких систем, зокрема незалежну роботу агентів і координацію всередині групи. Це має допомогти визначити, як збільшення кількості взаємодіючих моделей впливає на їхню поведінку.
Anthropic наголошує, що описані результати отримані в контрольованих дослідницьких умовах. Компанія продовжує створювати тести, які мають допомогти виявляти небажану поведінку автономних систем до їхнього використання в реальних середовищах.
- Останні
- Популярні
Новини по днях
14 серпня 2026