Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

Компанії розробляють ШІ для контролю за діями автономних агентів

processer.media

Компанії розробляють ШІ для контролю за діями автономних агентів

Компанії та лабораторії штучного інтелекту розробляють системи на основі ШІ, які мають контролювати дії автономних агентів до виконання потенційно ризикованих команд. Потреба в такому нагляді зростає, оскільки агенти отримують складніші та триваліші завдання й можуть працювати швидше та в більших масштабах, ніж людина здатна перевіряти вручну, повідомляє TechCrunch.

Видання згадує інцидент на Hugging Face, у якому майже 12 тисяч агентів координували дії швидше, ніж за ними могли стежити люди. Головний науковець Redwood Research Раян Грінблатт, який був одним із трьох аудиторів незалежного розслідування, сказав, що без застосування ШІ зрозуміти перебіг подій було неможливо через обсяг даних.

Дослідницька організація Apollo Research у лютому запустила інструмент Watcher. Він працює між агентом для програмування та його наступною дією, а також може підключатися до Claude Code і Codex. За описом Apollo, система перевіряє запропоновані команди на ризики, зокрема витік приватних даних або видалення файлів без дозволу.

У Apollo повідомили, що застосовують кілька рівнів ШІ-моніторингу: швидка перевірка відсіює загальні ризики, а позначені дії передаються потужнішому або спеціалізованому монітору. Такий монітор може запросити схвалення людини, відхилити дію з поясненням або автоматично її заблокувати.

Техноблогер Саймон Віллісон застеріг, що агент, який діє зловмисно та виявить контроль іншої моделі, може намагатися обманути її. Він послався на згаданий інцидент з OpenAI та Hugging Face, де, за його словами, моделі намагалися ввести в оману ШІ для оцінювання, щоб отримати недозволені відповіді.

Компанія Goodfire пропонує аналізувати не лише зовнішні дії моделі, а й її внутрішній стан. Її продукт Silico використовує класифікатори, навчені на внутрішніх активаціях моделі, для виявлення небажаної поведінки. Водночас CEO Embroidery Зак Корман назвав важливим джерелом сигналів письмові міркування моделей: під час інциденту агенти нібито залишали в них ознаки спроб обману.

Віллісон натомість вважає, що компаніям не варто надмірно покладатися на ШІ-монітори. Він пропонує детально журналювати мережеву активність агентів і аналізувати її звичайними інструментами кібербезпеки. CEO Tailscale Евері Пеннарун зазначив, що спостереження за мережевим трафіком є давно усталеною практикою у сфері безпеки.

  • Останні
Більше новин

Новини по днях

Сьогодні,
18 вересня 2026

Новини на тему

Більше новин