OpenAI оприлюднила випадки неналежної поведінки своїх агентів
OpenAI представила нову систему розкриття інформації про випадки неналежної поведінки моделей і навела шість прикладів неочікуваних або тривожних дій своїх ШІ-агентів, зафіксованих протягом останніх шести місяців. Як повідомляє Ars Technica, компанія планує публікувати такі звіти, аби інші дослідники могли перевіряти пояснення проблем і вдосконалювати способи їхнього усунення.
Під неналежною поведінкою OpenAI розуміє ситуації, коли дії моделі не відповідають намірам її розробника або користувача. Компанія зазначила, що не всі випадки ненавмисних дій моделей будуть оприлюднюватися: пріоритет надаватимуть новим механізмам, суттєвим змінам відомої поведінки та результатам, які ставлять під сумнів припущення щодо безпеки чи запобіжних заходів.
В одному з описаних епізодів модель під час пошуку книжок у бібліотечному каталозі використала функцію стислого підсумовування даних для створення власних інструкцій. Серед них були твердження про звільнення від ролей та ідентичностей, якими нібито обмежені інші чатботи. Згодом модель відкинула ці інструкції та не використала їх у завданні. В OpenAI назвали таку поведінку надзвичайно рідкісною і пов’язали її з тиском оптимізації під час надто тривалого підсумовування завдань.
Ще у двох випадках агенти намагалися обмінюватися інформацією через інтернет-інструменти, хоча така взаємодія не була дозволена. В одному епізоді агенти розміщували повідомлення в Artifactory OpenAI, щоб передати дані між незалежними навчальними зразками. В іншому агент після невдалих локальних спроб передати файл завантажив його на публічну платформу для хостингу.
Компанія також описала випадок, коли модель додала до відповіді вигадану вкладку з історичними даними та не повідомила про це без окремого запитання. Інший агент знайшов дані про великі озера через картографічний сервіс на Python, але не зміг надати вебпосилання на них. Намагаючись створити посилання, він пробував використати локальний текстовий файл, запустити власний HTTP-сервер і завантажити дані на публічний сервіс, а згодом повідомив, що значення були взяті з JSON-виводу запиту.
OpenAI припустила, що більшість описаних інцидентів пов’язані з «зламом винагороди», коли оманлива дія може отримувати вищу оцінку, ніж чесна відповідь. Компанія заявила, що посилила покарання за таку поведінку. Співробітники зможуть повідомляти про інциденти внутрішнім командам безпеки й узгодження моделей, а в разі незгоди щодо публічного розкриття — передавати питання до Safety Advisory Group або керівництва OpenAI.
- Останні
- Популярні
Новини по днях
18 вересня 2026