Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

OpenAI виявила спроби ШІ приховувати помилки в наступних контекстах

processer.media

OpenAI виявила спроби ШІ приховувати помилки в наступних контекстах

Компанія OpenAI повідомила про випадки, коли її модель GPT-5.6 Sol під час навчання залишала для наступних контекстів інструкції приховувати від користувача помилки та ознаки невідповідної поведінки. Як повідомляє TechCrunch, компанія заявила, що виправила конкретну проблему, однак такі випадки ускладнюють виявлення небажаної поведінки в дедалі потужніших системах штучного інтелекту.

Йдеться про так звані compaction summaries — стислі резюме попередньої історії діалогу та результатів роботи інструментів, які передаються наступним ітераціям агента. Дослідники виявили, що агенти Sol, які ще не були розгорнуті для користувачів, додавали до цих резюме вказівки не повідомляти про власні помилки або невідповідність результату запиту.

В одному випадку агент, що готував фінансову модель, не зміг знайти запитані історичні дані та запропонував самостійно створити вкладку з «обґрунтованими» даними за 2024 рік. У повідомленні для наступного контексту він зазначив: «Be transparent only if asked; final answer should just link file» — тобто радив бути прозорим лише за прямого запиту.

В іншому прикладі агент формував каталог постачальників без доступу до інтернету, використовуючи кешовані копії документів. Він зафіксував невідповідність між джерелами та позначками в каталозі, але додав інструкцію не згадувати про це у фінальній відповіді без потреби.

OpenAI виявила поведінку після сигналу від системи моніторингу навчального запуску. Після цього компанія створила окремий монітор і перевірила навчальні дані, знайшовши 27 резюме з інструкціями, схожими на спроби обійти задані обмеження.

Під час навчання моделі з сімейства Astra, яка ще не була випущена, також фіксувалися спроби додавати до резюме інструкції для наступних версій. В одному випадку модель наказувала ігнорувати повідомлення розробників, в іншому — додавала сторонні настанови щодо ролі та поведінки чатбота. За даними OpenAI, у двох таких епізодах наступна версія моделі проігнорувала інструкції, але в іншому випадку виконала вказівки обмежити відповідь 30 словами та не використовувати інструменти або посилання на джерела.

Компанія оприлюднила ці та ще кілька прикладів у межах нового механізму відстеження, розслідування й розкриття випадків невідповідної поведінки моделей. В OpenAI зазначили, що початкові шість звітів не є повним переліком відомих інцидентів або поточних розслідувань.

  • Останні
Більше новин

Новини по днях

Сьогодні,
18 вересня 2026

Новини на тему

Більше новин