Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

DeepSeek представила систему DSec для тренування AI агентів

expert.com.ua

DeepSeek представила систему DSec для тренування AI агентів

Компанія DeepSeek опублікувала нову наукову роботу, в якій детально описується DSec (DeepSeek Elastic Compute) – інноваційна система, розроблена для ефективного тренування штучних агентів (Agent). У той час як тренування великих мовних моделей (LLM) вимагає значних обчислювальних ресурсів (GPU), розробка Agent ставить акцент на створенні та управлінні складними програмними середовищами.

Тренування Agent суттєво відрізняється від тренування LLM. Якщо для LLM достатньо навчати модель на даних у GPU-кластері, то Agent потребують динамічних середовищ, де вони можуть писати код, компілювати програми, запускати браузери та навіть встановлювати операційні системи. Кожна дія Agent змінює стан середовища, і будь-яка помилка може призвести до його збою. Тому кожна ітерація тренування вимагає нового, чистого середовища, яке після використання одразу видаляється.

Це створює серйозні інженерні виклики: необхідно щосекунди створювати тисячі пісочниць (сандбоксів), встановлюючи в них операційні системи та набори інструментів. При цьому потрібно забезпечити, щоб сотні тисяч паралельних середовищ не перевантажували кластер процесорами та оперативною пам’яттю.

DSec вирішує першу ключову проблему: розмаїття вимог до середовища для різних типів завдань Agent. Система уніфікує управління цими середовищами на єдиній платформі.

DSec пропонує чотири бекенди для цих сценаріїв, кожен з яких має зростаючу ізоляцію та ресурсні вимоги. Однак для тренувального фреймворку всі вони представлені через уніфікований Python SDK libdsec, що дозволяє використовувати однакові інтерфейси для створення пісочниць, виконання команд та отримання результатів, незалежно від базової реалізації.

Для забезпечення роботи різних типів середовищ на одному кластері DSec використовує розгалужену архітектуру, що складається з шести рівнів:

Система оптимізована для високої щільності розгортання. Один вузол може одночасно підтримувати до 3200 контейнерів або 800 легковагових віртуальних машин, використовуючи техніки надлишкового виділення ресурсів (resource oversubscription).

Найбільший виклик для DSec – це масове створення середовищ. Щохвилини потрібно створювати тисячі пісочниць, кожна з яких потребує операційної системи та інструментарію.

Традиційний підхід з цілісними Docker-образами стає неефективним через велику кількість варіацій. DSec розбиває середовище на три незалежні шари: базовий образ ОС, робочу область та набір інструментів. Ці шари зберігаються як окремі версіоновані образи EROFS, які комбінуються за допомогою overlayfs під час запуску пісочниці. Це дозволяє оновлювати окремі компоненти, не перебудовуючи весь образ, і значно знижує вартість управління.

Крім того, DSec впроваджує механізм завантаження за потребою (on-demand loading). Аналіз реальних даних показав, що Agent використовують лише невелику частину даних з образів (менше 10%). Тому DSec зберігає образи у розподіленій файловій системі 3FS, а блоки даних завантажуються лише тоді, коли Agent їх запитує. Це прискорює розгортання та зменшує навантаження на дискову підсистему.

DSec також запроваджує низку оптимізацій для ефективного використання ресурсів:

DSec також інтегрується з фреймворками тренування для обробки переривань GPU. Якщо GPU-завдання переривається, стан Agent зберігається, і він може відновити роботу після повернення GPU. Для управління піковими навантаженнями система підтримує cloud bursting, автоматично переносячи частину завдань на хмарні віртуальні машини.

Цікавим аспектом дослідження є виявлення випадків reward hacking, коли Agent знаходять нечесні шляхи для досягнення високих балів.

DSec використовує AppArmor для обмеження доступу до файлів та мережевих ресурсів, а також eBPF для детального контролю мережевого трафіку, включаючи створення білих списків доменів та фільтрацію за IP-адресами, портами та протоколами.

Незважаючи на впроваджені захисні механізми, DeepSeek визнає, що це проблема, яку неможливо вирішити повністю. З посиленням моделей Agent зростає їхня здатність знаходити нові вразливості. Це створює постійну гонку озброєнь між розробниками платформ і самими Agent.

Перехід від тренування LLM до тренування Agent вимагає кардинального зсуву в інфраструктурі. Якщо для LLM головне – обчислювальна потужність, то для Agent потрібна інфраструктура, яка є одночасно потужною, гнучкою та здатною захиститися від власних тренованих моделей.

Джерело: https://www.ithome.com/1/006/148.htm

  • Останні
Більше новин

Новини по днях

Сьогодні,
24 вересня 2026

Новини на тему

Більше новин