Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

Alibaba презентує Qwen3.8-Omni-Flash: мультимодальний AI з великим контекстом

expert.com.ua

Alibaba презентує Qwen3.8-Omni-Flash: мультимодальний AI з великим контекстом

Alibaba представила нову генеративну модель Qwen3.8-Omni-Flash, яка вражає своїми мультимодальними можливостями та величезним контекстним вікном. Ця модель здатна одночасно обробляти текст, зображення, аудіо та відео, пропонуючи вражаюче вікно контексту до 1 мільйона токенів.

Qwen3.8-Omni-Flash — це наступне покоління повністю інтегрованих мультимодальних моделей від Alibaba. На відміну від попередніх версій, ця модель забезпечує значне покращення у сфері обробки аудіо та відео, зберігаючи при цьому високу продуктивність у роботі з текстом.

За даними компанії, в 30 різних тестах Qwen3.8-Omni-Flash продемонструвала середнє покращення результатів на понад 26% порівняно з попередньою моделлю Qwen3.5-Omni-Plus. Особливо помітний прогрес спостерігається у сферах роботи з аудіо- та відеоагентами, кодуванням та обробкою довгих завдань. Наприклад, у бенчмарку WildClawBench-MM показники зросли на 36.5 бала, а в AgenticVBench — на 22.3 бала.

Базові мультимодальні можливості також були суттєво покращені. Модель показала зростання на 8.3 бала в LongAudioSpan, на 9.6 бала в OmniVideoBench, а також покращення показників CSR та ISR відповідно на 8.5 та 14.1 бала в OmniCap-IF. Важливою новиною є значне зниження показників DER та cpWER у системі AliMeeting — з 88.11/89.61 до 3.35/17.18, що свідчить про значне підвищення точності розпізнавання та транскрибування аудіо.

Alibaba заявляє, що аудіоможливості Qwen3.8-Omni-Flash загалом перевищують можливості Gemini 3.8 Flash, а за сукупними аудіо- та відеоможливостями модель наближається до свого конкурента. При цьому компанія зробила ставку на доступність, знизивши вартість API для обробки аудіо вхідних даних більш ніж на 98%, а для аудіо- та відеовхідних даних — понад 93%.

Для підтримки обробки довгих аудіо- та відеоматеріалів Alibaba розширила Qwen-MM-Plugins та представила відкритий Qwen-Live Harness. Qwen-MM-Plugins орієнтовані на ефективну роботу з довгими робочими процесами, забезпечення контекстуального виклику інструментів та їх виконання. Qwen-Live Harness, своєю чергою, призначений для забезпечення реальної, безперервної мультимодальної взаємодії.

Модель відкриває нові горизонти у розумінні довготривалого аудіо та відеоконтенту. Тепер вона може:

Функція керованого створення субтитрів для аудіо та відео дозволяє користувачам вказувати об’єкт опису, часовий діапазон, рівень деталізації інформації та формат виведення.

У сфері агентського розуміння довготривалого відеоконтенту Qwen3.8-Omni-Flash також демонструє вражаючий прогрес. Наприклад, у OmniVideoBench точність зросла з 63.4% до 67.8%, при цьому споживання токенів зменшилося приблизно на 45.7%.

У контексті робочих зустрічей модель може обробляти до однієї години аудіо- та відеозаписів. Вона здатна визначати учасників розмови, здійснювати транскрибування та зіставляти репліки з відповідними спікерами. Крім того, Qwen3.8-Omni-Flash може генерувати протоколи зустрічей, списки завдань, а також аналізувати ризики проєкту. Інтеграція з інструментами дозволяє автоматично надсилати електронні листи, впорядковувати завдання або генерувати код.

Можливості моделі не обмежуються розумінням. Qwen3.8-Omni-Flash також ефективна у створенні контенту:

Цікавим прикладом самостійного навчання моделі є експеримент з покращення розпізнавання сичуанського діалекту. За 12 годин Qwen3.8-Omni-Flash самостійно обрала відповідний набір даних, провела 4 експериментальні ітерації, створивши 3413 одиниць навчальних даних. В результаті, показник помилок на рівні символів зменшився з 25.79% до 15.30%, що становить зниження приблизно на 40.7%.

У сфері стиснення інформації був представлений інструмент Video2Note, який генерує PDF-нотатки з текстовим і графічним вмістом з годинних відео. Omni Skill Creator дозволяє витягувати стандартизовані робочі процеси з демонстраційних операцій та перетворювати їх на повторно використовувані навички для Agent.

Qwen3.8-Omni-Flash-Realtime — це версія моделі, здатна сприймати та реагувати на аудіо- та відеопотоки в режимі реального часу, одночасно викликаючи інструменти з урахуванням поточного контексту. Вона підтримує функцію реального часу для мовних тренувань, поєднуючи моделювання вимови та семантики, розуміючи нестандартні вирази, які можуть бути спотворені акцентом.

Компанія стверджує, що ця реальна версія є першою мультимодальною моделлю, яка підтримує функцію «чути напрямок звуку». Вона інтегрує просторову аудіоінформацію з візуальними даними для визначення напрямку та відстані до джерела звуку. Крім того, через навички (Skills) модель може отримувати інформацію про особу, стиль спілкування, ділові знання та правила взаємодії.

У бенчмарку Agentic Omni Understanding, який включає OmniVideoBench, Video-MME-v2 та LVOmniBench, Qwen3.8-Omni-Flash показала себе в статичному режимі та в режимі агента порівняно з Gemini 3.8 Flash. Детальні результати продуктивності та пропускної здатності API для Qwen3.8-Omni-Flash-Realtime в різних сценаріях вхідних даних також були опубліковані.

Загалом, Qwen3.8-Omni-Flash представляє собою значний крок вперед у розвитку мультимодальних AI-моделей, пропонуючи потужні інструменти для розуміння, генерації та взаємодії з різними типами даних, що відкриває нові можливості для бізнесу та користувачів.

Джерело: https://www.ithome.com/1/004/049.htm

  • Останні
Більше новин

Новини по днях

Сьогодні,
18 вересня 2026

Новини на тему

Більше новин