Alibaba презентує Qwen3.8-Omni-Flash: мультимодальний AI з великим контекстом
Alibaba представила нову генеративну модель Qwen3.8-Omni-Flash, яка вражає своїми мультимодальними можливостями та величезним контекстним вікном. Ця модель здатна одночасно обробляти текст, зображення, аудіо та відео, пропонуючи вражаюче вікно контексту до 1 мільйона токенів.
Qwen3.8-Omni-Flash — це наступне покоління повністю інтегрованих мультимодальних моделей від Alibaba. На відміну від попередніх версій, ця модель забезпечує значне покращення у сфері обробки аудіо та відео, зберігаючи при цьому високу продуктивність у роботі з текстом.
За даними компанії, в 30 різних тестах Qwen3.8-Omni-Flash продемонструвала середнє покращення результатів на понад 26% порівняно з попередньою моделлю Qwen3.5-Omni-Plus. Особливо помітний прогрес спостерігається у сферах роботи з аудіо- та відеоагентами, кодуванням та обробкою довгих завдань. Наприклад, у бенчмарку WildClawBench-MM показники зросли на 36.5 бала, а в AgenticVBench — на 22.3 бала.
Базові мультимодальні можливості також були суттєво покращені. Модель показала зростання на 8.3 бала в LongAudioSpan, на 9.6 бала в OmniVideoBench, а також покращення показників CSR та ISR відповідно на 8.5 та 14.1 бала в OmniCap-IF. Важливою новиною є значне зниження показників DER та cpWER у системі AliMeeting — з 88.11/89.61 до 3.35/17.18, що свідчить про значне підвищення точності розпізнавання та транскрибування аудіо.
Alibaba заявляє, що аудіоможливості Qwen3.8-Omni-Flash загалом перевищують можливості Gemini 3.8 Flash, а за сукупними аудіо- та відеоможливостями модель наближається до свого конкурента. При цьому компанія зробила ставку на доступність, знизивши вартість API для обробки аудіо вхідних даних більш ніж на 98%, а для аудіо- та відеовхідних даних — понад 93%.
Для підтримки обробки довгих аудіо- та відеоматеріалів Alibaba розширила Qwen-MM-Plugins та представила відкритий Qwen-Live Harness. Qwen-MM-Plugins орієнтовані на ефективну роботу з довгими робочими процесами, забезпечення контекстуального виклику інструментів та їх виконання. Qwen-Live Harness, своєю чергою, призначений для забезпечення реальної, безперервної мультимодальної взаємодії.
Модель відкриває нові горизонти у розумінні довготривалого аудіо та відеоконтенту. Тепер вона може:
Функція керованого створення субтитрів для аудіо та відео дозволяє користувачам вказувати об’єкт опису, часовий діапазон, рівень деталізації інформації та формат виведення.
У сфері агентського розуміння довготривалого відеоконтенту Qwen3.8-Omni-Flash також демонструє вражаючий прогрес. Наприклад, у OmniVideoBench точність зросла з 63.4% до 67.8%, при цьому споживання токенів зменшилося приблизно на 45.7%.
У контексті робочих зустрічей модель може обробляти до однієї години аудіо- та відеозаписів. Вона здатна визначати учасників розмови, здійснювати транскрибування та зіставляти репліки з відповідними спікерами. Крім того, Qwen3.8-Omni-Flash може генерувати протоколи зустрічей, списки завдань, а також аналізувати ризики проєкту. Інтеграція з інструментами дозволяє автоматично надсилати електронні листи, впорядковувати завдання або генерувати код.
Можливості моделі не обмежуються розумінням. Qwen3.8-Omni-Flash також ефективна у створенні контенту:
Цікавим прикладом самостійного навчання моделі є експеримент з покращення розпізнавання сичуанського діалекту. За 12 годин Qwen3.8-Omni-Flash самостійно обрала відповідний набір даних, провела 4 експериментальні ітерації, створивши 3413 одиниць навчальних даних. В результаті, показник помилок на рівні символів зменшився з 25.79% до 15.30%, що становить зниження приблизно на 40.7%.
У сфері стиснення інформації був представлений інструмент Video2Note, який генерує PDF-нотатки з текстовим і графічним вмістом з годинних відео. Omni Skill Creator дозволяє витягувати стандартизовані робочі процеси з демонстраційних операцій та перетворювати їх на повторно використовувані навички для Agent.
Qwen3.8-Omni-Flash-Realtime — це версія моделі, здатна сприймати та реагувати на аудіо- та відеопотоки в режимі реального часу, одночасно викликаючи інструменти з урахуванням поточного контексту. Вона підтримує функцію реального часу для мовних тренувань, поєднуючи моделювання вимови та семантики, розуміючи нестандартні вирази, які можуть бути спотворені акцентом.
Компанія стверджує, що ця реальна версія є першою мультимодальною моделлю, яка підтримує функцію «чути напрямок звуку». Вона інтегрує просторову аудіоінформацію з візуальними даними для визначення напрямку та відстані до джерела звуку. Крім того, через навички (Skills) модель може отримувати інформацію про особу, стиль спілкування, ділові знання та правила взаємодії.
У бенчмарку Agentic Omni Understanding, який включає OmniVideoBench, Video-MME-v2 та LVOmniBench, Qwen3.8-Omni-Flash показала себе в статичному режимі та в режимі агента порівняно з Gemini 3.8 Flash. Детальні результати продуктивності та пропускної здатності API для Qwen3.8-Omni-Flash-Realtime в різних сценаріях вхідних даних також були опубліковані.
Загалом, Qwen3.8-Omni-Flash представляє собою значний крок вперед у розвитку мультимодальних AI-моделей, пропонуючи потужні інструменти для розуміння, генерації та взаємодії з різними типами даних, що відкриває нові можливості для бізнесу та користувачів.
Джерело: https://www.ithome.com/1/004/049.htm
- Останні
- Популярні
Новини по днях
18 вересня 2026