“AI Арена”: GPT-6 лідирує у рейтингу моделей
Bilibili офіційно представив свою нову платформу “AI Арена”, яка призначена для оцінки великих мовних моделей (LLM) зусиллями спільноти користувачів.
Ця ініціатива від Bilibili позиціонується як унікальний майданчик, де популярні блогери (UP-продюсери) платформи проводять реальні тести сотень великих мовних моделей. На відміну від традиційних синтетичних тестів, “AI Арена” дозволяє авторам контенту самостійно визначати теми та сценарії тестування, демонструючи фактичну продуктивність моделей у різноманітних завданнях, таких як програмування, логічні міркування, співпраця та обробка знань.
На платформі представлені результати тестів таких відомих моделей, як DeepSeek, Kimi, ChatGPT, Claude, Gemini, Doubao (豆包), Qwen (千问), Hy, MiniMax та багатьох інших. Рейтинги оновлюються в режимі реального часу, а до участі в тестуванні запрошуються всі UP-продюсери платформи.
За результатами першого раунду тестування, який охопив 10 різних UP-продюсерів, модель GPT-6 Astra посіла перше місце. Вона випередила GLM-5.3, здобувши найбільшу кількість перемог у різних тестах. Варто зазначити, що в топ-5 списку кращих моделей три позиції зайняли китайські розробки, що свідчить про зростання конкурентоспроможності вітчизняних LLM.
Запуск “AI Арени” відбувся на тлі значного зростання популярності контенту, пов’язаного зі штучним інтелектом, на платформі Bilibili. За останній рік час споживання контенту про AI на Bilibili збільшився на 72%. Понад 190 мільйонів користувачів щомісяця переглядають матеріали, присвячені AI. Платформа стала справжнім епіцентром для створення та обговорення контенту про AI, охоплюючи весь цикл від випуску нових моделей до їх використання, обговорення та отримання допомоги від спільноти.
“AI Арена” також відкрита для всіх UP-продюсерів Bilibili, що сприятиме подальшому розширенню бази тестів та моделей, а також залученню ширшої аудиторії до оцінки технологій штучного інтелекту.
Ця ініціатива Bilibili не тільки надає цінну інформацію для користувачів та розробників LLM, але й стимулює розвиток AI-спільноти на платформі, роблячи процес оцінки моделей більш прозорим, інтерактивним та заснованим на реальних сценаріях використання.
Джерело: https://www.ithome.com/1/004/738.htm
- Останні
- Популярні
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
-
- Вересень, 19
-
Новини по днях
20 вересня 2026