Alibaba представила Qwen3.8-Flash-Next: обходить Claude Opus у тестах

Нова модель Qwen3.8-Flash-Next з відкритими вагами перевершує Claude Opus 4.6 Max у програмуванні та агентських завданнях, маючи лише 6 млрд активних параметрів на токен.

cpaua1 хв124
Alibaba представила Qwen3.8-Flash-Next: обходить Claude Opus у тестах
photo_3753.jpg

Alibaba представила Qwen3.8-Flash-Next з Hugging FaceQwen/Qwen3.8-Flash-Nexthuggingface.co/Qwen/Qwen3.8-Flash-Next вагами, і вона вже обходить Claude Opus 4.6 Max одразу в кількох тестах.

Це ще не повноцінна Qwen4, а раннє прев'ю її архітектури.

125 млрд параметрів основної моделі плюс 51 млрд параметрів n-грамних представлень, при цьому на кожен токен активується лише 6 млрд параметрів.

Навчання обійшлося приблизно в 9 разів дешевше, ніж Qwen3.7-Plus, але в програмуванні та офісних завданнях модель виявилася сильнішою.

Основні результати:

• SWE-bench Pro — 62,5 проти 53,4 у Claude Opus 4.6 Max
• SWE-bench Multilingual — 81,0
• CoWorkBench — 73,9
• JobBench — 55,7
• Toolathlon — 73,5
• LiveCodeBench — 91,9
• GPQA Diamond — 91,7
• IFBench — 81,3

Нативний контекст 256K токенів, через YaRN розширюється до 1 млн.

На контексті в 1 млн токенів попередня обробка прискорюється до 7,6 раза, а генерація — до 4,9 раза.

Усього 6 млрд активних параметрів на токен, а рівень уже порівнянний з Opus в агентських завданнях і програмуванні.

Зовсім скоро модель з'явиться через API за ціною $0,16 за 1 млн вхідних токенів і $0,47 за 1 млн вихідних.

Поділитися

Автор

cpaua

Адміністратор блогу VibeCode. Пишу про vibe coding, AI та open source.

Коментарі

Щоб залишити коментар, увійдіть або зареєструйтеся
Завантаження...

Дайджест щотижня

Найкраще про vibe coding, AI-агентів та open source — раз на тиждень, без спаму.