Alibaba представила Qwen3.8-Flash-Next: обходить Claude Opus у тестах
Alibaba представила Qwen3.8-Flash-Next з вагами, і вона вже обходить Claude Opus 4.6 Max одразу в кількох тестах.
Це ще не повноцінна Qwen4, а раннє прев'ю її архітектури.
125 млрд параметрів основної моделі плюс 51 млрд параметрів n-грамних представлень, при цьому на кожен токен активується лише 6 млрд параметрів.
Навчання обійшлося приблизно в 9 разів дешевше, ніж Qwen3.7-Plus, але в програмуванні та офісних завданнях модель виявилася сильнішою.
Основні результати:
• SWE-bench Pro — 62,5 проти 53,4 у Claude Opus 4.6 Max
• SWE-bench Multilingual — 81,0
• CoWorkBench — 73,9
• JobBench — 55,7
• Toolathlon — 73,5
• LiveCodeBench — 91,9
• GPQA Diamond — 91,7
• IFBench — 81,3
Нативний контекст 256K токенів, через YaRN розширюється до 1 млн.
На контексті в 1 млн токенів попередня обробка прискорюється до 7,6 раза, а генерація — до 4,9 раза.
Усього 6 млрд активних параметрів на токен, а рівень уже порівнянний з Opus в агентських завданнях і програмуванні.
Зовсім скоро модель з'явиться через API за ціною $0,16 за 1 млн вхідних токенів і $0,47 за 1 млн вихідних.