cpaua
·1 хв2

Alibaba представила Qwen3.8-Flash-Next: обходить Claude Opus у тестах

Alibaba представила Qwen3.8-Flash-Next: обходить Claude Opus у тестах
photo_3753.jpg

Alibaba представила Qwen3.8-Flash-Next з Hugging FaceQwen/Qwen3.8-Flash-Nexthuggingface.co/Qwen/Qwen3.8-Flash-Next вагами, і вона вже обходить Claude Opus 4.6 Max одразу в кількох тестах.

Це ще не повноцінна Qwen4, а раннє прев'ю її архітектури.

125 млрд параметрів основної моделі плюс 51 млрд параметрів n-грамних представлень, при цьому на кожен токен активується лише 6 млрд параметрів.

Навчання обійшлося приблизно в 9 разів дешевше, ніж Qwen3.7-Plus, але в програмуванні та офісних завданнях модель виявилася сильнішою.

Основні результати:

• SWE-bench Pro — 62,5 проти 53,4 у Claude Opus 4.6 Max
• SWE-bench Multilingual — 81,0
• CoWorkBench — 73,9
• JobBench — 55,7
• Toolathlon — 73,5
• LiveCodeBench — 91,9
• GPQA Diamond — 91,7
• IFBench — 81,3

Нативний контекст 256K токенів, через YaRN розширюється до 1 млн.

На контексті в 1 млн токенів попередня обробка прискорюється до 7,6 раза, а генерація — до 4,9 раза.

Усього 6 млрд активних параметрів на токен, а рівень уже порівнянний з Opus в агентських завданнях і програмуванні.

Зовсім скоро модель з'явиться через API за ціною $0,16 за 1 млн вхідних токенів і $0,47 за 1 млн вихідних.

Поділитися:
Автор
cpaua

Адміністратор блогу VibeCode. Пишу про vibe coding, AI та open source.

Коментарі

Щоб залишити коментар, увійдіть або зареєструйтеся
Завантаження...

Схожі статті