Компания Alibaba выпустила мультимодальную MoE-модель Qwen3.8-Flash-Next. Этот релиз служит технологическим превью архитектуры, которая ляжет в основу будущего флагмана Qwen 4 — аналогично тому, как в свое время Qwen3-Next задала стандарт гибридного внимания для линеек Qwen3.5–3.8.
Ключевые нововведения в архитектуре Qwen 4
В основе модели лежит концепция Mixture-of-Experts, оптимизированная для эффективной локальной работы и взаимодействия со сверхдлинным контекстом (262K нативно и до 1 млн токенов через YaRN):
Низкое число активных параметров при огромной базе знаний: суммарно модель насчитывает около 180 млрд весов (125 млрд в MoE-графе, 51 млрд в N-gram таблицах и 4 млрд в блоке MTP). При этом на обработку одного токена задействуется лишь 6 млрд параметров (10 маршрутизируемых экспертов из 512 плюс 1 общий). По скорости это уровень легких 6B-моделей, а по эрудиции — тяжелых систем класса 70B+.
N-gram память на 51 млрд параметров с офлоадингом: отдельный слой эмбеддингов хранит 20 млн n-грамм (биграмм и триграмм). Поскольку ключи представляют собой детерминированные хеши, позиции обращений известны заранее. Это позволяет выгружать весь 51B-слой в обычную оперативную память или на быстрый NVMe SSD через
mmapс асинхронной подгрузкой, освобождая драгоценную видеопамять без потери точности.Гибридный механизм GDN + QSA: модель состоит из 48 слоев. Из них 36 уровней используют Gated DeltaNet (GDN), сжимая историю в фиксированное рекуррентное состояние и сдерживая рост KV-кэша. Оставшиеся 12 слоев работают на базе Qwen Sparse Attention (QSA) — алгоритма разреженного внимания, который анализирует историю микроблоками и ускоряет этап Prefill на контекстах в 1 млн токенов до 8,6 раз.
Четырехпоточный Gated Residual и блок MTP: механизм разделяет residual-поток на 4 независимые ветки в формате FP8 (одна из них выполняет роль магистрали для стабилизации обучения). Дополнительный слой Multi-Token Prediction (MTP) прогнозирует токены на несколько шагов вперед, ускоряя генерацию методом спекулятивного декодирования.
Сравнение характеристик
| Параметр | Qwen 3.8 27B (Dense) | Qwen3.8-Flash-Next (Qwen 4 MoE) |
|---|---|---|
| Тип архитектуры | Плотная (Dense) | MoE + N-gram память |
| Общий объем параметров | 27 млрд | ~180 млрд (125B MoE + 51B N-gram + 4B MTP) |
| Активные параметры на токен | 27 млрд | 6 млрд |
| Механизм внимания | GDN + Gated Attention | GDN + QSA (Sparse Attention) |
| N-gram память | Нет | 51B параметров (поддержка mmap) |
| Residual-связи | Одиночный поток | 4-поточный Gated Residual |
| Нативный контекст | 262K | 262K (до 1M через YaRN) |
Результаты в бенчмарках
Несмотря на то что активный объем вычислений у Qwen3.8-Flash-Next в 4,5 раза меньше по сравнению с плотной версией на 27B, модель существенно превосходит ее в агентских сценариях и программировании:
| Бенчмарк | Qwen3.8-Flash-Next | Qwen3.8-27B | Разница |
|---|---|---|---|
| DeepSWE 1.1 (агентский кодинг) | 58.7 | 42.2 | +16,5 |
| SWE-bench Pro | 62.5 | 61.7 | +0,8 |
| SWE-bench Multilingual | 81.0 | 73.8 | +7,2 |
| NL2Repo-Bench | 48.1 | 42.3 | +5,8 |
| CoWorkBench | 73.9 | 70.7 | +3,2 |
| JobBench | 55.7 | 33.4 | +22,3 |
| Agents’ Last Exam (Score / Pass@1) | 51.2 / 24.3 | 42.9 / 20.4 | +8,3 / +3,9 |
| Toolathlon Verified (Pass@1) | 73.5 | 67.1 | +6,4 |
| IFBench | 81.3 | 79.5 | +1,8 |
| GPQA Diamond | 91.7 | 89.2 | +2,5 |
| HLE (GPT-4o judge) | 35.9 | 30.8 | +5,1 |
| LiveCodeBench v6 | 91.9 | 90.3 | +1,6 |
Локальный запуск на 128 ГБ ОЗУ
Возможность выгружать массивные N-gram таблицы в системную память через mmap сделала запуск модели со 180 млрд весов доступным на рабочих станциях без огромных GPU-кластеров:
Потребление памяти: 4-битные квантованные сборки (форматы
UD-Q4_K_XLиUD-IQ4_XSдля GGUF / llama.cpp / Unsloth) требуют порядка 85–110 ГБ Unified Memory или RAM.Производительность: скорость генерации на ПК и Mac со 128 ГБ памяти достигает 20–30 токенов в секунду при наличии дискретного ускорителя.
Гибридные рассуждения: доступно гибкое управление глубиной логических выводов (параметр
reasoning_effort) и сохранение цепочки рассуждений между репликами.
Новая архитектура задает практичный стандарт для развертывания умных локальных агентов, сочетая флагманское качество с умеренными аппаратными требованиями.
Комментарии
, чтобы оставить комментарий.
Пока нет комментариев.