HAVE AI NEWS HAVE AI NEWS
Модели

Архитектурный прорыв Qwen 4: как устроена модель Qwen3.8-Flash-Next

Архитектурный прорыв Qwen 4: как устроена модель Qwen3.8-Flash-Next

Alibaba представила Qwen3.8-Flash-Next — превью архитектуры будущей Qwen 4. Модель на 180 млрд параметров задействует лишь 6 млрд на токен и способна работать на 128 ГБ системной памяти.

Компания Alibaba выпустила мультимодальную MoE-модель Qwen3.8-Flash-Next. Этот релиз служит технологическим превью архитектуры, которая ляжет в основу будущего флагмана Qwen 4 — аналогично тому, как в свое время Qwen3-Next задала стандарт гибридного внимания для линеек Qwen3.5–3.8.

Ключевые нововведения в архитектуре Qwen 4

В основе модели лежит концепция Mixture-of-Experts, оптимизированная для эффективной локальной работы и взаимодействия со сверхдлинным контекстом (262K нативно и до 1 млн токенов через YaRN):

  • Низкое число активных параметров при огромной базе знаний: суммарно модель насчитывает около 180 млрд весов (125 млрд в MoE-графе, 51 млрд в N-gram таблицах и 4 млрд в блоке MTP). При этом на обработку одного токена задействуется лишь 6 млрд параметров (10 маршрутизируемых экспертов из 512 плюс 1 общий). По скорости это уровень легких 6B-моделей, а по эрудиции — тяжелых систем класса 70B+.

  • N-gram память на 51 млрд параметров с офлоадингом: отдельный слой эмбеддингов хранит 20 млн n-грамм (биграмм и триграмм). Поскольку ключи представляют собой детерминированные хеши, позиции обращений известны заранее. Это позволяет выгружать весь 51B-слой в обычную оперативную память или на быстрый NVMe SSD через mmap с асинхронной подгрузкой, освобождая драгоценную видеопамять без потери точности.

  • Гибридный механизм GDN + QSA: модель состоит из 48 слоев. Из них 36 уровней используют Gated DeltaNet (GDN), сжимая историю в фиксированное рекуррентное состояние и сдерживая рост KV-кэша. Оставшиеся 12 слоев работают на базе Qwen Sparse Attention (QSA) — алгоритма разреженного внимания, который анализирует историю микроблоками и ускоряет этап Prefill на контекстах в 1 млн токенов до 8,6 раз.

  • Четырехпоточный Gated Residual и блок MTP: механизм разделяет residual-поток на 4 независимые ветки в формате FP8 (одна из них выполняет роль магистрали для стабилизации обучения). Дополнительный слой Multi-Token Prediction (MTP) прогнозирует токены на несколько шагов вперед, ускоряя генерацию методом спекулятивного декодирования.

Сравнение характеристик

ПараметрQwen 3.8 27B (Dense)Qwen3.8-Flash-Next (Qwen 4 MoE)
Тип архитектурыПлотная (Dense)MoE + N-gram память
Общий объем параметров27 млрд~180 млрд (125B MoE + 51B N-gram + 4B MTP)
Активные параметры на токен27 млрд6 млрд
Механизм вниманияGDN + Gated AttentionGDN + QSA (Sparse Attention)
N-gram памятьНет51B параметров (поддержка mmap)
Residual-связиОдиночный поток4-поточный Gated Residual
Нативный контекст262K262K (до 1M через YaRN)

Результаты в бенчмарках

Несмотря на то что активный объем вычислений у Qwen3.8-Flash-Next в 4,5 раза меньше по сравнению с плотной версией на 27B, модель существенно превосходит ее в агентских сценариях и программировании:

БенчмаркQwen3.8-Flash-NextQwen3.8-27BРазница
DeepSWE 1.1 (агентский кодинг)58.742.2+16,5
SWE-bench Pro62.561.7+0,8
SWE-bench Multilingual81.073.8+7,2
NL2Repo-Bench48.142.3+5,8
CoWorkBench73.970.7+3,2
JobBench55.733.4+22,3
Agents’ Last Exam (Score / Pass@1)51.2 / 24.342.9 / 20.4+8,3 / +3,9
Toolathlon Verified (Pass@1)73.567.1+6,4
IFBench81.379.5+1,8
GPQA Diamond91.789.2+2,5
HLE (GPT-4o judge)35.930.8+5,1
LiveCodeBench v691.990.3+1,6

Локальный запуск на 128 ГБ ОЗУ

Возможность выгружать массивные N-gram таблицы в системную память через mmap сделала запуск модели со 180 млрд весов доступным на рабочих станциях без огромных GPU-кластеров:

  • Потребление памяти: 4-битные квантованные сборки (форматы UD-Q4_K_XL и UD-IQ4_XS для GGUF / llama.cpp / Unsloth) требуют порядка 85–110 ГБ Unified Memory или RAM.

  • Производительность: скорость генерации на ПК и Mac со 128 ГБ памяти достигает 20–30 токенов в секунду при наличии дискретного ускорителя.

  • Гибридные рассуждения: доступно гибкое управление глубиной логических выводов (параметр reasoning_effort) и сохранение цепочки рассуждений между репликами.

Новая архитектура задает практичный стандарт для развертывания умных локальных агентов, сочетая флагманское качество с умеренными аппаратными требованиями.

Автор: ToxaBes3 часа назад

Источник: habr.com

Комментарии

, чтобы оставить комментарий.

Пока нет комментариев.