С выходом предварительной версии Qwen3.8-Flash-Next появилась возможность оценить новую архитектуру, которая станет базой для будущего поколения Qwen4. Модель использует гибридный подход: из общих 125 млрд параметров на каждый токен активируются всего 6 млрд, а еще 51 млрд вынесены в n-gram-эмбэддинги, подгружаемые точечно с дискового накопителя без вычислений по классической dense-схеме.
Тестирование проводилось на видеокарте RTX PRO 6000 с прицелом на применимость в конфигурациях уровня RTX 5090 с 32 ГБ VRAM. Параллельно были скорректированы данные предыдущих замеров: боевой сервер использует официальный Qwen3.8-27B-NVFP4A16 со включенной спекуляцией MTP, а не тестовый сторонний чекпойнт.
Результаты бенчмарков
Для минимизации погрешности каждая конфигурация прогонялась по три раза. Сводные результаты представлены в таблице:
| Модель | Прогонов | Балл | σ | Успех | Скорость (ток/с) |
|---|---|---|---|---|---|
| Flash-Next (Q3_K_XL) | 3 | 0.786 | 0.017 | 43/50 | 79.1 |
| Flash-Next (Q4_K_XL) | 3 | 0.785 | 0.021 | 44/50 | 77.4 |
| Qwen3.8-27B (NVFP4A16, прод) | 3 | 0.769 | 0.007 | 41/50 | 70.0 |
| Ornith-35B (MoE) | 2 | 0.732 | 0.004 | 42/50 | 238.1 |
| Ornith-9B | 3 | 0.590 | 0.037 | 30/50 | 121.4 |
Анализ точности и квантования
Показатели Flash-Next и продакшн-версии 27B находятся в пределах статистической погрешности: 0.786 против 0.769. При этом повышение точности квантования с Q3 до Q4 не дало прироста баллов (0.785 против 0.786), однако привело к повышенному расходу видеопамяти.
MoE-модель Ornith-35B уступает лидерам около 0.05 балла, но выигрывает по скорости генерации более чем в 3,4 раза (238 токенов в секунду против ~70–79 у конкурентов). Компактная Ornith-9B ожидаемо заняла последнее место с баллом 0.590 и повышенным разбросом результатов.
Специфика инференса и статус экосистемы
В процессе ночного тестирования возникли сложности с доступностью внешних моделей-судей через API (ошибки из-за перегрузки серверов), что потребовало изоляции сбойных задач и их повторного прогона.
На текущий момент запуск Flash-Next доступен преимущественно через llama.cpp. Движки уровня vLLM и SGLang пока не получили полноценной поддержки новых компонентов модели — механизма Gated DeltaNet, разреженного внимания и таблиц n-gram. Из-за отсутствия отлаженной инфраструктуры и MTP-спекуляции в промышленных средах скорый перевод боевых сервисов на новую архитектуру сопряжен с компромиссами.
Комментарии
, чтобы оставить комментарий.
Пока нет комментариев.