HAVE AI NEWS HAVE AI NEWS
Модели

Тестирование Qwen3.8-Flash-Next: сравнение с боевыми моделями и важность многократных прогонов

Тестирование Qwen3.8-Flash-Next: сравнение с боевыми моделями и важность многократных прогонов

Свежие тесты архитектуры Qwen3.8-Flash-Next показали сопоставимое качество с Qwen3.8-27B при заметных архитектурных новшествах, однако переход в продакшн пока сдерживается ограниченной поддержкой движков инференса.

С выходом предварительной версии Qwen3.8-Flash-Next появилась возможность оценить новую архитектуру, которая станет базой для будущего поколения Qwen4. Модель использует гибридный подход: из общих 125 млрд параметров на каждый токен активируются всего 6 млрд, а еще 51 млрд вынесены в n-gram-эмбэддинги, подгружаемые точечно с дискового накопителя без вычислений по классической dense-схеме.

Тестирование проводилось на видеокарте RTX PRO 6000 с прицелом на применимость в конфигурациях уровня RTX 5090 с 32 ГБ VRAM. Параллельно были скорректированы данные предыдущих замеров: боевой сервер использует официальный Qwen3.8-27B-NVFP4A16 со включенной спекуляцией MTP, а не тестовый сторонний чекпойнт.

Результаты бенчмарков

Для минимизации погрешности каждая конфигурация прогонялась по три раза. Сводные результаты представлены в таблице:

МодельПрогоновБаллσУспехСкорость (ток/с)
Flash-Next (Q3_K_XL)30.7860.01743/5079.1
Flash-Next (Q4_K_XL)30.7850.02144/5077.4
Qwen3.8-27B (NVFP4A16, прод)30.7690.00741/5070.0
Ornith-35B (MoE)20.7320.00442/50238.1
Ornith-9B30.5900.03730/50121.4

Анализ точности и квантования

Показатели Flash-Next и продакшн-версии 27B находятся в пределах статистической погрешности: 0.786 против 0.769. При этом повышение точности квантования с Q3 до Q4 не дало прироста баллов (0.785 против 0.786), однако привело к повышенному расходу видеопамяти.

MoE-модель Ornith-35B уступает лидерам около 0.05 балла, но выигрывает по скорости генерации более чем в 3,4 раза (238 токенов в секунду против ~70–79 у конкурентов). Компактная Ornith-9B ожидаемо заняла последнее место с баллом 0.590 и повышенным разбросом результатов.

Специфика инференса и статус экосистемы

В процессе ночного тестирования возникли сложности с доступностью внешних моделей-судей через API (ошибки из-за перегрузки серверов), что потребовало изоляции сбойных задач и их повторного прогона.

На текущий момент запуск Flash-Next доступен преимущественно через llama.cpp. Движки уровня vLLM и SGLang пока не получили полноценной поддержки новых компонентов модели — механизма Gated DeltaNet, разреженного внимания и таблиц n-gram. Из-за отсутствия отлаженной инфраструктуры и MTP-спекуляции в промышленных средах скорый перевод боевых сервисов на новую архитектуру сопряжен с компромиссами.

Автор: daniel_ivanov2 часа назад

Источник: habr.com

Комментарии

, чтобы оставить комментарий.

Пока нет комментариев.