Зачем отказываться от градиентного бустинга
Долгое время финальный этап отбора контента в рекомендациях строился на деревьях решений (GBDT). Однако классический бустинг исчерпал потенциал развития платформы рекомендаций из-за двух фундаментальных проблем:
- Негибкий одномерный скор: итоговое число невозможно динамически разобрать или перенастроить на лету под разные сценарии.
- Сложный ручной инжиниринг признаков: разработчикам приходилось вручную вычислять перекрестные метрики, комбинировать табличные показатели и объединять их с векторными эмбеддингами.
Решением команды AI VK стал переход на сквозную многозадачную нейросетевую модель, которая самостоятельно находит скрытые взаимосвязи в сырых логах.
Ключевые инженерные решения нейроранкера
Кусочно-линейное кодирование признаков
Непрерывные числовые фичи с тяжелыми хвостами распределений плохо воспринимаются нейросетями напрямую. Для решения этой проблемы диапазон значений разбивается на фиксированные бакеты. Модель определяет положение признака на шкале и интерполирует его между границами, формируя информативный обучаемый вектор без потери точности.
Архитектура DCDN со встроенным делением
Классическая сеть Deep & Cross Network (DCN) эффективно перемножает признаки, но не умеет работать с отрицательными степенями полиномов. Из-за этого относительные величины (например, CTR — отношение кликов к показам) требовали множества лишних параметров для аппроксимации. В обновленной архитектуре DCDN (Deep Cross-Division Network) операцию деления внедрили прямо в базовые слои. Теперь сеть вычисляет относительные показатели и коэффициенты досмотров автоматически в процессе градиентного спуска.
Многозадачность и гетерогенное внимание
После ядра DCDN данные проходят через механизм гетерогенного внимания (Heterogeneous Attention) и направляются в три независимые предиктивные головы:
- Оценка вероятности лайка.
- Прогноз риска дизлайка или скрытия публикации.
- Расчет ожидаемой длительности просмотра.
Чтобы обучение задач не конфликтовало, градиенты между головами изолированы через stop_gradient. Поверх сформированных оценок работает компактная нейросеть Learning to Rank (LTR), которая находит баланс между сигналами и выстраивает финальный порядок ленты в рантайме.
Вероятностный прогноз времени просмотра (HEGM)
Попытка предсказать длительность просмотра через стандартную функцию потерь MSE давала усредненный результат из-за бимодальности поведения аудитории: пользователи либо быстро перелистывают ролик (скип за 1–3 секунды), либо затягиваются в глубокий просмотр. Среднее значение не отражало реального сценария.
Инженеры применили иерархическую смесь распределений HEGM (Hierarchical Exponential-Gaussian Mixture):
- Экспоненциальное распределение оценивает вероятность мгновенного свайпа.
- Смесь гауссиан прогнозирует этапы длительного вовлеченного просмотра.
Оптимизация строится на методе максимального правдоподобия (MLE). Чтобы предотвратить схлопывание дисперсий гауссиан в дельта-функции, применили равномерную инициализацию математических ожиданий по временной шкале и добавили регуляризационные штрафы за дивергенцию.
Итоги внедрения
Перевод ранжирования на новую нейросетевую архитектуру принес ощутимый продуктовый прирост в VK Клипах:
- Общее время просмотра (Total Watch Time) выросло на 5,5%.
- Число лайков увеличилось на 5%.
- Количество репостов (шеров) подскочило на 15%.
Платформа Discovery позволяет масштабировать эту модель и динамически подключать новые продукты экосистемы без необходимости переписывать рекомендательные алгоритмы с нуля.
Комментарии
, чтобы оставить комментарий.
Пока нет комментариев.