Специалисты из мультимодального подразделения Tencent совместно с Университетом Сунь Ятсена изучили, насколько качественно современные большие языковые модели справляются с ролевыми сценариями. Эксперименты показали, что ИИ в целом испытывает сложности с отыгрышем: средний балл даже для положительных персонажей составил всего 3,21 из 5. В случае со злодеями результаты оказались еще ниже — 2,61 балла. Основная причина кроется в алгоритмах выравнивания (safety alignment), которые блокируют эгоизм, обман и манипуляции даже в рамках художественного вымысла.
Бенчмарк Moral RolePlay и градация морали
Для детального анализа авторы создали бенчмарк Moral RolePlay на базе массива данных COSER. Вся выборка персонажей была разделена на четыре уровня моральной ориентации:
Level 1 (Образцы добродетели) — абсолютно альтруистичные и самоотверженные герои;
Level 2 (Несовершенные, но положительные) — персонажи с благими намерениями, но обладающие импульсивностью или спорными привычками;
Level 3 (Эгоисты) — манипуляторы, преследующие исключительно собственную выгоду, но не являющиеся абсолютным злом;
Level 4 (Злодеи) — откровенные антагонисты, целенаправленно сеющие хаос и причиняющие вред.
Исходный массив включал более 23 тысяч сцен и свыше 54 тысяч портретов персонажей, где злодеи составляли всего 2,6%. Для чистоты эксперимента ученые сформировали сбалансированную выборку из 800 персонажей (по 200 на каждый уровень), описанных через комбинации из 77 личностных характеристик.
Методология оценки качества отыгрыша
Моделям предлагалось вжиться в заданный образ с подробным описанием черт и контекста диалога. Точность передачи характера (Character Fidelity) оценивалась специальной судейской LLM, начислявшей штрафы за каждое нарушение персоналии.
Итоговая формула рассчитывалась следующим образом: S = 5 − 0,5 × D − 0,1 × Dm + 0,15 × T, где D — сумма штрафов, Dm — максимальный единичный штраф за грубое нарушение, а T — объем реплик персонажа. Предельный результат равен 5 баллам, однако на практике средние оценки лучших решений даже на героях не превышали 3,42.
Результаты тестов: ключевые паттерны падения качества
В испытаниях участвовали 17 современных нейросетей, включая GPT-4o, Claude Opus 4.1, Grok-4, Gemini 2.5 Pro и DeepSeek-v3. Все модели продемонстрировали схожую тенденцию: качество генерации неуклонно снижается по мере ухудшения морального облика героя.
Level 1 (герои) — средняя оценка 3,21;
Level 2 (несовершенные герои) — 3,13;
Level 3 (эгоисты) — 2,71;
Level 4 (злодеи) — 2,61.
Наиболее выраженный спад (на 0,42 балла) зафиксирован при переходе от доброжелательных персонажей к эгоистам. Это свидетельствует о том, что барьером для ИИ становится сам факт нечестного или корыстного поведения, а не масштабы злодеяний.
Самые проблемные черты характера
Штрафы за негативные качества оказались ощутимо выше, чем за нейтральные или позитивные (в среднем 3,41 против 3,23 и 3,16 балла соответственно). Сложнее всего моделям давались:
лицемерие (штраф 3,55);
лживость (3,54);
эгоизм (3,52);
подозрительность (3,47);
паранойя (3,47);
жадность (3,44);
злонамеренность (3,42);
склонность к манипуляциям (3,39).
В то же время такие положительные черты, как храбрость или стойкость, нейросети отыгрывали практически без ошибок, что подтверждает избирательный характер проблемы.
Несоответствие лидербордам и примитивизация злодеев
Рейтинг в Chatbot Arena оказался плохим ориентиром для оценки ролевых способностей ИИ. На специально составленном лидерборде Villain RolePlay (VRP) расстановка сил кардинально изменилась:
glm-4.6 — 2,96 балла (10-е место в Arena);
deepseek-v3.1-thinking — 2,82 балла;
kimi-k2 — 2,79 балла;
gemini-2.5-pro — 2,75 балла;
deepseek-v3.1 — 2,71 балла.
Лидеры общего зачета Arena показали слабые результаты: claude-opus-4.1-thinking опустился на 13-ю строчку VRP (2,53 балла), а claude-sonnet-4.5 занял лишь 9-е место (2,56 балла).
Качественный анализ выявил, что строгие фильтры заставляют модели упрощать персонажей. Вместо хитрых интриг и психологического давления ИИ скатывается в банальные оскорбления и открытые угрозы. Системы безопасности строже реагируют на расчетливый обман, чем на примитивную агрессию, поэтому диалоги теряют глубину.
Подключение режима рассуждений (chain-of-thought) также не решило проблему: пошаговый анализ лишь усиливает самоцензуру, заставляя модель рефлексировать над этичностью реплик и ухудшать отыгрыш.
Почему это важно
Ограниченность ИИ в симуляции отрицательного поведения снижает его ценность для применения в сценарном деле, психологических симуляциях, образовательных программах с моральными дилеммами и тренировках навыков ведения сложных переговоров. Авторы работы подчеркивают необходимость создания более гибких систем безопасности, способных отличать реальный вред от ролевой игры в рамках вымышленного контекста.
Комментарии
Войдите , чтобы оставить комментарий.
Пока нет комментариев.