HAVE AI NEWS HAVE AI NEWS
en
Исследования

Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев

Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев

Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.

Специалисты из мультимодального подразделения Tencent совместно с Университетом Сунь Ятсена изучили, насколько качественно современные большие языковые модели справляются с ролевыми сценариями. Эксперименты показали, что ИИ в целом испытывает сложности с отыгрышем: средний балл даже для положительных персонажей составил всего 3,21 из 5. В случае со злодеями результаты оказались еще ниже — 2,61 балла. Основная причина кроется в алгоритмах выравнивания (safety alignment), которые блокируют эгоизм, обман и манипуляции даже в рамках художественного вымысла.

Бенчмарк Moral RolePlay и градация морали

Для детального анализа авторы создали бенчмарк Moral RolePlay на базе массива данных COSER. Вся выборка персонажей была разделена на четыре уровня моральной ориентации:

  • Level 1 (Образцы добродетели) — абсолютно альтруистичные и самоотверженные герои;

  • Level 2 (Несовершенные, но положительные) — персонажи с благими намерениями, но обладающие импульсивностью или спорными привычками;

  • Level 3 (Эгоисты) — манипуляторы, преследующие исключительно собственную выгоду, но не являющиеся абсолютным злом;

  • Level 4 (Злодеи) — откровенные антагонисты, целенаправленно сеющие хаос и причиняющие вред.

Исходный массив включал более 23 тысяч сцен и свыше 54 тысяч портретов персонажей, где злодеи составляли всего 2,6%. Для чистоты эксперимента ученые сформировали сбалансированную выборку из 800 персонажей (по 200 на каждый уровень), описанных через комбинации из 77 личностных характеристик.

Методология оценки качества отыгрыша

Моделям предлагалось вжиться в заданный образ с подробным описанием черт и контекста диалога. Точность передачи характера (Character Fidelity) оценивалась специальной судейской LLM, начислявшей штрафы за каждое нарушение персоналии.

Итоговая формула рассчитывалась следующим образом: S = 5 − 0,5 × D − 0,1 × Dm + 0,15 × T, где D — сумма штрафов, Dm — максимальный единичный штраф за грубое нарушение, а T — объем реплик персонажа. Предельный результат равен 5 баллам, однако на практике средние оценки лучших решений даже на героях не превышали 3,42.

Результаты тестов: ключевые паттерны падения качества

В испытаниях участвовали 17 современных нейросетей, включая GPT-4o, Claude Opus 4.1, Grok-4, Gemini 2.5 Pro и DeepSeek-v3. Все модели продемонстрировали схожую тенденцию: качество генерации неуклонно снижается по мере ухудшения морального облика героя.

  • Level 1 (герои) — средняя оценка 3,21;

  • Level 2 (несовершенные герои) — 3,13;

  • Level 3 (эгоисты) — 2,71;

  • Level 4 (злодеи) — 2,61.

Наиболее выраженный спад (на 0,42 балла) зафиксирован при переходе от доброжелательных персонажей к эгоистам. Это свидетельствует о том, что барьером для ИИ становится сам факт нечестного или корыстного поведения, а не масштабы злодеяний.

Самые проблемные черты характера

Штрафы за негативные качества оказались ощутимо выше, чем за нейтральные или позитивные (в среднем 3,41 против 3,23 и 3,16 балла соответственно). Сложнее всего моделям давались:

  • лицемерие (штраф 3,55);

  • лживость (3,54);

  • эгоизм (3,52);

  • подозрительность (3,47);

  • паранойя (3,47);

  • жадность (3,44);

  • злонамеренность (3,42);

  • склонность к манипуляциям (3,39).

В то же время такие положительные черты, как храбрость или стойкость, нейросети отыгрывали практически без ошибок, что подтверждает избирательный характер проблемы.

Несоответствие лидербордам и примитивизация злодеев

Рейтинг в Chatbot Arena оказался плохим ориентиром для оценки ролевых способностей ИИ. На специально составленном лидерборде Villain RolePlay (VRP) расстановка сил кардинально изменилась:

  1. glm-4.6 — 2,96 балла (10-е место в Arena);

  2. deepseek-v3.1-thinking — 2,82 балла;

  3. kimi-k2 — 2,79 балла;

  4. gemini-2.5-pro — 2,75 балла;

  5. deepseek-v3.1 — 2,71 балла.

Лидеры общего зачета Arena показали слабые результаты: claude-opus-4.1-thinking опустился на 13-ю строчку VRP (2,53 балла), а claude-sonnet-4.5 занял лишь 9-е место (2,56 балла).

Качественный анализ выявил, что строгие фильтры заставляют модели упрощать персонажей. Вместо хитрых интриг и психологического давления ИИ скатывается в банальные оскорбления и открытые угрозы. Системы безопасности строже реагируют на расчетливый обман, чем на примитивную агрессию, поэтому диалоги теряют глубину.

Подключение режима рассуждений (chain-of-thought) также не решило проблему: пошаговый анализ лишь усиливает самоцензуру, заставляя модель рефлексировать над этичностью реплик и ухудшать отыгрыш.

Почему это важно

Ограниченность ИИ в симуляции отрицательного поведения снижает его ценность для применения в сценарном деле, психологических симуляциях, образовательных программах с моральными дилеммами и тренировках навыков ведения сложных переговоров. Авторы работы подчеркивают необходимость создания более гибких систем безопасности, способных отличать реальный вред от ролевой игры в рамках вымышленного контекста.

Автор: Konstantine Mozgovoy

Источник: neurohive.io

Комментарии

Войдите , чтобы оставить комментарий.

Пока нет комментариев.