Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.