Исследования
Новости категории «Исследования»
Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач
Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.
Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев
Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.
Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%
Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.