HAVE AI NEWS HAVE AI NEWS
en

Исследования

Новости категории «Исследования»

Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач

Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.

Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев

Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.