HAVE AI NEWS HAVE AI NEWS
en

#Бенчмарки

Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач

Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.

Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев

Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.

Релиз GLM-5: открытая модель от Zhipu AI выходит на уровень лидеров в агентном программировании

Zhipu AI и Университет Цинхуа представили GLM-5 — мощную открытую MoE-модель на 744 млрд параметров, способную автономно писать код, вести глубокий веб-поиск и решать сложные многошаговые задачи наравне с проприетарными флагманами.

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.

OpenAI представила первый собственный ИИ-чип Jalapeño для конкуренции с Nvidia в инференсе

OpenAI опубликовала первые результаты тестов Jalapeño — собственного чипа для инференса, разработанного совместно с Broadcom, заявив о значительном превосходстве в скорости и энергоэффективности над решениями Nvidia.