#Бенчмарки
Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач
Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.
Слишком правильные: исследование показало, почему ИИ не умеет убедительно отыгрывать злодеев
Исследователи из Tencent и Университета Сунь Ятсена выяснили, что встроенные механизмы безопасности мешают языковым моделям вживаться в роли отрицательных персонажей, заменяя тонкие манипуляции шаблонной агрессией.
Релиз GLM-5: открытая модель от Zhipu AI выходит на уровень лидеров в агентном программировании
Zhipu AI и Университет Цинхуа представили GLM-5 — мощную открытую MoE-модель на 744 млрд параметров, способную автономно писать код, вести глубокий веб-поиск и решать сложные многошаговые задачи наравне с проприетарными флагманами.
Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%
Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.
OpenAI представила первый собственный ИИ-чип Jalapeño для конкуренции с Nvidia в инференсе
OpenAI опубликовала первые результаты тестов Jalapeño — собственного чипа для инференса, разработанного совместно с Broadcom, заявив о значительном превосходстве в скорости и энергоэффективности над решениями Nvidia.