HAVE AI NEWS HAVE AI NEWS
en

#ИИ-агенты

Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач

Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.

Релиз GLM-5: открытая модель от Zhipu AI выходит на уровень лидеров в агентном программировании

Zhipu AI и Университет Цинхуа представили GLM-5 — мощную открытую MoE-модель на 744 млрд параметров, способную автономно писать код, вести глубокий веб-поиск и решать сложные многошаговые задачи наравне с проприетарными флагманами.

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.

Anthropic выпустила Claude Sonnet 5: фокус на автономных агентах, кодинге и скрытых расходах

Anthropic представила новую языковую модель Claude Sonnet 5, оптимизированную под многошаговую автономную работу и программирование. Несмотря на привлекательный базовый тариф, специфика рассуждений и новый токенизатор могут сделать решение дороже ожидаемого.

Гонка за персонального ИИ-компаньона: стратегии OpenAI, Apple, Яндекса и Meta

Технологические гиганты переходят от создания изолированных чат-ботов к разработке сквозных персональных ИИ-ассистентов. Разбираемся, как меняются носимые устройства и почему главным активом в этой борьбе станет цифровая память пользователя.