HAVE AI NEWS HAVE AI NEWS
en

#Claude

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.

Anthropic выпустила Claude Sonnet 5: фокус на автономных агентах, кодинге и скрытых расходах

Anthropic представила новую языковую модель Claude Sonnet 5, оптимизированную под многошаговую автономную работу и программирование. Несмотря на привлекательный базовый тариф, специфика рассуждений и новый токенизатор могут сделать решение дороже ожидаемого.