#Claude
Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%
Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.
Anthropic выпустила Claude Sonnet 5: фокус на автономных агентах, кодинге и скрытых расходах
Anthropic представила новую языковую модель Claude Sonnet 5, оптимизированную под многошаговую автономную работу и программирование. Несмотря на привлекательный базовый тариф, специфика рассуждений и новый токенизатор могут сделать решение дороже ожидаемого.