HAVE AI NEWS HAVE AI NEWS
en
Исследования

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Бенчмарк ClawBench выявил слабые места ИИ-агентов: лучший результат в реальном интернете составил всего 33%

Новый бенчмарк ClawBench проверил работу автономных веб-агентов на живых сайтах. Сильнейшая из протестированных моделей смогла успешно справиться лишь с третью практических задач.

Исследователи представили ClawBench — новый бенчмарк, созданный для оценки способности ИИ-агентов решать практические задачи в реальном интернете. В список сценариев вошли повседневные действия вроде бронирования билетов, заполнения анкет на работу и оформления заказов. Согласно результатам исследования, даже лидер теста — модель Claude Sonnet 4.6 — смогла корректно завершить лишь 33,3% сценариев. Исходный код системы тестирования выложен на GitHub, а сопутствующие материалы и датасет доступны на официальном сайте проекта.

Почему синтетические песочницы дают ложную картину

Популярные тестовые среды (такие как WebArena, OSWorld и VisualWebArena) запускают модели внутри изолированных «песочниц» со статическими копиями веб-страниц. В таких средах отсутствуют динамический рендеринг через JavaScript, всплывающие уведомления о куки, капчи и необходимость авторизации. Из-за этого модели демонстрируют обманчиво высокий уровень успеха (65–75%), который резко падает при столкновении с реальным вебом.

Другие платформы, тестирующие работу на живых ресурсах (включая WebVoyager и AssistantBench), в основном ограничиваются пассивным сбором данных и чтением. Систематическая проверка интерактивных действий — заполнения форм и отправки информации — до появления ClawBench практически не проводилась.

Особенности методологии ClawBench

Датасет включает 153 прикладных задания на базе 144 действующих сайтов, распределенных по 15 тематическим блокам: от онлайн-шопинга, управления финансами и бронирования путешествий до разработки ПО и взаимодействия с соцсетями.

Каждое испытание содержит базовый URL, текстовое задание и целевой HTTP-запрос, подтверждающий корректное завершение процесса. Для каждого сценария специалисты предварительно записали эталонные пользовательские траектории.

Чтобы агенты не совершали реальных платежей и не отправляли нежелательные заявки, разработчики внедрили защитную систему на базе протокола Chrome DevTools (CDP) и легковесного расширения. В момент, когда ИИ нажимает кнопку отправки или оплаты, система перехватывает исходящий HTTP-запрос, фиксирует его полезную нагрузку и останавливает фактическую передачу данных. Во время валидации механизм сработал со 100% точностью на всех задачах.

Комплексная фиксация данных и агентная оценка

В процессе выполнения теста бенчмарк непрерывно собирает пять уровней информации:

  • полноформатную видеозапись экрана через Xvfb и FFmpeg;

  • пошаговые снимки экрана после каждого действия;

  • логи сетевого трафика через CDP;

  • цепочки рассуждений нейросети и вызовы инструментов в формате JSON;

  • события пользовательского ввода (клики, прокрутку, ввод с клавиатуры).

Анализ результатов возложен на специализированного оценщика на базе Claude Code. Он сопоставляет шаги тестируемой модели с эталонными действиями человека, проверяет точность внесенных в поля данных и выдает структурированное обоснование вместе с бинарной оценкой успешности.

Итоги тестирования нейросетей

В рамках бенчмарка были проверены семь актуальных систем. Показатели успешности распределились следующим образом:

  • Claude Sonnet 4.6 — 33,3%;

  • GLM-5 — 24,2%;

  • Gemini 3 Flash — 19,0%;

  • Claude Haiku 4.5 — 18,3%;

  • GPT-5.4 — 6,5%;

  • Gemini 3.1 Flash Lite — 3,3%;

  • Kimi K2.5 — 0,7%.

Для сравнения, на синтетических бенчмарках вроде OSWorld и WebArena модели Claude Sonnet 4.6 и GPT-5.4 обычно достигают 67–75% успеха.

Относительно уверенно агенты справились с финансовыми сервисами, академическими порталами (запись на курсы Coursera/edX, отправка решений на LeetCode) и поиском транспортных билетов. Самыми сложными оказались задачи, связанные с разработкой (настройка репозиториев GitHub, форки на Hugging Face, конфигурация Airtable), где результат лидера составил лишь 19%, а также социальные сервисы с динамическими многостраничными формами (оставление отзывов на Glassdoor или Vivino).

Значение исследования

Результаты ClawBench подтверждают, что традиционные синтетические бенчмарки близки к насыщению и перестают отражать реальные возможности веб-агентов. Новый подход позволяет исследователям точно локализовать ошибки моделей при взаимодействии с современными веб-интерфейсами и дает реалистичный ориентир для развития автономных ИИ-систем.

Автор: Konstantine Mozgovoy

Источник: neurohive.io

Комментарии

Войдите , чтобы оставить комментарий.

Пока нет комментариев.