Исследователи представили ClawBench — новый бенчмарк, созданный для оценки способности ИИ-агентов решать практические задачи в реальном интернете. В список сценариев вошли повседневные действия вроде бронирования билетов, заполнения анкет на работу и оформления заказов. Согласно результатам исследования, даже лидер теста — модель Claude Sonnet 4.6 — смогла корректно завершить лишь 33,3% сценариев. Исходный код системы тестирования выложен на GitHub, а сопутствующие материалы и датасет доступны на официальном сайте проекта.
Почему синтетические песочницы дают ложную картину
Популярные тестовые среды (такие как WebArena, OSWorld и VisualWebArena) запускают модели внутри изолированных «песочниц» со статическими копиями веб-страниц. В таких средах отсутствуют динамический рендеринг через JavaScript, всплывающие уведомления о куки, капчи и необходимость авторизации. Из-за этого модели демонстрируют обманчиво высокий уровень успеха (65–75%), который резко падает при столкновении с реальным вебом.
Другие платформы, тестирующие работу на живых ресурсах (включая WebVoyager и AssistantBench), в основном ограничиваются пассивным сбором данных и чтением. Систематическая проверка интерактивных действий — заполнения форм и отправки информации — до появления ClawBench практически не проводилась.
Особенности методологии ClawBench
Датасет включает 153 прикладных задания на базе 144 действующих сайтов, распределенных по 15 тематическим блокам: от онлайн-шопинга, управления финансами и бронирования путешествий до разработки ПО и взаимодействия с соцсетями.
Каждое испытание содержит базовый URL, текстовое задание и целевой HTTP-запрос, подтверждающий корректное завершение процесса. Для каждого сценария специалисты предварительно записали эталонные пользовательские траектории.
Чтобы агенты не совершали реальных платежей и не отправляли нежелательные заявки, разработчики внедрили защитную систему на базе протокола Chrome DevTools (CDP) и легковесного расширения. В момент, когда ИИ нажимает кнопку отправки или оплаты, система перехватывает исходящий HTTP-запрос, фиксирует его полезную нагрузку и останавливает фактическую передачу данных. Во время валидации механизм сработал со 100% точностью на всех задачах.
Комплексная фиксация данных и агентная оценка
В процессе выполнения теста бенчмарк непрерывно собирает пять уровней информации:
полноформатную видеозапись экрана через Xvfb и FFmpeg;
пошаговые снимки экрана после каждого действия;
логи сетевого трафика через CDP;
цепочки рассуждений нейросети и вызовы инструментов в формате JSON;
события пользовательского ввода (клики, прокрутку, ввод с клавиатуры).
Анализ результатов возложен на специализированного оценщика на базе Claude Code. Он сопоставляет шаги тестируемой модели с эталонными действиями человека, проверяет точность внесенных в поля данных и выдает структурированное обоснование вместе с бинарной оценкой успешности.
Итоги тестирования нейросетей
В рамках бенчмарка были проверены семь актуальных систем. Показатели успешности распределились следующим образом:
Claude Sonnet 4.6 — 33,3%;
GLM-5 — 24,2%;
Gemini 3 Flash — 19,0%;
Claude Haiku 4.5 — 18,3%;
GPT-5.4 — 6,5%;
Gemini 3.1 Flash Lite — 3,3%;
Kimi K2.5 — 0,7%.
Для сравнения, на синтетических бенчмарках вроде OSWorld и WebArena модели Claude Sonnet 4.6 и GPT-5.4 обычно достигают 67–75% успеха.
Относительно уверенно агенты справились с финансовыми сервисами, академическими порталами (запись на курсы Coursera/edX, отправка решений на LeetCode) и поиском транспортных билетов. Самыми сложными оказались задачи, связанные с разработкой (настройка репозиториев GitHub, форки на Hugging Face, конфигурация Airtable), где результат лидера составил лишь 19%, а также социальные сервисы с динамическими многостраничными формами (оставление отзывов на Glassdoor или Vivino).
Значение исследования
Результаты ClawBench подтверждают, что традиционные синтетические бенчмарки близки к насыщению и перестают отражать реальные возможности веб-агентов. Новый подход позволяет исследователям точно локализовать ошибки моделей при взаимодействии с современными веб-интерфейсами и дает реалистичный ориентир для развития автономных ИИ-систем.
Комментарии
Войдите , чтобы оставить комментарий.
Пока нет комментариев.