Исследовательские группы из Center for AI Safety и компании Scale AI представили Remote Labor Index (RLI) — специализированный бенчмарк, созданный для оценки способности автономных ИИ-агентов выполнять полноценную работу удаленных специалистов. В основу тестирования легли 240 реальных заказов с биржи Upwork, охватывающих спектр от геймдева до архитектурного проектирования. Результаты продемонстрировали сильное отставание ИИ от людей: передовые системы успешно справились лишь с 2,5% задач на приемлемом для заказчиков уровне.
Авторы проекта выложили в открытый доступ инфраструктуру для тестирования и 10 демонстрационных заданий на платформе GitHub. Основной массив из 230 проектов остался закрытым, чтобы предотвратить попадание тестовых данных в обучающие выборки будущих моделей и сохранить объективность бенчмарка.
Как устроен Remote Labor Index
В отличие от классических тестов, построенных на абстрактных вопросах или изолированных фрагментах кода, RLI ориентирован на практику фриланс-рынка. Авторы исследования выкупали у исполнителей с Upwork кейсы с уже завершенными и оплаченными заказами (выплачивая за материалы от $15 до $200). В каждый тестовый пакет вошли:
оригинальное техническое задание от клиента;
исходные файлы и ресурсы;
финальный результат работы специалиста, принятый и оплаченный заказчиком.
Решение человека служит эталоном качества, доказавшим свою коммерческую ценность. Из 240 кейсов 207 были получены напрямую от фрилансеров, а еще 40 подобраны из редких категорий и открытых источников с согласия авторов. Всего охвачено 23 сферы деятельности, среди которых ключевые доли занимают:
видеомонтаж и анимация — 13%;
3D-моделирование — 12%;
графический дизайн — 11%;
разработка игр — 10%;
звукорежиссура и аудио — 10%;
архитектура — 7%;
промышленный и продуктовый дизайн — 6%.
Средняя рыночная стоимость отдельного проекта в выборке составила $632 (медиана — $200), а среднее время выполнения человеком — 29 часов (медиана — 11,5 часа). Суммарно база представляет более 6000 рабочих часов совокупной стоимостью свыше $140 000.
Итоги тестирования нейросетей
В рамках испытаний исследователи проверили модели Manus, Grok 4, Claude Sonnet 4.5, GPT-5, ChatGPT agent и Gemini 2.5 Pro. Лидером стал агент Manus, успешно завершивший 2,5% задач. Второе место разделили Grok 4 и Sonnet 4.5 с показателем 2,1%. В рейтинге по системе Elo наивысший результат также показал Manus (509,9 балла), что все еще существенно ниже человеческого стандарта в 1000 баллов (разрыв приблизительно в 400 очков означает, что человек превосходит модель с вероятностью 10 к 1).
Анализ сбоев выявил основные слабые места агентов:
Низкое качество исполнения (45,6% случаев): примитивная графика из простых фигур вместо проработанных макетов, неестественная синтетическая озвучка.
Незавершенность работы (35,7% случаев): предоставление коротких фрагментов (например, 8-секундного ролика вместо требуемого 8-минутного).
Поврежденные или пустые файлы (17,6% случаев): нерабочие результаты генерации.
Нарушение внутренней логики (14,8% случаев): рассинхронизация компонентов — например, разные фасады здания на соседних 3D-рендерах.
Успешные сценарии применения
Тем не менее в ряде задач нейросети показали результаты на уровне квалифицированных специалистов. ИИ успешно проявил себя в следующих направлениях:
звуковой монтаж: сведение дикторской речи с фонограммой, отделение вокальной дорожки от аккомпанемента, генерация звуковых эффектов для ретро-игр;
создание концептов логотипов и графики для рекламы;
составление текстовых аналитических отчетов;
разработка интерактивных аналитических панелей (дашбордов) и базовое программирование.
Главным барьером для моделей остается отсутствие механизмов самоконтроля и визуальной верификации. Сгенерировав 3D-объект, веб-страницу или код игры, система не способна критически оценить корректность отображения и функциональность результата.
Особенности RLI и экономика внедрения
RLI превосходит бенчмарки вроде GDPval или HCAST по глубине задач: длительность выполнения проектов здесь в среднем вдвое выше, а диапазон форматов файлов включает 72 типа расширений (включая CAD-чертежи .dwg/.dxf, 3D-модели .obj/.gltf, архитектурные проекты .rvt, дизайнерские макеты .psd/.ai и веб-игры). Платформа бенчмарка поддерживает прямое открытие и рендеринг этих форматов в браузере.
Для оценки экономического эффекта авторы ввели метрику autoflation — показатель удешевления суммарного пула задач при замещении человека нейросетью там, где она справляется. На текущем этапе экономия составила 4%. В пересчете на реальные деньги агент Manus смог бы заработать $1 720 из потенциального фонда в $143 991. При этом запуск модели на одном задании обходился в среднем всего в $2,34 (при лимите API-затрат в $30).
Ограничения бенчмарка
Исследователи отмечают, что текущая версия теста исключает задачи, требующие продолжительной командной работы, прямого общения с клиентом в процессе (например, онлайн-репетиторство) или отложенного по времени эффекта (SEO-оптимизация). Кроме того, в расчетах использовались исторические ставки без учета инфляции.
Авторы RLI подчеркивают: несмотря на успехи ИИ в академических тестах и тестах на логику, автоматизация комплексных практических задач на рынке фриланса все еще находится на начальной стадии. В дальнейшем датасет планируют расширять новыми профессиональными сценариями.
Комментарии
Войдите , чтобы оставить комментарий.
Пока нет комментариев.