HAVE AI NEWS HAVE AI NEWS
en
Исследования

Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач

Бенчмарк Remote Labor Index показал: современные ИИ-агенты справляются лишь с 2,5% реальных фриланс-задач

Специалисты Center for AI Safety и Scale AI разработали тест RLI на основе сотен реальных проектов с Upwork. Даже ведущие языковые модели и агенты смогли качественно закрыть не более 2,5% заказов.

Исследовательские группы из Center for AI Safety и компании Scale AI представили Remote Labor Index (RLI) — специализированный бенчмарк, созданный для оценки способности автономных ИИ-агентов выполнять полноценную работу удаленных специалистов. В основу тестирования легли 240 реальных заказов с биржи Upwork, охватывающих спектр от геймдева до архитектурного проектирования. Результаты продемонстрировали сильное отставание ИИ от людей: передовые системы успешно справились лишь с 2,5% задач на приемлемом для заказчиков уровне.

Авторы проекта выложили в открытый доступ инфраструктуру для тестирования и 10 демонстрационных заданий на платформе GitHub. Основной массив из 230 проектов остался закрытым, чтобы предотвратить попадание тестовых данных в обучающие выборки будущих моделей и сохранить объективность бенчмарка.

Как устроен Remote Labor Index

В отличие от классических тестов, построенных на абстрактных вопросах или изолированных фрагментах кода, RLI ориентирован на практику фриланс-рынка. Авторы исследования выкупали у исполнителей с Upwork кейсы с уже завершенными и оплаченными заказами (выплачивая за материалы от $15 до $200). В каждый тестовый пакет вошли:

  • оригинальное техническое задание от клиента;

  • исходные файлы и ресурсы;

  • финальный результат работы специалиста, принятый и оплаченный заказчиком.

Решение человека служит эталоном качества, доказавшим свою коммерческую ценность. Из 240 кейсов 207 были получены напрямую от фрилансеров, а еще 40 подобраны из редких категорий и открытых источников с согласия авторов. Всего охвачено 23 сферы деятельности, среди которых ключевые доли занимают:

  • видеомонтаж и анимация — 13%;

  • 3D-моделирование — 12%;

  • графический дизайн — 11%;

  • разработка игр — 10%;

  • звукорежиссура и аудио — 10%;

  • архитектура — 7%;

  • промышленный и продуктовый дизайн — 6%.

Средняя рыночная стоимость отдельного проекта в выборке составила $632 (медиана — $200), а среднее время выполнения человеком — 29 часов (медиана — 11,5 часа). Суммарно база представляет более 6000 рабочих часов совокупной стоимостью свыше $140 000.

Итоги тестирования нейросетей

В рамках испытаний исследователи проверили модели Manus, Grok 4, Claude Sonnet 4.5, GPT-5, ChatGPT agent и Gemini 2.5 Pro. Лидером стал агент Manus, успешно завершивший 2,5% задач. Второе место разделили Grok 4 и Sonnet 4.5 с показателем 2,1%. В рейтинге по системе Elo наивысший результат также показал Manus (509,9 балла), что все еще существенно ниже человеческого стандарта в 1000 баллов (разрыв приблизительно в 400 очков означает, что человек превосходит модель с вероятностью 10 к 1).

Анализ сбоев выявил основные слабые места агентов:

  • Низкое качество исполнения (45,6% случаев): примитивная графика из простых фигур вместо проработанных макетов, неестественная синтетическая озвучка.

  • Незавершенность работы (35,7% случаев): предоставление коротких фрагментов (например, 8-секундного ролика вместо требуемого 8-минутного).

  • Поврежденные или пустые файлы (17,6% случаев): нерабочие результаты генерации.

  • Нарушение внутренней логики (14,8% случаев): рассинхронизация компонентов — например, разные фасады здания на соседних 3D-рендерах.

Успешные сценарии применения

Тем не менее в ряде задач нейросети показали результаты на уровне квалифицированных специалистов. ИИ успешно проявил себя в следующих направлениях:

  • звуковой монтаж: сведение дикторской речи с фонограммой, отделение вокальной дорожки от аккомпанемента, генерация звуковых эффектов для ретро-игр;

  • создание концептов логотипов и графики для рекламы;

  • составление текстовых аналитических отчетов;

  • разработка интерактивных аналитических панелей (дашбордов) и базовое программирование.

Главным барьером для моделей остается отсутствие механизмов самоконтроля и визуальной верификации. Сгенерировав 3D-объект, веб-страницу или код игры, система не способна критически оценить корректность отображения и функциональность результата.

Особенности RLI и экономика внедрения

RLI превосходит бенчмарки вроде GDPval или HCAST по глубине задач: длительность выполнения проектов здесь в среднем вдвое выше, а диапазон форматов файлов включает 72 типа расширений (включая CAD-чертежи .dwg/.dxf, 3D-модели .obj/.gltf, архитектурные проекты .rvt, дизайнерские макеты .psd/.ai и веб-игры). Платформа бенчмарка поддерживает прямое открытие и рендеринг этих форматов в браузере.

Для оценки экономического эффекта авторы ввели метрику autoflation — показатель удешевления суммарного пула задач при замещении человека нейросетью там, где она справляется. На текущем этапе экономия составила 4%. В пересчете на реальные деньги агент Manus смог бы заработать $1 720 из потенциального фонда в $143 991. При этом запуск модели на одном задании обходился в среднем всего в $2,34 (при лимите API-затрат в $30).

Ограничения бенчмарка

Исследователи отмечают, что текущая версия теста исключает задачи, требующие продолжительной командной работы, прямого общения с клиентом в процессе (например, онлайн-репетиторство) или отложенного по времени эффекта (SEO-оптимизация). Кроме того, в расчетах использовались исторические ставки без учета инфляции.

Авторы RLI подчеркивают: несмотря на успехи ИИ в академических тестах и тестах на логику, автоматизация комплексных практических задач на рынке фриланса все еще находится на начальной стадии. В дальнейшем датасет планируют расширять новыми профессиональными сценариями.

Автор: Konstantine Mozgovoy

Источник: neurohive.io

Комментарии

Войдите , чтобы оставить комментарий.

Пока нет комментариев.