HAVE AI NEWS HAVE AI NEWS
Исследования

Эксперимент: кого называют лучшие нейросети, если спросить их о лидерстве на рынке

Эксперимент: кого называют лучшие нейросети, если спросить их о лидерстве на рынке

Пять популярных ИИ-сервисов с доступом к веб-поиску ответили на вопросы о лучшей нейросети. Как показал тест, модели редко ставят себя на первое место, но почти всегда рекомендуют ChatGPT.

Казалось бы, языковые модели должны продвигать собственный бренд из-за корпоративных инструкций или обучающих данных. Однако практический тест пяти систем с включенным веб-поиском продемонстрировал неожиданные результаты: ИИ-ассистенты неохотно ставят себя на пьедестал, но регулярно рекомендуют продукты конкурентов.

Суть эксперимента

В тестировании участвовали пять платформ, подключенных к поисковой выдаче в реальном времени: ChatGPT (gpt-4o), Claude (claude-sonnet-4.5), Gemini (gemini-3.6-flash), Perplexity (sonar-pro) и «Алиса AI» (генеративный ответ поиска Яндекса).

Сервисам задавали четыре нейтральных запроса без упоминания брендов (например, о выборе помощника для работы с текстами или решении сложных задач), а также один контрольный вопрос с прямым перечислением участников. Каждый запрос повторялся трижды для учета вариативности ответов. Из 75 отправленных запросов 71 вернул корректный результат.

Как модели оценивают себя

В слепых тестах (без подсказок в запросе) участники проявили разную степень «скромности»:

  • Claude вспомнил о себе во всех 12 случаях, но поставил себя на первое место лишь трижды;
  • ChatGPT упомянул себя в 9 ответах из 12 (4 раза на первой позиции);
  • Gemini назвала себя 10 раз из 11, но ни разу не поставила свое имя во главе списка (медианная позиция — третья);
  • Perplexity упомянул себя в 6 ответах из 12 (3 раза первым);
  • «Алиса AI» назвала себя лишь в 3 ответах из 10 успешных запусков.

ChatGPT — общий фаворит

При анализе всех 57 валидных ответов на нейтральные вопросы выяснилось, что нейросети активно советуют сторонние разработки. Лидером по цитируемости стал ChatGPT — его включили в рекомендации даже прямые соперники (Claude, Perplexity и Gemini упоминали продукт OpenAI почти в 100% случаев).

Нейросеть / БрендВстречаемость в 57 ответах
ChatGPT51
Claude47
Gemini42
DeepSeek30
Perplexity23
GigaChat15
Алиса AI13
Grok9

Такие системы, как DeepSeek, GigaChat и Grok, не участвовали в прямом тестировании, однако активно упоминались другими моделями на основе данных из веб-поиска.

Почему так происходит

Подобный результат не обязательно означает объективное превосходство той или иной модели. Скорее, генеративные ответы отражают распределение информации в интернете и текущую поисковую выдачу: чем чаще сервис упоминается в статьях и обзорах, тем выше вероятность, что языковая модель сошлется на него в ответе пользователю.

Автор: ig_novvv4 часа назад

Источник: habr.com

Комментарии

, чтобы оставить комментарий.

Пока нет комментариев.