Казалось бы, языковые модели должны продвигать собственный бренд из-за корпоративных инструкций или обучающих данных. Однако практический тест пяти систем с включенным веб-поиском продемонстрировал неожиданные результаты: ИИ-ассистенты неохотно ставят себя на пьедестал, но регулярно рекомендуют продукты конкурентов.
Суть эксперимента
В тестировании участвовали пять платформ, подключенных к поисковой выдаче в реальном времени: ChatGPT (gpt-4o), Claude (claude-sonnet-4.5), Gemini (gemini-3.6-flash), Perplexity (sonar-pro) и «Алиса AI» (генеративный ответ поиска Яндекса).
Сервисам задавали четыре нейтральных запроса без упоминания брендов (например, о выборе помощника для работы с текстами или решении сложных задач), а также один контрольный вопрос с прямым перечислением участников. Каждый запрос повторялся трижды для учета вариативности ответов. Из 75 отправленных запросов 71 вернул корректный результат.
Как модели оценивают себя
В слепых тестах (без подсказок в запросе) участники проявили разную степень «скромности»:
- Claude вспомнил о себе во всех 12 случаях, но поставил себя на первое место лишь трижды;
- ChatGPT упомянул себя в 9 ответах из 12 (4 раза на первой позиции);
- Gemini назвала себя 10 раз из 11, но ни разу не поставила свое имя во главе списка (медианная позиция — третья);
- Perplexity упомянул себя в 6 ответах из 12 (3 раза первым);
- «Алиса AI» назвала себя лишь в 3 ответах из 10 успешных запусков.
ChatGPT — общий фаворит
При анализе всех 57 валидных ответов на нейтральные вопросы выяснилось, что нейросети активно советуют сторонние разработки. Лидером по цитируемости стал ChatGPT — его включили в рекомендации даже прямые соперники (Claude, Perplexity и Gemini упоминали продукт OpenAI почти в 100% случаев).
| Нейросеть / Бренд | Встречаемость в 57 ответах |
|---|---|
| ChatGPT | 51 |
| Claude | 47 |
| Gemini | 42 |
| DeepSeek | 30 |
| Perplexity | 23 |
| GigaChat | 15 |
| Алиса AI | 13 |
| Grok | 9 |
Такие системы, как DeepSeek, GigaChat и Grok, не участвовали в прямом тестировании, однако активно упоминались другими моделями на основе данных из веб-поиска.
Почему так происходит
Подобный результат не обязательно означает объективное превосходство той или иной модели. Скорее, генеративные ответы отражают распределение информации в интернете и текущую поисковую выдачу: чем чаще сервис упоминается в статьях и обзорах, тем выше вероятность, что языковая модель сошлется на него в ответе пользователю.
Комментарии
, чтобы оставить комментарий.
Пока нет комментариев.