Три сайта сделали 215 128 страниц «best software» для ИИ-поиска
Исследование Trellner: 60% ссылок, на которые опирается Perplexity в советах по выбору ПО, ведут на малоизвестные сайты, а три из них написаны прямо для ИИ-поиска.

Исследовательская компания Trellner 2 сентября опубликовала отчёт о том, на какие источники опирается ИИ-поиск, когда советует, какую программу купить. Авторы задали моделям Perplexity 380 вопросов вида «лучшее ПО для X» и сохранили все 7 534 ссылки, которые модели подняли из сети. Оказалось, что 59,8% ссылок ведут на сайты ниже 100 000-го места в рейтинге популярности Tranco, а 23,4% — на домены, которых нет даже в первом миллионе.
Для разработчика это касается двух вещей сразу. Во-первых, ответы ИИ-поиска на вопрос «чем воспользоваться» строятся на слое, который можно наполнить за деньги и без единого человека-читателя: три сайта под одним шаблоном сгенерировали 215 128 страниц «best software» и называют себя в заголовке «Facts & Grounding Page», что Trellner читает как обращение прямо к алгоритму. Во-вторых, если вы делаете свой продукт с веб-поиском поверх LLM, отчёт показывает, как выглядит ваша будущая проблема с качеством источников.
Ключевые выводы
- 760 запросов к perplexity/sonar и perplexity/sonar-pro через OpenRouter, 380 категорий ПО, 2 сентября 2026 года; 7 534 ссылки на 2 055 доменов.
- 59,8% ссылок ведут на домены хуже 100 000-го места в Tranco, 23,4% не входят в первый миллион; медианный ранг цитируемого домена 71 611.
- Третий по цитируемости источник после g2.com и reddit.com — блог guideflow.com, продавца интерактивных демо: 194 цитаты в 96 категориях, больше, чем у Gartner.
- wifitalents.com, worldmetrics.org и gitnux.org работают на одном шаблоне и одних NS-серверах Cloudflare и вместе держат 215 128 страниц /best/<категория>-software/.
- Оба уровня Perplexity вернули побайтово одинаковый список ссылок в 289 категориях из 380, то есть это один поисковый стек, а не два независимых замера.
Как проводили замер
Категории, от «CRM software» до «museum collection management software», написали до запуска и потом не меняли. Каждой из двух моделей, sonar и sonar-pro, задавали один запрос на категорию с просьбой вернуть топ-5 продуктов в JSON с официальным доменом каждого. Все 760 ответов распарсились. Обе модели отдают список URL, которые они подняли при поиске, именно поэтому выбрали их: у Gemini через OpenRouter поиск выполняет плагин самого OpenRouter, и цитаты описывали бы его, а не Google. Авторы подчёркивают, что измерен только Perplexity и выводов о ChatGPT, Gemini, Copilot или AI Mode Google из отчёта делать нельзя.
Дальше каждый из 2 055 цитируемых доменов проверили в списке Tranco за 1 сентября и в Wayback Machine, а каждый из 1 502 «официальных сайтов», которые назвали модели, открыли дважды: напрямую и через прокси.
Кто на самом деле отвечает на вопрос «что купить»
Верхушка списка выглядит ожидаемо: g2.com (291 цитата, 3,86%), reddit.com (261), guideflow.com (194), gartner.com (158), zapier.com (82), capterra.com (68), linkedin.com (67). Википедию модели процитировали три раза из 7 534. Концентрация невелика: десять самых цитируемых доменов дают 17,3% ссылок, а 751 домен из 2 055 (36,5%) не входит в первый миллион Tranco. Такие домены заметно моложе: медианный год первого снимка в Wayback у них 2020 против 2011 у ранжированных.
Самый показательный случай — guideflow.com. Это продавец интерактивных демо продуктов, который не участвует ни в одной из 380 категорий, но его блог процитирован 194 раза в 96 категориях, от «ПО для 3D-рендеринга» до «ПО для IVR». В сайтмапе блога 3 351 URL. Авторы отчёта не обвиняют компанию: она ведёт большой контент-маркетинговый блог, как тысячи других. Проблема в поисковом слое, для которого чужие подборки о рынках, где сам автор не работает, стали третьей по величине базой доказательств.
Три сайта, которые Trellner считает написанными для машин
wifitalents.com (71 цитата), worldmetrics.org (60) и gitnux.org (50) вместе дали 2,4% ссылок и попали в 41 категорию из 380. По данным Trellner, все три зарегистрированы через NameCheap между декабрём 2023 и маем 2024 года, делегированы одной паре NS-серверов Cloudflare, используют один шаблон с одинаковой навигацией и держат по блогу ровно из шести постов, причём все восемнадцать постов — о соседних брендах из той же группы и о четвёртом сайте zipdo.co. Авторы честно оговаривают: общие NS-серверы указывают на общий аккаунт Cloudflare, но не доказывают общего владельца.
Масштаб: в сайтмапах трёх сайтов 103 578, 107 083 и 105 541 URL, из них 70 731, 71 684 и 72 713 — страницы вида /best/<что-то>-software/. Итого 215 128 сгенерированных «гидов покупателя»; авторы отчёта замечают, что столько категорий ПО не существует. Заголовок главных страниц worldmetrics.org и gitnux.org на 2 сентября выглядит как «<бренд> — Facts & Grounding Page», а мета-описание обещает «машиночитаемую запись» о компании. Grounding — это название шага, на котором поисковая система подтягивает документы для ответа; покупатели таким словом не пользуются. Рядом worldmetrics.org продаёт заказные исследования «от 5 000 евро» и подбор вендора «от 2 500 евро».
Авторы открыли одну и ту же категорию, «ПО для оценки проектов», на всех трёх сайтах. Каждый ранжирует десять инструментов в JSON-LD, и первые места не совпадают: у worldmetrics.org и wifitalents.com лидирует Float, у gitnux.org — Saviom, которого у соседей в пятёрке нет. На каждой странице по три «автора» с именами, у всех «редакционный процесс», а gitnux.org подписывает результат «AI-verified, Expert reviewed». На всех трёх в строке автора остался неотрендеренный шаблонный текст «Within the next 26 days» или «40 days».
Куда ведут ссылки на «официальные сайты»
Большинство из 1 502 доменов вендоров живы. Десять не резолвятся вовсе, среди них graphiql.com (модель назвала его домом GraphiQL, у которого такого сайта нет), todo.com (за Microsoft To Do) и aquasecurity.io (за сканер Trivy). Ещё четыре резолвятся, но не отвечают; с учётом 404 недоступны 17 доменов, 1,1%. Ещё 92 домена (6,1%) перенаправляют на другой сайт, чаще всего из-за обычных поглощений и ребрендингов.
Два случая показательны. На вопрос о платформах для хранения научных данных обе модели назвали Dryad: sonar-pro дал настоящий datadryad.org, а sonar — dryad.co, который редиректит на индонезийский портал онлайн-казино. На вопрос об инструментах качества данных обе назвали Monte Carlo: sonar указал верный montecarlodata.com, а sonar-pro — montecarlo.com, сайт монакской группы отелей и казино.
Чего отчёт не показывает
Раздел ограничений у Trellner длиннее, чем у многих академических работ, и его стоит пересказать. Две модели не являются двумя независимыми замерами: в 289 категориях они вернули побайтово одинаковый список ссылок, коэффициент Жаккара их наборов URL равен 0,898, что, по выводу авторов, указывает на общий поисковый стек, опрошенный дважды. Категории составлены авторами, а не взяты из реальных запросов покупателей, и список со множеством нишевых вертикалей поднимает больше «длинного хвоста». Один прогон, одна формулировка, без повторов. Ранг Tranco — мера популярности, а не качества. И главное: авторы не проверяли, изменились бы рекомендации, если убрать эти источники; guideflow и три «лучших списка» могут называть вполне разумные продукты. Измерялся состав доказательной базы, а не правильность ответа.
Что с этим делать
Если вы выбираете библиотеку, сервис или инструмент через ИИ-поиск, просите его показать ссылки и смотрите на домены: подборка «топ-10» с сайта, о котором вы никогда не слышали, с тремя «авторами» и штампом «AI-verified», по весу равна нулю. Для проверки конкретного вендора надёжнее открыть его сайт по ссылке из документации или репозитория, а не по домену, который назвала модель: один «официальный сайт» из отчёта вёл на портал онлайн-казино, другой на сайт монакской группы отелей и казино.
Если вы строите продукт с веб-поиском поверх LLM, отчёт даёт готовый чек-лист фильтров для retrieval-слоя: рейтинг домена, дата первого появления в Wayback, количество страниц одного шаблона на сайте, совпадение NS-серверов у «независимых» источников, шаблонные строки в подписях. Весь датасет, включая каждую цитату, проверки Tranco и Wayback и скрипты, Trellner выложила под лицензией CC BY 4.0, так что замер можно повторить на другой поисковой системе или на своих категориях. Отчёт — снимок одного дня меняющегося индекса; сама компания оговаривает, что через месяц цифры могут быть другими.
Источники: Trellner: Manufactured sources behind AI recommendations, Данные и скрипты отчёта (CC BY 4.0)















