Практический чек-лист из 20 пунктов: как проверить, может ли ChatGPT или Perplexity найти, прочитать и процитировать ваш сайт — от robots.txt до структуры ответов.
Если нейросеть не может процитировать вашу страницу — неважно, как она ранжируется в обычном поиске. В AI-поиске недостаточно быть «где-то в индексе»: страница должна быть доступна роботу, понятна как источник и содержать самостоятельный ответ на вопрос пользователя.
Я собрал чек-лист из 20 признаков, который использую перед глубокой работой с GEO. Он не обещает попадание в каждый ответ ChatGPT или Perplexity — результат зависит от запроса, свежести данных и набора источников. Но он помогает быстро найти причины, из-за которых сайт вообще не рассматривается как источник.
Сначала проверяю не текст, а доступ. Если робот получает запрет, ошибку или пустую оболочку приложения, дальнейшая оптимизация заголовков не поможет.
Откройте `https://ваш-домен/robots.txt` и проверьте, нет ли запретов для актуальных user-agent из [GEO/AEO-аудита](/geo-ai-audit):
Отсутствие этих строк само по себе не означает проблему: если для `User-agent: *` нет запрещающего `Disallow`, доступ может быть открыт. Но вот шесть красных флагов:
1. `Disallow: /` для всех роботов или нужного AI-агента.
2. Важные разделы услуг, кейсов или статей закрыты общей маской.
3. CDN, WAF или антибот отдаёт роботу 403, CAPTCHA либо бесконечный редирект.
4. Страница возвращает 5xx или слишком долго отвечает.
5. Главный URL перекидывает на другой домен или протокол без ясного канонического адреса.
6. В sitemap нет ключевых страниц, которые вы рассчитываете показывать как источник.
Не стоит бездумно открывать служебные зоны, личный кабинет или данные клиентов. Речь только о публичных материалах, которые действительно должны участвовать в поиске.
Седьмой признак — в исходном HTML почти нет текста. Это частая история у SPA: браузер после JavaScript показывает красивую страницу, а краулер получает один `div` и набор скриптов.
Мы сами обнаружили такую проблему на nasloy.ru во время внутренней проверки: в сыром HTML было 0 символов полезного текста. После пререндеринга и переработки ключевых блоков AEO-балл вырос с 36 до 81. Это не «секретный фактор ранжирования», а обычная работа с доступностью: робот получил то же основное содержание, что и посетитель.
Остальные признаки в этом блоке:
7. Основной текст появляется только после выполнения JavaScript.
8. На странице стоит `noindex`, либо заголовок `X-Robots-Tag: noindex`.
9. Canonical указывает на другой URL без объективной причины.
10. Важная страница возвращает soft 404, дубликат или цепочку редиректов.
11. Schema.org отсутствует либо противоречит видимому тексту: например, в `Article` другой автор или дата, а в `Organization` старый домен.
Файл `llms.txt` в корне сайта может помочь AI-агенту быстрее увидеть структуру важных материалов: услуги, статьи, кейсы, контакты. Я включаю его в проверку как полезный дополнительный сигнал.
Но отсутствие файла — не повод останавливать работу. Он не заменяет robots.txt, индексацию, HTML и содержательный контент; поддержка формата разными платформами неодинакова. Сначала устраните блокировки и дубли, затем добавляйте машиночитаемую карту.
После технической доступности начинается AEO — оптимизация под извлечение ответа. Нейросеть выбирает не «ключевое слово на странице», а фрагмент, который можно безопасно и понятно использовать вне контекста.
Проверьте страницу по следующим пунктам:
13. Первый абзац отвечает на основной вопрос, а не начинается с общих слов о компании.
14. У статьи один понятный H1, а H2 и H3 отражают реальные вопросы пользователя.
15. В каждом важном разделе есть короткий вывод, затем условия, детали и пример.
16. Текст содержит конкретику: сроки, критерии, ограничения, методику или источник данных.
17. Ключевые сведения не спрятаны только в изображении, PDF, табах или аккордеоне без текстового резюме.
Плохой вариант: «Мы оказываем качественные услуги и применяем индивидуальный подход». Он подходит любой компании и не отвечает ни на один запрос.
Сильнее: «Для интернет-магазина базовая SEO-структура включает категории, посадочные фильтры и правила каноникализации; набор зависит от ассортимента и поискового спроса». Здесь есть предмет ответа, контекст и ограничение. Подробную архитектуру я разобрал в статье [«SEO-структура каталога: категории, фильтры и посадочные страницы»](/blog/seo-struktura-kataloga-kategorii-filtry-posadochnye-stranicy).
18. У материала есть автор или ответственная редакция, дата публикации и дата обновления, если тема меняется.
19. Виден практический опыт: кейс, методика, скриншот, расчёт, исходные условия или честно обозначенные ограничения.
20. FAQ отвечает на действительно частые вопросы, а разметка `FAQPage` повторяет видимый пользователю текст, а не содержит скрытые SEO-фразы.
Не добавляйте FAQPage ради самой разметки. Поисковым системам и AI важнее точность ответа и согласованность фактов на странице. Неверные даты, придуманные регалии и микроразметка, которая не совпадает с контентом, снижают доверие вместо роста видимости.
Быстро пройти техническую часть можно в [GEO/AEO-аудите](/geo-ai-audit). Инструмент проверяет ответ сервера и сырой HTML без выполнения JavaScript, `robots.txt`, наличие `llms.txt`, основные метатеги, каноникал, заголовки, текстовый объём и сигналы структуры. Результат — не окончательный вердикт о видимости в ChatGPT, а понятная стартовая диагностика: что исправлять в первую очередь.
Если по чек-листу всё зелёное, не делайте вывод, что бренд уже будет в каждом AI-ответе. Следующий уровень — смысловая полнота и доверие к источнику. Сравните контрольные запросы с тем, как отвечают конкуренты: есть ли у них понятнее таблицы, актуальнее факты, больше подтверждений и лучшее описание бренда.
Начните с критических барьеров: откройте нужным роботам только публичные страницы, исправьте 4xx/5xx, `noindex`, неверные canonical и пустой HTML. Затем переработайте 5–10 приоритетных посадочных страниц: дайте прямой ответ, добавьте доказательства, автора, дату и связанные материалы.
Если техническая часть в порядке, а бренд всё равно не появляется в ответах, переходите к причинам низкой цитируемости. В статье [«Почему нейросети не упоминают ваш бренд: 12 причин и способы исправления»](/blog/pochemu-neyroseti-ne-upominayut-brend-12-prichin) я разобрал внешний контур, противоречивые данные, слабые доказательства опыта и другие факторы, которые один robots.txt не решает.
Для более широкого плана развития полезен материал [«GEO-продвижение в 2026 году»](/blog/geo-prodvizhenie-2026-chatgpt-gemini-yandexgpt): там показано, как соединить техническую готовность, контент и авторитет бренда в одну последовательную стратегию.