Тематическая чистота сайта: где вы теряете вес и краулинг
Разбираю, как навигационные ссылки и цепочки редиректов размывают тему сайта и тратят краулинговый бюджет. Механика PageRank, практика аудита и чек-лист.

Тематическая чистота — это совпадение двух карт: карты URL вашего сайта и карты смыслов, по которой Google раскладывает документы в свои кластеры. Если сайт про промышленные насосы, а половина внутренних ссылок ведёт на теги вроде «интересное», архивы по месяцам и старый раздел с корпоративными новостями 2017 года, то для алгоритма вы сайт «про многое понемногу». Никакой отдельной метрики «topical purity» в Search Console нет. Но есть сигналы уровня сайта, и они складываются из того, куда ведут ваши ссылки и что краулер находит в конце пути.
Я за 18 лет разобрал несколько сотен структур, и утечки почти всегда в одних и тех же двух местах. Первое — навигация: шапка, футер, сайдбар, сквозные блоки «читайте также». Второе — редиректы: цепочки после миграций, 302 вместо 301, ссылки в контенте, которые ведут на URL, отдающий 301 на URL, отдающий 301 на главную.
Ниже показываю механику обеих утечек и конкретную практику: что выгружать, что считать, что резать. Без обещаний позиций — только про то, как перестать сливать ресурс, который у вас уже есть.
Что Google считает тематически чистой страницей и сайтом
На уровне страницы всё довольно прозрачно. Документ выглядит целостным, когда заголовки, текст, анкоры внутренних ссылок и сущности в нём вращаются вокруг одной интенции. Страница «ремонт винтовых насосов» со ссылками на «ремонт винтовых насосов Grundfos», «диагностика статора» и «цены на ремонт» — понятный узел. Та же страница с сайдбаром, где висят 20 ссылок на статьи про логистику, кредиты и корпоративный праздник, — размытый узел.
На уровне сайта Google смотрит шире: какие кластеры вообще существуют в вашем графе ссылок, насколько они плотные и есть ли между ними внятные мостики. Здесь помогает нормальная кластеризация семантики — когда каждая группа запросов заранее привязана к своему URL, а не растаскивается по трём похожим страницам. Иначе вы получаете каннибализацию ключевых слов и вдобавок мусорные связи между кластерами, которых там быть не должно.
Есть простой тест. Откройте случайную страницу и выпишите все внутренние ссылки с неё. Если больше 60–70% ведут в её тематический кластер — хорошо. Если 80% ссылок — это сквозная навигация в чужие разделы, то страница работает не на свой кластер, а на весь сайт сразу. Точнее — почти ни на что.
Утечка PageRank через навигационные ссылки
PageRank течёт по внутренним ссылкам. Упрощённо: вес страницы делится между её исходящими ссылками. Когда в шапке и футере 140 уникальных URL, каждая страница сайта отдаёт вес 140 адресам, и большая часть этого потока уходит в «О компании», «Вакансии», «Политику конфиденциальности» и десяток тегов. Товарные и услуговые страницы получают крошки.
Google давно не считает все ссылки равными — модель reasonable surfer взвешивает ссылку по вероятности клика, и футерная ссылка стоит дешевле ссылки из основного текста. Но это не спасает. Во-первых, страницы всё равно остаются в графе и всё равно обходятся краулером. Во-вторых, сквозная ссылка на чуждую тему — это утверждение о сайте: «здесь важно и это тоже». Повторите утверждение на 50 000 страницах, и алгоритму будет тяжело понять, где у вас ядро.
Как я аудирую навигацию. Сначала краулю сайт и выгружаю все внутренние ссылки. Затем считаю, сколько уникальных URL встречается более чем на 90% страниц — это и есть сквозной блок. Дальше сравниваю этот список с картой кластеров. Обычно оказывается, что 20–30 адресов в меню и футере не имеют ни спроса, ни трафика, ни отношения к деньгам. В одном проекте с 12 000 страниц футер разносил вес на 68 URL, из которых 41 за год не получил ни одного визита из поиска.
Что с этим делать по факту. Мегаменю на 200 пунктов сворачиваю в 30–40 входов верхнего уровня, остальное переношу на страницы-хабы: из шапки ссылка на раздел, а внутри раздела — полный список подкатегорий. Так вес идёт по иерархии, а не веером. Служебные страницы вроде политики и вакансий оставляю в футере одной ссылкой каждую — они нужны людям, и их вклад в размывание невелик, пока их три, а не тридцать. Блоки «популярное» и «последние записи» в сайдбаре меняю на ссылки внутри того же кластера — это уже нормальная перелинковка, а не случайный шум.
Про nofollow сразу разочарую: перераспределить вес им нельзя. С 2009 года доля, ушедшая в nofollow-ссылку, просто сгорает. Оставляю его только там, где ссылка нужна пользователю, но индексировать и обходить нечего: логин, корзина, сравнение, пользовательский фильтр. Лучший способ убрать ссылку из графа — убрать саму ссылку.
Теги и архивы — отдельная боль. Правило простое: тег живёт, если под него есть спрос и минимум 5–7 релевантных материалов. Всё остальное закрываю noindex и вырезаю ссылки из шаблона, а совсем пустые — отдаю 410. Архивы по датам почти никогда не нужны в индексе и тем более в сквозных блоках. Пагинация: страницы со второй и далее оставляю индексируемыми с self-canonical (canonical на первую страницу Google игнорирует или трактует как ошибку), в разметке — только соседние номера плюс первая и последняя, без «ковра» из 40 цифр. Для каталогов это часть более широкой задачи — структура каталога и фильтров.
Crawl budget на страницах-редиректах
Краулинговый бюджет — это произведение двух вещей: сколько запросов ваш хост выдерживает и сколько Google вообще хочет у вас забрать. Каждый редирект тратит запрос, но контента не приносит. Цепочка из трёх хопов — три запроса на одну страницу вместо одного. Google пройдёт до пяти хопов за один цикл и может дойти до десяти за несколько, но каждый лишний шаг — это отложенная индексация и потерянный сигнал.
Связь с тематической чистотой прямая. Краулер строит представление о сайте, шагая по ссылкам. Если четверть шагов заканчивается не документом, а перебросом, структура выглядит рыхлой. Хуже, когда старые URL массово редиректят на главную: Google часто трактует такие переброски как soft 404 и просто отбрасывает их. Плюс тематический шум — ссылка с анкором «купить мембранный насос НД-160» ведёт в итоге на главную, и алгоритм получает противоречивый сигнал о том, чему эта страница посвящена.
Самый показательный случай из моей практики: интернет-магазин после смены CMS. В логах 34% запросов Googlebot приходились на 3xx, максимальная цепочка — шесть хопов (старый URL → URL с www → без слеша → новая категория → её редирект → финал). Новые товары индексировались по три недели. После схлопывания цепочек в один хоп доля 3xx упала до 4%, и обход новых URL ускорился до двух-трёх дней.
Где искать. Логи сервера — основной источник: фильтрую по user-agent Googlebot и смотрю долю кодов 3xx и 4xx, нормой считаю до 5%. Search Console: отчёт «Статистика сканирования» с разбивкой по коду ответа и раздел индексирования со статусами «Страница с переадресацией» и «Не найдено (404)». Краулер (я работаю со Screaming Frog) даёт отчёт Redirect Chains — там сразу видны длина цепочки, циклы и конечный код. Отдельно прогоняю в list mode все URL из старой карты сайта и все внешние бэклинки: именно по ним чаще всего висят длинные цепочки.
Чиню так. Правило «одна пересадка максимум»: любой старый URL редиректится сразу на финальный адрес, без промежуточных. Внутренние ссылки в шаблонах и в текстах переписываю на конечные URL — редирект не должен быть костылём для навигации. В sitemap.xml оставляю только 200-е страницы. 302 использую буквально для временного: акция на две недели, техработы. Карта редиректов (source → target → дата → ответственный) обязательна при любой миграции сайта — без неё через год никто не вспомнит, почему конкретный URL ведёт туда, куда ведёт, и цепочки начнут отрастать заново.
| Симптом | Что это значит | Что делать |
|---|---|---|
| 100+ уникальных URL в сквозном меню и футере | Вес распыляется, тема размыта | Свернуть в 30–40 входов, остальное — на хабы |
| Теги и архивы в сайдбаре на каждой странице | Тысячи слабых URL в графе и в обходе | Оставить теги со спросом, остальные noindex + убрать ссылки |
| Доля 3xx в логах Googlebot выше 10% | Бюджет уходит на переброски | Схлопнуть цепочки, переписать внутренние ссылки |
| Много статусов «Страница с переадресацией» в GSC | Google видит редиректы там, где ждёт контент | Проверить sitemap и внутренние ссылки на 200-е URL |
| Старые URL редиректят на главную | Риск soft 404, потеря сигналов | Редиректить на ближайший релевантный документ или отдавать 410 |
| Цепочки длиной 3+ хопа после миграции | Отложенная индексация | Один хоп до финального адреса, карта редиректов |
Как проверить свой сайт на тематическую чистоту
- Посчитайте уникальные URL в сквозных блоках. Больше 50 — уже повод сокращать.
- Выгрузите внутренние ссылки и сравните долю ссылок «внутрь кластера» и «наружу» для 10 важных страниц.
- Найдите URL, которые получают входящие ссылки только из шаблона. Если у них нет трафика и спроса — им не место в меню.
- Проверьте теги: сколько их всего, у скольких есть хотя бы 5 материалов и хотя бы один визит из поиска за год.
- Прогоните краулер и откройте отчёт по цепочкам редиректов. Цель — ноль цепочек длиннее одного хопа и ноль циклов.
- Посмотрите в логах долю ответов 3xx и 4xx на запросы Googlebot за последний месяц.
- Сверьте sitemap.xml с реальными кодами ответа: редиректы и 404 оттуда убрать.
- Найдите все 302 и решите по каждому: он действительно временный?
- Проверьте, ведут ли ссылки в текстах статей на финальные URL, а не на старые адреса из 2019 года.
- Сопоставьте список индексируемых страниц с картой кластеров. Всё, что не попадает ни в один кластер, — кандидат на удаление, объединение или noindex.
Когда тематическая чистота не главная проблема
Честно: не всем это нужно в первую очередь. Если у вас 80 страниц на одном домене и одна тема, краулинговый бюджет вас не ограничивает — Google обойдёт такой сайт целиком за сутки. Возиться с пятью лишними ссылками в футере там бессмысленно, лучше писать контент и собирать упоминания.
Крупные мультибрендовые площадки — второй случай. Маркетплейс по определению «про многое», и его вытягивает не чистота темы, а спрос, ассортимент, скорость и внешние сигналы. Там задача другая: держать чистоту внутри каждого раздела, а не по домену.
И третье. Когда на сайте битый Core Web Vitals, страницы отдают 500 по ночам, а на посадочных нет ни цен, ни описаний — начинать надо не с футера. Приоритеты я обычно расставляю через экспресс-аудит: сначала то, что ломает индексацию и конверсию, потом структура графа ссылок. Утечки PageRank и бюджета — это про эффективность уже имеющегося ресурса, а не про создание спроса.
Мой рабочий порядок такой: сначала цепочки редиректов, потому что это чинится за один спринт и даёт измеримый сдвиг в логах. Затем навигация — тут больше согласований с дизайном и продуктом. И только после этого имеет смысл наращивать контент в кластерах: он будет опираться на структуру, которая не протекает. Если нужна помощь с диагностикой или полноценное SEO-продвижение — приходите с доступом к логам и Search Console, разберём по цифрам.
Обсудить SEO-продвижение · Проверить сайт на тематическую чистоту