Тематическая чистота сайта: где вы теряете вес и краулинг

Разбираю, как навигационные ссылки и цепочки редиректов размывают тему сайта и тратят краулинговый бюджет. Механика PageRank, практика аудита и чек-лист.

Тематическая чистота сайта: где вы теряете вес и краулинг

Тематическая чистота — это совпадение двух карт: карты URL вашего сайта и карты смыслов, по которой Google раскладывает документы в свои кластеры. Если сайт про промышленные насосы, а половина внутренних ссылок ведёт на теги вроде «интересное», архивы по месяцам и старый раздел с корпоративными новостями 2017 года, то для алгоритма вы сайт «про многое понемногу». Никакой отдельной метрики «topical purity» в Search Console нет. Но есть сигналы уровня сайта, и они складываются из того, куда ведут ваши ссылки и что краулер находит в конце пути.

Я за 18 лет разобрал несколько сотен структур, и утечки почти всегда в одних и тех же двух местах. Первое — навигация: шапка, футер, сайдбар, сквозные блоки «читайте также». Второе — редиректы: цепочки после миграций, 302 вместо 301, ссылки в контенте, которые ведут на URL, отдающий 301 на URL, отдающий 301 на главную.

Ниже показываю механику обеих утечек и конкретную практику: что выгружать, что считать, что резать. Без обещаний позиций — только про то, как перестать сливать ресурс, который у вас уже есть.

Что Google считает тематически чистой страницей и сайтом

На уровне страницы всё довольно прозрачно. Документ выглядит целостным, когда заголовки, текст, анкоры внутренних ссылок и сущности в нём вращаются вокруг одной интенции. Страница «ремонт винтовых насосов» со ссылками на «ремонт винтовых насосов Grundfos», «диагностика статора» и «цены на ремонт» — понятный узел. Та же страница с сайдбаром, где висят 20 ссылок на статьи про логистику, кредиты и корпоративный праздник, — размытый узел.

На уровне сайта Google смотрит шире: какие кластеры вообще существуют в вашем графе ссылок, насколько они плотные и есть ли между ними внятные мостики. Здесь помогает нормальная кластеризация семантики — когда каждая группа запросов заранее привязана к своему URL, а не растаскивается по трём похожим страницам. Иначе вы получаете каннибализацию ключевых слов и вдобавок мусорные связи между кластерами, которых там быть не должно.

Есть простой тест. Откройте случайную страницу и выпишите все внутренние ссылки с неё. Если больше 60–70% ведут в её тематический кластер — хорошо. Если 80% ссылок — это сквозная навигация в чужие разделы, то страница работает не на свой кластер, а на весь сайт сразу. Точнее — почти ни на что.

Утечка PageRank через навигационные ссылки

PageRank течёт по внутренним ссылкам. Упрощённо: вес страницы делится между её исходящими ссылками. Когда в шапке и футере 140 уникальных URL, каждая страница сайта отдаёт вес 140 адресам, и большая часть этого потока уходит в «О компании», «Вакансии», «Политику конфиденциальности» и десяток тегов. Товарные и услуговые страницы получают крошки.

Google давно не считает все ссылки равными — модель reasonable surfer взвешивает ссылку по вероятности клика, и футерная ссылка стоит дешевле ссылки из основного текста. Но это не спасает. Во-первых, страницы всё равно остаются в графе и всё равно обходятся краулером. Во-вторых, сквозная ссылка на чуждую тему — это утверждение о сайте: «здесь важно и это тоже». Повторите утверждение на 50 000 страницах, и алгоритму будет тяжело понять, где у вас ядро.

Как я аудирую навигацию. Сначала краулю сайт и выгружаю все внутренние ссылки. Затем считаю, сколько уникальных URL встречается более чем на 90% страниц — это и есть сквозной блок. Дальше сравниваю этот список с картой кластеров. Обычно оказывается, что 20–30 адресов в меню и футере не имеют ни спроса, ни трафика, ни отношения к деньгам. В одном проекте с 12 000 страниц футер разносил вес на 68 URL, из которых 41 за год не получил ни одного визита из поиска.

Что с этим делать по факту. Мегаменю на 200 пунктов сворачиваю в 30–40 входов верхнего уровня, остальное переношу на страницы-хабы: из шапки ссылка на раздел, а внутри раздела — полный список подкатегорий. Так вес идёт по иерархии, а не веером. Служебные страницы вроде политики и вакансий оставляю в футере одной ссылкой каждую — они нужны людям, и их вклад в размывание невелик, пока их три, а не тридцать. Блоки «популярное» и «последние записи» в сайдбаре меняю на ссылки внутри того же кластера — это уже нормальная перелинковка, а не случайный шум.

Про nofollow сразу разочарую: перераспределить вес им нельзя. С 2009 года доля, ушедшая в nofollow-ссылку, просто сгорает. Оставляю его только там, где ссылка нужна пользователю, но индексировать и обходить нечего: логин, корзина, сравнение, пользовательский фильтр. Лучший способ убрать ссылку из графа — убрать саму ссылку.

Теги и архивы — отдельная боль. Правило простое: тег живёт, если под него есть спрос и минимум 5–7 релевантных материалов. Всё остальное закрываю noindex и вырезаю ссылки из шаблона, а совсем пустые — отдаю 410. Архивы по датам почти никогда не нужны в индексе и тем более в сквозных блоках. Пагинация: страницы со второй и далее оставляю индексируемыми с self-canonical (canonical на первую страницу Google игнорирует или трактует как ошибку), в разметке — только соседние номера плюс первая и последняя, без «ковра» из 40 цифр. Для каталогов это часть более широкой задачи — структура каталога и фильтров.

Crawl budget на страницах-редиректах

Краулинговый бюджет — это произведение двух вещей: сколько запросов ваш хост выдерживает и сколько Google вообще хочет у вас забрать. Каждый редирект тратит запрос, но контента не приносит. Цепочка из трёх хопов — три запроса на одну страницу вместо одного. Google пройдёт до пяти хопов за один цикл и может дойти до десяти за несколько, но каждый лишний шаг — это отложенная индексация и потерянный сигнал.

Связь с тематической чистотой прямая. Краулер строит представление о сайте, шагая по ссылкам. Если четверть шагов заканчивается не документом, а перебросом, структура выглядит рыхлой. Хуже, когда старые URL массово редиректят на главную: Google часто трактует такие переброски как soft 404 и просто отбрасывает их. Плюс тематический шум — ссылка с анкором «купить мембранный насос НД-160» ведёт в итоге на главную, и алгоритм получает противоречивый сигнал о том, чему эта страница посвящена.

Самый показательный случай из моей практики: интернет-магазин после смены CMS. В логах 34% запросов Googlebot приходились на 3xx, максимальная цепочка — шесть хопов (старый URL → URL с www → без слеша → новая категория → её редирект → финал). Новые товары индексировались по три недели. После схлопывания цепочек в один хоп доля 3xx упала до 4%, и обход новых URL ускорился до двух-трёх дней.

Где искать. Логи сервера — основной источник: фильтрую по user-agent Googlebot и смотрю долю кодов 3xx и 4xx, нормой считаю до 5%. Search Console: отчёт «Статистика сканирования» с разбивкой по коду ответа и раздел индексирования со статусами «Страница с переадресацией» и «Не найдено (404)». Краулер (я работаю со Screaming Frog) даёт отчёт Redirect Chains — там сразу видны длина цепочки, циклы и конечный код. Отдельно прогоняю в list mode все URL из старой карты сайта и все внешние бэклинки: именно по ним чаще всего висят длинные цепочки.

Чиню так. Правило «одна пересадка максимум»: любой старый URL редиректится сразу на финальный адрес, без промежуточных. Внутренние ссылки в шаблонах и в текстах переписываю на конечные URL — редирект не должен быть костылём для навигации. В sitemap.xml оставляю только 200-е страницы. 302 использую буквально для временного: акция на две недели, техработы. Карта редиректов (source → target → дата → ответственный) обязательна при любой миграции сайта — без неё через год никто не вспомнит, почему конкретный URL ведёт туда, куда ведёт, и цепочки начнут отрастать заново.

СимптомЧто это значитЧто делать
100+ уникальных URL в сквозном меню и футереВес распыляется, тема размытаСвернуть в 30–40 входов, остальное — на хабы
Теги и архивы в сайдбаре на каждой страницеТысячи слабых URL в графе и в обходеОставить теги со спросом, остальные noindex + убрать ссылки
Доля 3xx в логах Googlebot выше 10%Бюджет уходит на переброскиСхлопнуть цепочки, переписать внутренние ссылки
Много статусов «Страница с переадресацией» в GSCGoogle видит редиректы там, где ждёт контентПроверить sitemap и внутренние ссылки на 200-е URL
Старые URL редиректят на главнуюРиск soft 404, потеря сигналовРедиректить на ближайший релевантный документ или отдавать 410
Цепочки длиной 3+ хопа после миграцииОтложенная индексацияОдин хоп до финального адреса, карта редиректов

Как проверить свой сайт на тематическую чистоту

Когда тематическая чистота не главная проблема

Честно: не всем это нужно в первую очередь. Если у вас 80 страниц на одном домене и одна тема, краулинговый бюджет вас не ограничивает — Google обойдёт такой сайт целиком за сутки. Возиться с пятью лишними ссылками в футере там бессмысленно, лучше писать контент и собирать упоминания.

Крупные мультибрендовые площадки — второй случай. Маркетплейс по определению «про многое», и его вытягивает не чистота темы, а спрос, ассортимент, скорость и внешние сигналы. Там задача другая: держать чистоту внутри каждого раздела, а не по домену.

И третье. Когда на сайте битый Core Web Vitals, страницы отдают 500 по ночам, а на посадочных нет ни цен, ни описаний — начинать надо не с футера. Приоритеты я обычно расставляю через экспресс-аудит: сначала то, что ломает индексацию и конверсию, потом структура графа ссылок. Утечки PageRank и бюджета — это про эффективность уже имеющегося ресурса, а не про создание спроса.

Мой рабочий порядок такой: сначала цепочки редиректов, потому что это чинится за один спринт и даёт измеримый сдвиг в логах. Затем навигация — тут больше согласований с дизайном и продуктом. И только после этого имеет смысл наращивать контент в кластерах: он будет опираться на структуру, которая не протекает. Если нужна помощь с диагностикой или полноценное SEO-продвижение — приходите с доступом к логам и Search Console, разберём по цифрам.

Обсудить SEO-продвижение · Проверить сайт на тематическую чистоту