Если в индексе уже появились пустые архивы авторов, тегов или других таксономий, robots.txt обычно не решает задачу. Поисковик может оставить URL в индексе как найденный, но недоступный для обхода. Для тонких архивов в WordPress надежнее управлять индексацией на уровне HTML-мета и каноникализации, а не только через запреты в robots.
Ниже разберем рабочую схему: как понять, какие архивы реально мешают, как закрыть их от индексации без поломки сайта и как проверить, что изменения сработали.
Когда архивы нужно убирать из индекса
Не каждый архив надо закрывать. Проблема возникает, когда страница не дает поиску полезного сигнала: на ней мало записей, контент дублирует другие страницы, а трафика она не приносит. Чаще всего это касается:
- архивов авторов на сайтах с одним автором или без уникальных биографий;
- пустых или почти пустых тегов;
- служебных таксономий, которые созданы плагином и не несут самостоятельной ценности;
- архивов с одинаковыми сниппетами, заголовками и описаниями.
Если архив нужен пользователям как навигация, но не нужен в поиске, его обычно оставляют доступным для обхода и ставят noindex,follow. Это позволяет не ломать внутреннюю перелинковку и при этом не тащить страницу в индекс.
Диагностика: что именно дает дубли
Перед правкой проверьте, какие URL уже индексируются и как они выглядят в выдаче. Удобно смотреть три вещи: заголовок страницы, мета-описание и наличие уникального контента выше списка записей. Если на архиве только список карточек, а title повторяет шаблон вида «Тег: ...», это кандидат на закрытие.
Что проверить вручную
- Есть ли у архива уникальный текст, а не только список постов.
- Отличается ли title от других архивов.
- Не дублирует ли архив страницу рубрики, автора или поиска.
- Есть ли у него входящие ссылки из меню или хлебных крошек.
Если вы используете Yoast SEO, откройте настройки таксономии и посмотрите, какие архивы уже помечены как noindex. Для кастомных таксономий это особенно важно: плагин может не знать, что архив пустой или бесполезный, пока вы не зададите правило вручную.
Пошаговое решение через Yoast SEO
Самый безопасный путь — закрывать от индексации конкретные архивы в настройках SEO-плагина, а не через массовый запрет в robots. Тогда страница остается доступной для обхода, но поисковик получает явный сигнал не включать ее в индекс.
1. Отключите индексацию для нужной таксономии
В админке WordPress откройте настройки SEO для таксономий и найдите архивы тегов, категорий или кастомных таксономий. Для каждого типа оцените отдельно: если архив полезен как посадочная страница, оставьте его открытым; если это тонкий дубль, ставьте noindex.
Логика простая: закрываем не «все подряд», а только те архивы, которые не несут самостоятельной ценности. Иначе можно случайно убрать из поиска нормальные страницы, которые реально собирают трафик.
2. Для сложных случаев используйте фильтр WordPress
Если нужно управлять индексацией кодом, можно подключиться к фильтру wpseo_robots и вернуть noindex,follow только для нужных архивов. Пример ниже закрывает архивы тегов с количеством записей меньше 3.
<?php
add_filter( 'wpseo_robots', function( $robots ) {
if ( is_tag() ) {
$term = get_queried_object();
if ( $term instanceof WP_Term ) {
$count = (int) $term->count;
if ( $count < 3 ) {
return 'noindex,follow';
}
}
}
return $robots;
} );Этот вариант полезен, когда вручную поддерживать сотни тегов неудобно. Но перед внедрением проверьте, не влияет ли правило на нужные посадочные страницы. Если у вас есть теги, которые специально продвигаются, исключите их из условия.
3. Проверьте canonical и title
Даже если страница закрыта от индексации, у нее должен быть корректный canonical. Обычно он должен указывать на саму страницу архива, а не на главную или случайную рубрику. Если canonical сломан, поисковик может интерпретировать страницу как дубль другой.
Для title важно убрать бессмысленные шаблоны. Например, если архив тегов пустой, заголовок вида «Тег: Купить» только усиливает мусорный след в индексе. Лучше либо закрыть такой архив, либо сделать его реальной посадочной страницей с текстом и подборкой материалов.
Когда лучше править кодом, а когда плагином
| Подход | Когда подходит | Минус |
|---|---|---|
| Настройки Yoast SEO | Нужно быстро закрыть конкретную таксономию | Менее гибко для условий по количеству записей |
Код через wpseo_robots | Нужны правила по счетчику, типу архива или роли | Требует тестирования после обновлений темы/плагина |
robots.txt | Нужно ограничить обход технических URL | Не решает задачу удаления уже известных URL из индекса |
Если у вас нет задачи писать собственные правила, удобнее держать базовую чистку через SEO-плагин. Для более широких сценариев, где нужно убирать дубли, служебные архивы и лишние элементы интерфейса, иногда используют Clearfy Pro: он помогает централизованно отключать часть лишних страниц и функций, не разбрасывая настройки по разным местам. Ссылка: https://wpshop.ru/plugins/clearfy.
Проверка результата после внедрения
После изменения правил не ограничивайтесь просмотром исходного кода. Нужно убедиться, что поисковик видит именно тот сигнал, который вы ожидали.
Что проверить
- В HTML страницы есть
<meta name="robots" content="noindex,follow">или эквивалентный заголовок. - Canonical указывает на сам архив, если страница остается доступной.
- Страница открывается без редиректа на главную или ошибку.
- В Search Console URL проходит проверку и не получает статус, противоречащий вашей логике.
Проверять лучше в двух местах: в браузере через просмотр исходного кода и в инструментах для вебмастеров. Если страница уже была в индексе, удаление может занять время. Это нормально: поисковик должен переобойти URL и увидеть новый сигнал.
Быстрая проверка через PHP
Если вы сомневаетесь, что фильтр срабатывает только на нужных страницах, временно добавьте логирование в debug.log или проверьте условие через error_log(). Ниже пример для точечной диагностики:
<?php
add_filter( 'wpseo_robots', function( $robots ) {
if ( is_tag() ) {
error_log( 'Tag archive checked: ' . get_queried_object_id() );
}
return $robots;
} );После теста не оставляйте такие логи в продакшене надолго: они засоряют журнал и могут раскрывать структуру сайта.
Частые ошибки и как их исправить
Закрывают страницу в robots.txt и ждут удаления из индекса
Это распространенная ошибка. Если URL уже известен поисковику, запрет на обход не всегда убирает его из индекса. Для удаления нужен явный сигнал noindex или удаление страницы с корректным статусом ответа.
Ставят noindex на все архивы подряд
Так можно случайно убрать из поиска полезные страницы категорий. Перед массовым изменением проверьте, какие архивы реально приносят трафик и какие используются как посадочные страницы.
Ломают canonical
Иногда после правок canonical начинает вести на главную или на другую рубрику. В результате поисковик получает противоречивые сигналы: страница доступна, но каноническая ссылка указывает в другое место. Это надо исправлять сразу, иначе индексация будет вести себя нестабильно.
Не учитывают пагинацию
Если закрываете архив, проверьте и его страницы пагинации. Иначе в индексе могут остаться /page/2/, /page/3/ и т.д. Для тонких архивов это обычно лишний шум.
Чек-лист перед публикацией изменений
- Определили, какие архивы действительно тонкие и дублирующие.
- Проверили, не нужны ли они как посадочные страницы.
- Настроили
noindex,followдля нужных архивов. - Убедились, что canonical не сломан.
- Проверили пагинацию и связанные URL.
- Посмотрели исходный код и статус в Search Console.
Практические советы по безопасности и производительности
Если вы управляете индексацией кодом, держите изменения в дочерней теме или в небольшом mu-plugin, а не в файле основной темы. Так правило не потеряется после обновления. Для больших сайтов полезно документировать, какие таксономии закрыты и почему: через месяц это сильно экономит время на аудитах.
Не смешивайте SEO-логику и кеширование. Если у вас агрессивный page cache, после изменения мета-тегов очистите кеш, иначе вы будете проверять старую версию страницы и думать, что правило не сработало.
Если нужен более широкий аудит дублей, служебных страниц и мусорных архивов, имеет смысл смотреть не только на отдельные правила, но и на общую чистку сайта. В таких сценариях удобнее сначала убрать лишнее на уровне структуры, а уже потом добивать точечные URL.