Если в индексе появляются десятки почти одинаковых страниц, чаще всего проблема не в контенте, а в шаблонных архивах: авторы, рубрики, метки, даты, пагинация, страницы поиска. Для небольшого сайта это выглядит как «мусор в индексе», для большого — как размывание релевантности и лишняя нагрузка на обход. Ниже — рабочий сценарий: как понять, что именно дублируется, что закрывать от индексации, а что лучше оставить.
Как понять, что дубли создают именно архивы
Сначала не трогайте настройки вслепую. Проверьте, какие URL реально попали в поиск и чем они отличаются от основных страниц. Типичный признак — в выдаче есть архивы авторов с пустым или почти пустым содержимым, страницы меток, которые повторяют рубрику, и пагинация, где каждая страница тянет один и тот же шаблонный заголовок.
Что смотреть в первую очередь
- Google Search Console: отчёт по страницам и исключённым URL.
- Поиск по сайту через
site:example.comс запросамиauthor,tag,/page/. - Исходный код страниц архива: есть ли уникальный текст, описание, хлебные крошки.
- Количество записей в таксономии: если у метки 2-3 поста и она дублирует рубрику, пользы от неё обычно мало.
Если на архиве автора только список записей без поясняющего текста, а сама страница не несёт самостоятельной ценности, её часто имеет смысл закрыть от индексации. То же касается меток, которые используются как дубли рубрик.
Диагностика проблемы: где именно рождаются дубли
В WordPress дубли чаще всего появляются не из-за одной ошибки, а из-за комбинации настроек темы, SEO-плагина и структуры контента. Поэтому полезно проверить несколько уровней сразу.
| Источник дубля | Как выглядит | Что делать |
|---|---|---|
| Архивы авторов | Одинаковый список постов без уникального текста | Закрыть от индексации или добавить ценность |
| Метки | Повторяют рубрики по смыслу | Удалить лишние метки, объединить в рубрики |
| Пагинация | /page/2/, /page/3/ с тем же шаблоном | Оставить для обхода, но не плодить лишние каноникалы |
| Страницы поиска | URL с параметром ?s= | Закрыть от индексации |
Если у вас уже стоит SEO-плагин, сначала посмотрите его настройки. В Yoast, Rank Math и похожих решениях часто есть отдельные переключатели для архивов автора, меток и дат. Но даже при наличии плагина полезно понимать, что именно он делает с noindex и каноникалами.
Пошаговое решение без лишнего риска
Шаг 1. Оцените ценность архивов
Не все архивы нужно закрывать. Если на сайте есть сильные авторские страницы с биографией, ссылками на соцсети, списком материалов и уникальным описанием, их можно оставить открытыми. Если это просто технический список постов, индексировать его обычно нет смысла.
Шаг 2. Закройте от индексации то, что не приносит трафик
Для архивов авторов и меток безопаснее начинать с noindex,follow, а не с полного удаления страниц. Так поисковик не будет держать их в индексе, но сможет проходить по ссылкам дальше.
Если вы хотите сделать это кодом, а не через плагин, можно добавить фильтр в functions.php дочерней темы или в небольшой mu-plugin:
<?php
add_action('wp_head', function () {
if (is_author() || is_tag() || is_search()) {
echo '<meta name="robots" content="noindex,follow" />' . "\n";
}
}, 1);Это простой вариант, но он не отменяет канонические URL и не решает вопрос с настройками SEO-плагина. Если плагин уже выводит robots meta, не дублируйте тег вручную — получите конфликт.
Шаг 3. Уберите лишние архивы из карты сайта
Если архив не должен индексироваться, его не должно быть и в sitemap. В противном случае вы сами подсказываете поисковику, что страница важна. В большинстве SEO-плагинов это настраивается отдельно для таксономий и архивов.
Шаг 4. Сократите количество пустых или дублирующих таксономий
Метки часто создают больше шума, чем пользы. Если у вас есть рубрика «Новости» и метка «Новости компании», а по факту они ведут на один и тот же набор материалов, одну из сущностей лучше убрать. Перед удалением проверьте, не используются ли эти термины в навигации, хлебных крошках и внутренних фильтрах.
Для массовой чистки таксономий удобно сначала выгрузить список терминов и посмотреть, где у них есть посты. Пример через WP-CLI:
wp term list post_tag --fields=term_id,name,countЕсли у метки count равен 0 или она дублирует рубрику по смыслу, её можно удалить после проверки ссылок в шаблонах.
Когда лучше править кодом, а когда — через плагин
Если задача только в том, чтобы закрыть архивы от индексации и убрать их из sitemap, удобнее использовать SEO-плагин. Если нужна более тонкая логика — например, noindex только для пустых авторов или только для определённых таксономий — код даёт больше контроля.
| Подход | Плюсы | Минусы |
|---|---|---|
| SEO-плагин | Быстро, без правки темы | Меньше гибкости, зависит от интерфейса |
| Код в теме | Точный контроль, легко версионировать | Можно сломать разметку при обновлении темы |
| mu-plugin | Не зависит от темы, удобно для технастроек | Нужно аккуратно сопровождать |
Для production-сайта mu-plugin обычно практичнее: логика индексации не должна исчезать после смены темы.
Проверка результата после внедрения
После изменений не ограничивайтесь визуальной проверкой. Нужно убедиться, что поисковик видит именно то, что вы задумали.
- Откройте архив автора, метки и страницу поиска в браузере и проверьте наличие
noindexв исходном коде. - Проверьте, что закрытые URL исчезли из sitemap.
- В Search Console отправьте на повторную проверку несколько проблемных страниц.
- Сравните количество индексируемых архивов до и после через
site:и отчёты GSC.
Если страница всё ещё индексируется, проверьте три вещи: нет ли второго тега robots от SEO-плагина, не отдаёт ли сервер старый кэш, и не остался ли URL в sitemap. Иногда проблема не в коде, а в том, что кэш страницы не обновился после правки.
Частые ошибки и как их исправить
Ставят noindex на всё подряд
Так часто ломают полезные архивы рубрик. Если рубрика приносит трафик и содержит уникальный текст, её не нужно автоматически закрывать только потому, что это архив.
Удаляют метки без проверки внутренних ссылок
После удаления метки могут появиться битые ссылки в блоках, виджетах и хлебных крошках. Сначала проверьте, где термин используется в шаблонах и контенте.
Оставляют архив в sitemap
Это частая причина, почему поисковик продолжает возвращаться к странице. Если URL не должен индексироваться, уберите его и из карты сайта.
Дублируют robots meta вручную и через плагин
В итоге поисковик видит несколько противоречивых указаний. Выберите один источник правды: либо SEO-плагин, либо собственный код.
Практические советы по безопасности и производительности
Чистка дублей полезна не только для SEO. Меньше лишних архивов — меньше страниц для обхода, меньше мусора в sitemap и меньше шансов, что шаблонная страница будет ранжироваться вместо нужной.
- Не удаляйте таксономии массово без бэкапа базы.
- После правок сбрасывайте кэш страницы и, если есть, объектный кэш.
- Если используете кастомный код, храните его в mu-plugin, а не в активной теме.
- Проверяйте, не создаёт ли тема отдельные архивы для авторов, дат и форматов записей.
Если нужен более прикладной инструмент для чистки дублей и технических SEO-настроек, можно посмотреть Clearfy Pro: https://wpshop.ru/plugins/clearfy?utm_source=wpengine.ru&utm_medium=article&utm_campaign=kak-nayti-i-udalit-dubli-stranits-iz-za-arhivov-avtorov-i-taksonomiy-v-wordpress. Но даже с плагином важно понимать, какие архивы вы закрываете и почему — иначе можно случайно убрать из индекса страницы, которые реально приводят трафик.
Если нужно быстро проверить логику на конкретном сайте, начните с трёх URL: один архив автора, одна метка и одна страница пагинации. Если на них поведение предсказуемое, дальше можно масштабировать настройку на весь сайт.