Дубли страниц: тихая утечка позиций, которую не видно глазами

У Виктора магазин автозапчастей в Челябинске: около шестисот позиций в каталоге, страница о доставке, контакты, десяток статей про подбор деталей. Всего, если считать честно, около шестисот пятидесяти страниц.
Когда подрядчик прислал ему первый разбор сайта, в строке «страниц найдено» стояло четыре тысячи двести.
Виктор решил, что это ошибка. Ошибки не было: каждая карточка товара открывалась по четырём-пяти разным адресам. С фильтром по производителю и без, с сортировкой по цене и по названию, со ссылкой из поиска по сайту и напрямую. Содержимое везде одно, адреса разные — а для поисковой системы разный адрес означает разную страницу.
Главная мысль сразу: дубли страниц — это не эстетическая проблема и не придирка специалистов. Это ситуация, в которой поиск вынужден выбирать одну страницу из нескольких одинаковых, и выбирает он далеко не всегда ту, которую вы считаете главной.
Что вы узнаете из статьи
- Почему один и тот же сайт может выглядеть для поиска как четыре разных
- Четыре источника дублей: адресные варианты, фильтры, метки и повторяющиеся тексты
- Чем именно вредны дубли и почему из-за них в выдачу попадает не та страница
- Как найти их за двадцать минут без специальных программ и доступов
- Что чинится галочкой в настройках, а что требует решений по структуре сайта
Почему поиск видит несколько сайтов вместо одного
Для человека адрес сайта — это название. Для робота адрес — это идентификатор страницы, и любое отличие в нём создаёт новую страницу.
Классический набор: сайт открывается с «www» и без него, по защищённому протоколу и по обычному, с косой чертой в конце адреса и без неё. Перемножьте — получится до восьми адресов, ведущих на одну и ту же главную страницу. Все восемь робот считает разными и всем восьми присваивает вес по отдельности.
Что из этого следует. Допустим, на вашу главную ссылаются двадцать сайтов: справочники, партнёры, статья в местном издании. Если половина ссылок ведёт на адрес с «www», а половина без, ваш накопленный авторитет делится надвое. Ни один из двух адресов не получает всего.
Второе следствие тоньше. У каждого сайта есть предел того, сколько страниц робот готов обойти за визит. Когда из четырёх тысяч адресов три с половиной тысячи — копии, робот тратит время на них, а до новой карточки товара или свежей статьи доходит через неделю. Именно поэтому у Виктора новые позиции появлялись в поиске месяцами. Проверить, сколько страниц реально попало в индекс, стоит до любых выводов о качестве сайта.
Третье следствие — самое неприятное для владельца. Из нескольких копий система выбирает одну и показывает её. Выбирает по своим соображениям, и в выдачу вполне может уехать адрес с параметрами фильтра, где половина товаров скрыта, или версия страницы для печати без кнопки «В корзину».
Четыре источника, из которых берутся копии
Адресные варианты. Тот самый набор с «www», протоколами и косой чертой. Плюс адреса с заглавными буквами, если сервер настроен без учёта регистра. Лечится один раз настройкой переадресации на основной адрес.
Фильтры и сортировки. Каталог с выбором по бренду, цене, размеру порождает адреса вида /katalog?brand=17&sort=price. Каждое сочетание — новый адрес, и число их растёт как произведение всех фильтров. Здесь нужен канонический адрес: специальная строка в коде, которая сообщает роботу, что главной считать нужно чистую страницу каталога.
Метки в ссылках. Хвосты вроде ?utm_source=telegram, которые вы ставите, чтобы понимать, откуда пришли люди. Полезная вещь, но каждая метка создаёт формально новый адрес. Решается тем же каноническим адресом.
Повторяющиеся тексты между страницами. Самый частый случай — страницы под города. Компания работает в пяти городах, и на пяти страницах стоит один текст, в котором заменено только название города. Формально адреса разные, содержимое почти одинаковое, и система оставляет одну страницу из пяти. Сюда же — карточки товаров с описанием от производителя, одинаковым у всех продавцов страны, и страницы услуг, отличающиеся одним абзацем.
Отдельная разновидность — технические копии: версия для печати, страницы пагинации каталога, черновики, оставшиеся после переноса сайта, и старый сайт, забытый на поддомене вроде old.вашсайт.ру.
Побочный признак, по которому дубли обнаруживаются раньше всего: одинаковые заголовки. Если проверка показывает двадцать страниц с одной и той же подписью, почти наверняка часть из них — копии. Правило у каждой страницы свой заголовок работает и как защита от этого.
Как найти за двадцать минут и что делать дальше
Порядок простой и не требует программ.
Наберите в поиске site:вашсайт.ру и сравните число найденных страниц с реальным. Расхождение в разы — сигнал.
Откройте главную по четырём адресам подряд: с «www» и без, с косой чертой и без. Все должны переезжать на один основной адрес. Если каждый открывается сам по себе — вот первый дубль.
Возьмите характерное предложение с любой страницы услуг, заключите его в кавычки и найдите в поиске вместе с оператором site:вашсайт.ру. Если находится больше одной страницы, текст повторяется.
Загляните в панель вебмастера: там есть раздел с исключёнными страницами, и напротив копий обычно прямо указано, что страница признана дублем.
Что делать с найденным, по порядку. Сначала настроить переадресацию на один основной адрес — это разовая работа, дающая самый заметный эффект. Затем прописать канонические адреса для фильтров, сортировок и меток. Потом закрыть от индексации служебные страницы: корзину, сравнение, печатные версии, результаты внутреннего поиска. И только затем браться за самое трудоёмкое — переписывать повторяющиеся тексты так, чтобы страница про Челябинск отличалась от страницы про Магнитогорск не одним словом, а содержанием: адрес, сроки, местные особенности, фотографии выполненных работ.
Первые три пункта — работа для того, кто ведёт сайт, и укладывается она в день. Четвёртый упирается в тексты и растягивается на недели.
Составлять карту дублей вручную на большом каталоге нереально. В нашей разовой проверке сайта робот обходит страницы и показывает, какие адреса ведут на одинаковое содержимое, где повторяются заголовки и что не попало в индекс. Отчёт приходит на почту примерно через час, замечания разложены по уровням, и дальше остаётся выдержать порядок работ после разбора.
Сверьтесь с собой
Четыре признака, что позиции утекают в копии.
Первый: по site: находится заметно больше страниц, чем вы создавали. Особенно если разница в разы.
Второй: главная открывается и с «www», и без него, и оба варианта работают самостоятельно, не переезжая друг на друга.
Третий: в выдаче по вашему запросу оказывается адрес с длинным хвостом из знаков вопроса и амперсандов вместо чистой страницы услуги.
Четвёртый: у вас есть страницы под несколько городов, и текст на них отличается только названием города.
Совпало два пункта и больше? Значит, часть накопленного веса сайта распределяется между копиями, а в выдачу попадает не то, что вы готовили.
Часто задаваемые вопросы
Накажет ли поисковая система за дубли?
Санкций за технические копии обычно нет — системы понимают, что так устроены сайты. Проблема не в наказании, а в размывании: вес делится, обход тратится впустую, в выдачу уходит случайная копия. Отдельная история — тексты, скопированные с чужих сайтов: вот это уже риск.
Чем канонический адрес отличается от переадресации?
Переадресация физически уводит человека и робота на другой адрес — старый перестаёт открываться. Канонический адрес оставляет страницу доступной, но сообщает, какую версию считать основной. Для фильтров и меток нужен второй вариант, для адресных дублей — первый.
У меня страницы под десять городов с похожим текстом. Всё переписывать?
Начните с тех городов, откуда реально идут заявки. Отличать страницы должно содержание: адрес и время работы, сроки выезда, цены с учётом расстояния, местные примеры работ. Одна честно переписанная страница полезнее девяти клонов.
Нужно ли закрывать от индексации страницы с метками в ссылках?
Закрывать не нужно — достаточно канонического адреса. Иначе робот перестанет видеть страницу, на которую вы ведёте рекламу и переходы из каналов.
Как быстро всё восстановится после чистки?
Переадресация обычно учитывается за две-четыре недели. Склейка накопленного веса идёт дольше — до нескольких месяцев. Резкого скачка ждать не стоит, эффект проявляется как выравнивание позиций и ускорение появления новых страниц.
Заключение
Дубли — это утечка, которую не видно из окна браузера. Сайт открывается, страницы работают, всё выглядит нормально. И при этом накопленный за годы вес делится между копиями, робот тратит визиты на служебные адреса, а в выдачу попадает версия страницы, которую вы никому не собирались показывать.
Хорошая новость: большая часть чинится настройками и делается один раз. Переадресация на основной адрес, канонические адреса для фильтров и меток, закрытие служебных разделов — это день работы, а не проект на квартал. Трудоёмким остаётся только одно: переписать страницы, которые повторяют друг друга по смыслу.
Чтобы понять масштаб, нужен список: какие адреса ведут на одно и то же и сколько таких. Разовая проверка сайта собирает его за час — вводите адрес и почту, отчёт приходит письмом. Заказать можно на dobro-code.ru/seo-audit, оплата один раз.
Ещё в рубрике «Статьи и SEO»
Страница контактов, которой действительно пользуются
Почему на страницу контактов заходят чаще, чем кажется, что там ищут на самом деле, зачем нужен режим работы с оговорками и как оформить карту, чтобы до вас доехали.
Статьи и SEOЧто делать, когда отзывов нет вообще: чем заменить доказательства
Как показать надёжность, если клиентов было мало или они не пишут: девять форм доказательства помимо отзывов, что работает на старте, чего нельзя делать и как выйти из этого состояния за три месяца.
Статьи и SEOСхемы и инфографика: когда нужны и как сделать просто
Какие данные требуют схемы, а какие лучше оставить текстом, четыре типа изображений, которые работают в услугах, как нарисовать понятно без дизайнера и почему сложная инфографика не работает.