Индексация: как убедиться, что робот вообще видит ваши страницы

В апреле Ольга добавила на сайт детского центра страницу про летний лагерь. Написала честно и подробно: распорядок дня, чем кормят, сколько детей в группе, что брать с собой, как забирать раньше. Полторы тысячи знаков и восемь фотографий с прошлого сезона.
В июне лагерь набрали на треть. Ольга открыла поиск, набрала «детский лагерь дневного пребывания» и своего города — страницы не было. Ни на первой позиции, ни на пятой странице выдачи. Зато нашёлся конкурент, у которого про лагерь написано три абзаца и ни одной фотографии.
Она решила, что текст плохой, и переписала его ещё раз. Результат не изменился, потому что дело было не в тексте: страница физически отсутствовала в базе поисковой системы. Переписывать можно было хоть до сентября.
Главная мысль сразу: пока страницы нет в индексе, всё остальное не имеет значения. Ни ключевые фразы, ни объём, ни фотографии — их некому оценивать. Проверка индексации занимает пять минут и должна идти первой, до любых разговоров о продвижении.
Что вы узнаете из статьи
- Из каких трёх шагов складывается путь страницы от публикации до показа человеку
- Как за пять минут проверить, есть ли конкретная страница в поиске
- Пять причин, по которым страницу не берут в индекс, и как отличить их друг от друга
- Зачем сайту карта страниц и что должно быть в служебном файле robots.txt
- Что реально ускоряет попадание в поиск, а что относится к городским легендам
Три шага, которые люди путают между собой
Между «я опубликовал страницу» и «её видят люди» лежат три отдельных события.
Обход. Робот узнаёт адрес страницы и скачивает её содержимое. Узнать адрес он может двумя способами: перейти по ссылке с другой известной ему страницы или найти адрес в карте сайта. Третьего способа нет. Страница, на которую никто не ссылается и которой нет в карте, для робота не существует, даже если она открывается у вас в браузере.
Индексация. Скачанную страницу система разбирает и решает, класть ли её в базу. Отказать могут: если страница закрыта служебной инструкцией, если она почти пустая, если такая же уже есть на сайте, если сервер отдал ошибку в момент обхода.
Показ. Только попавшая в базу страница участвует в подборе ответов на запросы. И здесь уже работает всё то, что обычно называют продвижением.
Путаница возникает, когда все три шага сливаются в одно слово «продвижение». Владелец сайта покупает работы по третьему шагу, а застряло у него на первом. Деньги уходят, ничего не меняется, вывод делается неверный: «SEO не работает». У фразы «сайта нет в поиске» есть три разных причины, и до первой из них продвижение вообще не добирается.
Проверить, на каком шаге вы находитесь, просто. Введите в строке поиска оператор site: и адрес страницы целиком, без пробела после двоеточия. Нашлась — она в индексе, вопрос в позициях. Не нашлась — вопрос в индексации, и дальше идём разбираться.
Пять причин, по которым страницы нет в базе
Причина первая: запрет в служебном файле. По адресу вашсайт.ру/robots.txt лежит текстовый файл с инструкциями для роботов. Строка Disallow: / означает «не заходить никуда». Её ставят на время разработки и иногда забывают убрать. Бывает мягче: закрыт один раздел — например, Disallow: /blog, потому что когда-то там велась тестовая работа.
Причина вторая: запрет в коде самой страницы. В разделе <head> может стоять инструкция noindex. Внешне страница совершенно обычная. Такое случается, когда страницу копировали с черновика или когда в системе управления сайтом стоит галочка «скрыть от поисковых систем» — в некоторых конструкторах она включена по умолчанию для новых страниц.
Причина третья: страница-сирота. На неё не ведёт ни одна ссылка внутри сайта, и в карте сайта её нет. Классический случай: страницу сделали под рассылку, ссылку дали в письме, а в меню не поставили. Робот приходит на сайт через главную и обходит его по ссылкам — до сироты он просто не доходит.
Причина четвёртая: сервер отвечает ошибкой. Страница открывается у вас, потому что лежит в кэше браузера, но роботу отдаётся ошибка или бесконечная переадресация. Отдельная разновидность — сайт, который «падает» под нагрузкой ровно в те моменты, когда его обходит робот.
Причина пятая: страница почти пустая или повторяет другую. Две строки текста и телефон системе оценивать нечего. Если же на сайте несколько одинаковых страниц, в базу возьмут одну, а остальные отбросят как копии — и совсем не обязательно ту, которую вы считаете главной.
Порядок проверки: пятнадцать минут без доступов
Всё нужное делается снаружи, пароли от сайта не понадобятся.
Сначала общая картина: site:вашсайт.ру в строке поиска. Сравните число найденных страниц с тем, сколько их на самом деле. Расхождение вдвое — уже повод разбираться, расхождение в десять раз — авария.
Дальше конкретная страница: site:вашсайт.ру/adres-stranicy. Так вы отделяете общую проблему сайта от проблемы одной страницы.
Потом откройте вашсайт.ру/robots.txt и прочитайте его целиком — он редко длиннее двадцати строк. Ищите слово Disallow и смотрите, что стоит после него.
Затем вашсайт.ру/sitemap.xml. Файл должен открываться и содержать адреса ваших страниц. Если открывается пустая страница или ошибка — карты у сайта нет, и роботу приходится искать страницы вслепую.
Наконец, откройте нужную страницу, нажмите правую кнопку мыши, выберите «Просмотр кода страницы» и поищите по тексту слово noindex. Нашлось в верхней части — вот и ответ.
Отдельно стоит зарегистрировать сайт в панелях для вебмастеров у поисковых систем. Это бесплатно, занимает вечер и даёт две полезные вещи: список страниц, которые система не взяла в индекс, с указанием причины, и возможность отправить конкретный адрес на переобход вручную.
Когда страниц много, ручной обход перестаёт быть реалистичным: тридцать адресов — это тридцать проверок по пяти пунктам каждая. Машинный обход делает то же самое разом. Наша разовая проверка сайта устроена именно так: робот открывает сайт снаружи, проходит по всем доступным страницам и через час присылает разбор, где видно, что в индекс не попало и по какой причине. В том же отчёте — заголовки и описания страниц, скорость, изображения и остальные семь направлений. Стоит восемьсот рублей, оплачивается один раз, доступы не нужны.
Сверьтесь с собой
Четыре признака, что проблема именно в индексации, а не в позициях.
Первый: по site: находится заметно меньше страниц, чем есть на сайте. Особенно если не находятся страницы услуг — самые нужные.
Второй: сайт не находится даже по точному названию компании вместе с городом. По такому запросу конкуренция минимальна, и отсутствие в выдаче означает отсутствие в базе.
Третий: вы не можете открыть вашсайт.ру/sitemap.xml — там ошибка или пусто.
Четвёртый: новые страницы не появляются в поиске месяцами, хотя старые находятся нормально. Это указывает на проблему с обходом новых адресов, а не с сайтом целиком.
Совпало два пункта и больше? Значит, деньги на продвижение сейчас уйдут в пустоту: продвигать нечего, пока страницы не попали в базу.
Часто задаваемые вопросы
Сколько времени занимает индексация новой страницы?
Обычно от нескольких дней до трёх-четырёх недель. На активно обновляемых сайтах быстрее: робот привыкает заходить чаще. Если прошло больше месяца и страницы нет, ждать дальше бесполезно — ищите причину.
Можно ли ускорить попадание страницы в поиск?
Да, тремя способами: отправить адрес на переобход через панель вебмастера, поставить на страницу ссылки с других страниц сайта и дать на неё ссылку в своих каналах, чтобы по ней шли живые переходы. Платные «услуги по ускоренной индексации» ничего сверх этого не делают.
Что означает статус «страница обходится, но не индексируется»?
Робот её видел и брать не стал. Чаще всего причина в содержимом: слишком мало текста, повтор другой страницы или служебный адрес вроде корзины. Реже — временный сбой, и тогда страница появится сама через пару недель.
Нужен ли sitemap маленькому сайту на десять страниц?
Строго говоря, нет: робот дойдёт до всего по ссылкам из меню. Но карта стоит ничего — почти все системы управления сайтом собирают её сами — и страхует от ситуации, когда страницу забыли поставить в меню.
Я закрыл раздел от индексации, но страницы всё равно находятся. Почему?
Запрет в robots.txt закрывает обход, а не показ. Если на страницу ведут внешние ссылки, она может остаться в базе. Чтобы убрать её наверняка, нужна инструкция noindex в коде самой страницы, и при этом обход закрывать нельзя — иначе робот не увидит запрет.
Заключение
Индексация — это не этап продвижения, а вход в него. Страница либо есть в базе поисковой системы, либо её там нет, и во втором случае никакая работа с текстами и ключевыми фразами не сдвинет ситуацию ни на позицию.
Хорошая новость в том, что проверка не требует ни бюджета, ни специалистов, ни паролей от сайта: оператор site:, служебный файл robots.txt, карта сайта и просмотр кода страницы отвечают на вопрос за пятнадцать минут. Плохая — в том, что причины бывают спрятаны глубоко, а на сайте из нескольких десятков страниц вручную их не отловить.
Если хочется получить полную картину сразу, разовая проверка закрывает эту задачу: вы вводите адрес сайта и почту, а примерно через час получаете разбор с перечнем страниц, замечаниями и приоритетами. Заказать можно на dobro-code.ru/seo-audit — оплата один раз, без подписки.
Ещё в рубрике «Статьи и SEO»
Страница контактов, которой действительно пользуются
Почему на страницу контактов заходят чаще, чем кажется, что там ищут на самом деле, зачем нужен режим работы с оговорками и как оформить карту, чтобы до вас доехали.
Статьи и SEOЧто делать, когда отзывов нет вообще: чем заменить доказательства
Как показать надёжность, если клиентов было мало или они не пишут: девять форм доказательства помимо отзывов, что работает на старте, чего нельзя делать и как выйти из этого состояния за три месяца.
Статьи и SEOСхемы и инфографика: когда нужны и как сделать просто
Какие данные требуют схемы, а какие лучше оставить текстом, четыре типа изображений, которые работают в услугах, как нарисовать понятно без дизайнера и почему сложная инфографика не работает.