Перейти к содержимому
cropas.samara
Техническое SEO 10 мин чтения

Индексация сайта: почему страницы не попадают в поиск

Страница опубликована, а в поиске её нет. Рассказываем, как найти причину: от запрета в robots.txt до малополезного контента, и что делать в каждом случае.

// содержание статьи

Владелец сайта добавляет новую услугу, ждёт неделю, вторую — а по запросу страница так и не находится. Первое желание — переписать текст или купить ссылки. Но чаще всего проблема глубже: поисковая система эту страницу просто не видит или сознательно не включает в индекс. А страница, которой нет в индексе, не может ранжироваться ни на какой позиции.

Индексация — это первый и обязательный этап на пути к трафику. Пока робот не обошёл страницу, не разобрал её содержимое и не решил сохранить её в базе, все остальные усилия по оптимизации работают вхолостую. В этой статье разберём, как устроен процесс, как проверить, что происходит с вашими страницами, и какие причины встречаются на практике чаще всего.

Как поисковик находит и добавляет страницы

Путь страницы в поиск состоит из нескольких шагов, и сбой возможен на любом из них.

  1. Обнаружение. Робот узнаёт об адресе — из ссылки на другой странице, из файла sitemap.xml, из внешнего источника или из уведомления через панель вебмастера.
  2. Сканирование. Робот запрашивает страницу у сервера и получает ответ: код статуса, заголовки и HTML-код.
  3. Обработка. Поисковик разбирает содержимое, при необходимости выполняет JavaScript, находит канонический адрес, определяет язык, регион и тематику.
  4. Решение об индексации. Система оценивает, стоит ли хранить страницу: не дубль ли это, есть ли в ней польза, не запрещена ли она директивами.
  5. Ранжирование. Только проиндексированная страница участвует в выдаче и получает позиции по запросам.

Важно понимать: сканирование и индексация — не одно и то же. Робот может заходить на страницу регулярно, но не добавлять её в поиск. И наоборот, страница может оставаться в индексе, хотя сканируется редко.

Как проверить, что страница в индексе

Прежде чем что-то чинить, нужно понять масштаб проблемы: не проиндексирована одна страница, раздел или половина сайта.

Панели вебмастера

Главный источник правды — Яндекс Вебмастер и Google Search Console. В Вебмастере откройте раздел «Индексирование» и отчёт «Страницы в поиске»: там видны добавленные и исключённые адреса с указанием причины. Инструмент «Проверить статус URL» покажет, когда робот последний раз заходил на конкретную страницу и что увидел. В Search Console аналогичную роль играют отчёт «Индексирование страниц» и инструмент проверки URL.

Подробнее о том, какие отчёты стоит просматривать регулярно, мы писали в статье про Яндекс Вебмастер и Google Search Console.

Оператор site: и поиск по фразе

Быстрый, но грубый способ — ввести в поиске site: с именем вашего домена и частью адреса раздела. Результат покажет примерное число страниц, но цифрам доверять нельзя: оператор даёт оценку, а не точный подсчёт. Для проверки одной страницы удобнее взять уникальную фразу из текста и поискать её в кавычках.

Сравнение с количеством страниц на сайте

Полезно сопоставить три числа: сколько страниц реально существует на сайте (по данным краулера), сколько адресов в sitemap.xml и сколько в индексе. Если на сайте 400 полезных страниц, а в поиске 150 — проблема системная. Если в индексе 2 300 адресов при 400 реальных — значит, в поиск попал мусор: фильтры, параметры, служебные страницы.

Типичные причины и что с ними делать

Ниже — сводная таблица причин, которые мы встречаем на аудитах чаще всего. Она помогает быстро сузить круг поиска.

ПричинаКак проявляетсяГде смотретьЧто делать
Запрет в robots.txtСтраница не сканируется совсемАнализ robots.txt в ВебмастереУбрать или уточнить директиву Disallow
Метатег noindexСканируется, но исключенаКод страницы, отчёт об исключённыхУдалить noindex с нужных страниц
Неверный canonicalИсключена как неканоническаяИнструмент проверки URLУказать канонический адрес на саму страницу
Дубль другой страницыИсключена как дубликатОтчёт «Страницы в поиске»Уникализировать или склеить редиректом
Ошибка сервера 5xxРобот получает сбойОтчёт о статусах, логиУстранить сбой, проверить нагрузку
Контент подгружается скриптомПустая страница для роботаПросмотр отрендеренного HTMLСерверный рендеринг или предрендер
Малополезная страницаИсключена как недостаточно качественнаяОтчёт об исключённыхПереработать содержимое или убрать
Нет входящих ссылокРобот не знает об адресеКраулер, карта сайтаДобавить в меню, перелинковку и sitemap

Разберём самые частые ситуации подробнее.

Технические запреты

Самая обидная причина — сайт сам просит робота не заходить. Часто так бывает после разработки: на тестовой копии ставят Disallow: / в robots.txt или noindex во все шаблоны, а при переносе на боевой домен забывают убрать. Мы видели сайт мебельного салона на Московском шоссе, который три месяца после запуска работал с полным запретом индексации — и владелец искренне считал, что «SEO не работает».

Второй вариант — слишком широкие правила. Например, директива Disallow: /*? закрывает все адреса с параметрами, а заодно и пагинацию каталога, если она сделана через параметр. Правила для robots.txt и карты сайта мы разбирали отдельно: robots.txt и sitemap.xml без ошибок.

Канонические адреса и дубли

Атрибут canonical подсказывает поисковику, какую версию страницы считать основной. Ошибки здесь коварны: шаблон может ставить canonical на главную для всех страниц или на первую страницу категории для всей пагинации. В результате поисковик послушно исключает всё, кроме указанного адреса.

Дубли возникают и без ошибок в canonical: одна страница доступна со слешем и без, с разными параметрами сортировки, через разные пути в каталоге. Робот тратит ресурсы на копии, а нужная версия может проиграть. Решение зависит от природы копии: где-то достаточно корректного canonical, где-то нужен 301-редирект, а иногда — закрытие параметров от обхода.

Ответы сервера

Страница должна отдавать код 200. Если сервер периодически отвечает 500 или 503, робот снижает частоту обхода, а нестабильные страницы могут вылететь из индекса. Отдельная история — «мягкие 404»: страница пустая или с текстом «ничего не найдено», но сервер отвечает 200. Поисковик распознаёт такие случаи и исключает их, а заодно тратит на них время.

Проблемы с JavaScript

Современные сайты часто собирают содержимое в браузере. Google умеет выполнять скрипты, но делает это с задержкой и не всегда полностью. Яндекс рендерит JavaScript заметно скромнее. Если в исходном HTML нет текста, заголовков и ссылок, а всё появляется только после выполнения скриптов, часть страниц может индексироваться с пустым содержимым или не индексироваться вовсе.

Проверка простая: откройте исходный код страницы (не инспектор, а именно исходный ответ сервера) и найдите в нём основной текст. Если его нет — стоит обсуждать серверный рендеринг или предварительную генерацию страниц.

Малополезные и похожие страницы

Даже технически идеальная страница может не попасть в поиск, если поисковик сочтёт её бесполезной. Типичные примеры: карточки товаров с одной фотографией и без описания, теги блога с двумя записями, страницы услуг, отличающиеся только названием района. В Вебмастере такие адреса обычно отмечены как «недостаточно качественные» или «малоценные».

Здесь помогает не техника, а работа с содержимым: объединить близкие страницы в одну сильную, дописать уникальную информацию, добавить характеристики, фотографии, ответы на вопросы. Если страница не нужна ни людям, ни поиску — честнее закрыть её от индексации самостоятельно.

Краулинговый бюджет: когда он действительно важен

Термин «краулинговый бюджет» любят упоминать к месту и не к месту. На деле для сайта услуг из 50–300 страниц он почти никогда не становится ограничением. Робот легко обходит такой объём.

Бюджет начинает играть роль на крупных проектах: интернет-магазинах с десятками тысяч карточек, агрегаторах, сайтах с фильтрами, которые порождают миллионы комбинаций адресов. Признаки проблемы:

  • новые товары появляются в поиске через несколько недель;
  • в логах сервера видно, что робот ходит в основном по параметрическим адресам;
  • в индексе много служебных страниц, а важные категории обновляются редко.

Решение — сократить количество бессмысленных адресов: закрыть сортировки и технические параметры, настроить Clean-param для Яндекса, убрать бесконечные календари и сессии в URL, обновлять sitemap.xml только актуальными адресами.

Как ускорить индексацию новых страниц

Если с технической стороной всё в порядке, новые страницы можно «подтолкнуть» к роботу.

  • Переобход в Вебмастере. В Яндекс Вебмастере есть инструмент «Переобход страниц» с дневным лимитом — отправляйте туда самые важные адреса сразу после публикации.
  • Запрос индексации в Search Console. Инструмент проверки URL позволяет запросить сканирование конкретной страницы.
  • Актуальный sitemap.xml. Карта сайта должна обновляться автоматически и содержать дату изменения страниц.
  • Ссылки с сильных страниц. Ссылка с главной, из меню или из популярной статьи приводит робота быстрее, чем любая карта сайта.
  • Протокол IndexNow. Его поддерживает Яндекс: сайт сам уведомляет поисковик об изменениях. Многие CMS умеют делать это через модуль.

При этом ускорение не заменяет качество. Если страница слабая, поисковик может её быстро просканировать — и так же быстро исключить.

Пошаговая диагностика: порядок действий

Когда страница не находится в поиске, мы проверяем её в таком порядке. Это экономит время: первые пункты занимают минуты, а последние требуют анализа.

  1. Проверить статус URL в Вебмастере и Search Console: знает ли поисковик об адресе и что он о нём думает.
  2. Убедиться, что сервер отвечает кодом 200, без редиректов и цепочек.
  3. Проверить robots.txt на предмет запрета этого адреса.
  4. Посмотреть код страницы: нет ли метатега noindex или заголовка X-Robots-Tag.
  5. Проверить canonical: указывает ли он на эту же страницу.
  6. Открыть исходный HTML и убедиться, что основной текст и ссылки присутствуют без выполнения скриптов.
  7. Проверить, есть ли на страницу внутренние ссылки и включена ли она в sitemap.xml.
  8. Сравнить содержимое с похожими страницами сайта: нет ли дублирования.
  9. Оценить полезность страницы глазами пользователя: отвечает ли она на запрос лучше конкурентов.

Если все пункты пройдены, а страницы по-прежнему нет, стоит подождать один-два цикла обхода и посмотреть, не изменится ли статус. Для молодых сайтов индексация иногда занимает несколько недель — это нормально.

Как не сломать индексацию при изменениях на сайте

Большая часть проблем возникает не сама по себе, а после каких-то работ: редизайна, переезда на новую CMS, смены структуры URL. Несколько правил, которые избавят от неприятных сюрпризов:

  • перед запуском новой версии сравните robots.txt, метатеги и canonical со старой;
  • при смене адресов настройте постраничные 301-редиректы, а не перенаправление всего на главную;
  • после релиза в течение двух-трёх недель ежедневно смотрите отчёты об исключённых страницах;
  • держите тестовую копию сайта закрытой паролем, а не только директивой robots.txt — так она точно не попадёт в поиск.

Если сайт уже пострадал после переезда или обновления, разбираться лучше комплексно. В рамках SEO-аудита мы проверяем индексацию всех разделов, сверяем данные краулера с отчётами поисковиков и выдаём список исправлений по приоритету, а внедрение берёт на себя команда технической оптимизации.

Выводы

Индексация — фундамент, без которого не работает ни текст, ни ссылки, ни дизайн. Чаще всего страницы не попадают в поиск по вполне конкретным и устранимым причинам.

  • Начинайте с данных Яндекс Вебмастера и Google Search Console: они прямо называют причину исключения.
  • Проверьте простое — robots.txt, noindex, canonical, коды ответа — прежде чем переписывать тексты.
  • Убедитесь, что контент виден роботу без выполнения JavaScript.
  • Не плодите дубли и малополезные страницы: лучше одна сильная страница, чем пять слабых.
  • Любые крупные изменения на сайте сопровождайте проверкой индексации в первые недели после релиза.

Регулярный контроль индексации занимает несколько минут в неделю, а избавляет от месяцев потерянного трафика.

$ help --seo

Хотите применить это на своём сайте?

Посмотрим сайт и подскажем, какие шаги дадут результат быстрее всего. Разбор бесплатный.

Все статьи рубрики
  • Техническое SEO 7 мин

    Микроразметка Schema.org: зачем она нужна и как внедрить

    Микроразметка помогает поисковику понять, где на странице цена, адрес, рейтинг и ответы на вопросы. Рассказываем, какие типы действительно полезны и как их внедрить без ошибок.

  • Техническое SEO 7 мин

    Мобильная версия сайта и mobile-first индексация

    Поисковики оценивают сайт по тому, как он выглядит на смартфоне. Разбираем, что это значит на практике и как проверить мобильную версию, прежде чем она начнёт терять позиции.

  • Техническое SEO 8 мин

    Редиректы 301 и 302: когда и какой использовать

    Неправильно выбранный редирект может обнулить позиции после переезда или редизайна. Объясняем разницу между 301 и 302 и показываем, как настраивать перенаправления без потерь.