Индексация сайта: почему страницы не попадают в поиск
Страница опубликована, а в поиске её нет. Рассказываем, как найти причину: от запрета в robots.txt до малополезного контента, и что делать в каждом случае.
// содержание статьи
Владелец сайта добавляет новую услугу, ждёт неделю, вторую — а по запросу страница так и не находится. Первое желание — переписать текст или купить ссылки. Но чаще всего проблема глубже: поисковая система эту страницу просто не видит или сознательно не включает в индекс. А страница, которой нет в индексе, не может ранжироваться ни на какой позиции.
Индексация — это первый и обязательный этап на пути к трафику. Пока робот не обошёл страницу, не разобрал её содержимое и не решил сохранить её в базе, все остальные усилия по оптимизации работают вхолостую. В этой статье разберём, как устроен процесс, как проверить, что происходит с вашими страницами, и какие причины встречаются на практике чаще всего.
Как поисковик находит и добавляет страницы
Путь страницы в поиск состоит из нескольких шагов, и сбой возможен на любом из них.
- Обнаружение. Робот узнаёт об адресе — из ссылки на другой странице, из файла sitemap.xml, из внешнего источника или из уведомления через панель вебмастера.
- Сканирование. Робот запрашивает страницу у сервера и получает ответ: код статуса, заголовки и HTML-код.
- Обработка. Поисковик разбирает содержимое, при необходимости выполняет JavaScript, находит канонический адрес, определяет язык, регион и тематику.
- Решение об индексации. Система оценивает, стоит ли хранить страницу: не дубль ли это, есть ли в ней польза, не запрещена ли она директивами.
- Ранжирование. Только проиндексированная страница участвует в выдаче и получает позиции по запросам.
Важно понимать: сканирование и индексация — не одно и то же. Робот может заходить на страницу регулярно, но не добавлять её в поиск. И наоборот, страница может оставаться в индексе, хотя сканируется редко.
Как проверить, что страница в индексе
Прежде чем что-то чинить, нужно понять масштаб проблемы: не проиндексирована одна страница, раздел или половина сайта.
Панели вебмастера
Главный источник правды — Яндекс Вебмастер и Google Search Console. В Вебмастере откройте раздел «Индексирование» и отчёт «Страницы в поиске»: там видны добавленные и исключённые адреса с указанием причины. Инструмент «Проверить статус URL» покажет, когда робот последний раз заходил на конкретную страницу и что увидел. В Search Console аналогичную роль играют отчёт «Индексирование страниц» и инструмент проверки URL.
Подробнее о том, какие отчёты стоит просматривать регулярно, мы писали в статье про Яндекс Вебмастер и Google Search Console.
Оператор site: и поиск по фразе
Быстрый, но грубый способ — ввести в поиске site: с именем вашего домена и частью адреса раздела. Результат покажет примерное число страниц, но цифрам доверять нельзя: оператор даёт оценку, а не точный подсчёт. Для проверки одной страницы удобнее взять уникальную фразу из текста и поискать её в кавычках.
Сравнение с количеством страниц на сайте
Полезно сопоставить три числа: сколько страниц реально существует на сайте (по данным краулера), сколько адресов в sitemap.xml и сколько в индексе. Если на сайте 400 полезных страниц, а в поиске 150 — проблема системная. Если в индексе 2 300 адресов при 400 реальных — значит, в поиск попал мусор: фильтры, параметры, служебные страницы.
Типичные причины и что с ними делать
Ниже — сводная таблица причин, которые мы встречаем на аудитах чаще всего. Она помогает быстро сузить круг поиска.
| Причина | Как проявляется | Где смотреть | Что делать |
|---|---|---|---|
| Запрет в robots.txt | Страница не сканируется совсем | Анализ robots.txt в Вебмастере | Убрать или уточнить директиву Disallow |
| Метатег noindex | Сканируется, но исключена | Код страницы, отчёт об исключённых | Удалить noindex с нужных страниц |
| Неверный canonical | Исключена как неканоническая | Инструмент проверки URL | Указать канонический адрес на саму страницу |
| Дубль другой страницы | Исключена как дубликат | Отчёт «Страницы в поиске» | Уникализировать или склеить редиректом |
| Ошибка сервера 5xx | Робот получает сбой | Отчёт о статусах, логи | Устранить сбой, проверить нагрузку |
| Контент подгружается скриптом | Пустая страница для робота | Просмотр отрендеренного HTML | Серверный рендеринг или предрендер |
| Малополезная страница | Исключена как недостаточно качественная | Отчёт об исключённых | Переработать содержимое или убрать |
| Нет входящих ссылок | Робот не знает об адресе | Краулер, карта сайта | Добавить в меню, перелинковку и sitemap |
Разберём самые частые ситуации подробнее.
Технические запреты
Самая обидная причина — сайт сам просит робота не заходить. Часто так бывает после разработки: на тестовой копии ставят Disallow: / в robots.txt или noindex во все шаблоны, а при переносе на боевой домен забывают убрать. Мы видели сайт мебельного салона на Московском шоссе, который три месяца после запуска работал с полным запретом индексации — и владелец искренне считал, что «SEO не работает».
Второй вариант — слишком широкие правила. Например, директива Disallow: /*? закрывает все адреса с параметрами, а заодно и пагинацию каталога, если она сделана через параметр. Правила для robots.txt и карты сайта мы разбирали отдельно: robots.txt и sitemap.xml без ошибок.
Канонические адреса и дубли
Атрибут canonical подсказывает поисковику, какую версию страницы считать основной. Ошибки здесь коварны: шаблон может ставить canonical на главную для всех страниц или на первую страницу категории для всей пагинации. В результате поисковик послушно исключает всё, кроме указанного адреса.
Дубли возникают и без ошибок в canonical: одна страница доступна со слешем и без, с разными параметрами сортировки, через разные пути в каталоге. Робот тратит ресурсы на копии, а нужная версия может проиграть. Решение зависит от природы копии: где-то достаточно корректного canonical, где-то нужен 301-редирект, а иногда — закрытие параметров от обхода.
Ответы сервера
Страница должна отдавать код 200. Если сервер периодически отвечает 500 или 503, робот снижает частоту обхода, а нестабильные страницы могут вылететь из индекса. Отдельная история — «мягкие 404»: страница пустая или с текстом «ничего не найдено», но сервер отвечает 200. Поисковик распознаёт такие случаи и исключает их, а заодно тратит на них время.
Проблемы с JavaScript
Современные сайты часто собирают содержимое в браузере. Google умеет выполнять скрипты, но делает это с задержкой и не всегда полностью. Яндекс рендерит JavaScript заметно скромнее. Если в исходном HTML нет текста, заголовков и ссылок, а всё появляется только после выполнения скриптов, часть страниц может индексироваться с пустым содержимым или не индексироваться вовсе.
Проверка простая: откройте исходный код страницы (не инспектор, а именно исходный ответ сервера) и найдите в нём основной текст. Если его нет — стоит обсуждать серверный рендеринг или предварительную генерацию страниц.
Малополезные и похожие страницы
Даже технически идеальная страница может не попасть в поиск, если поисковик сочтёт её бесполезной. Типичные примеры: карточки товаров с одной фотографией и без описания, теги блога с двумя записями, страницы услуг, отличающиеся только названием района. В Вебмастере такие адреса обычно отмечены как «недостаточно качественные» или «малоценные».
Здесь помогает не техника, а работа с содержимым: объединить близкие страницы в одну сильную, дописать уникальную информацию, добавить характеристики, фотографии, ответы на вопросы. Если страница не нужна ни людям, ни поиску — честнее закрыть её от индексации самостоятельно.
Краулинговый бюджет: когда он действительно важен
Термин «краулинговый бюджет» любят упоминать к месту и не к месту. На деле для сайта услуг из 50–300 страниц он почти никогда не становится ограничением. Робот легко обходит такой объём.
Бюджет начинает играть роль на крупных проектах: интернет-магазинах с десятками тысяч карточек, агрегаторах, сайтах с фильтрами, которые порождают миллионы комбинаций адресов. Признаки проблемы:
- новые товары появляются в поиске через несколько недель;
- в логах сервера видно, что робот ходит в основном по параметрическим адресам;
- в индексе много служебных страниц, а важные категории обновляются редко.
Решение — сократить количество бессмысленных адресов: закрыть сортировки и технические параметры, настроить Clean-param для Яндекса, убрать бесконечные календари и сессии в URL, обновлять sitemap.xml только актуальными адресами.
Как ускорить индексацию новых страниц
Если с технической стороной всё в порядке, новые страницы можно «подтолкнуть» к роботу.
- Переобход в Вебмастере. В Яндекс Вебмастере есть инструмент «Переобход страниц» с дневным лимитом — отправляйте туда самые важные адреса сразу после публикации.
- Запрос индексации в Search Console. Инструмент проверки URL позволяет запросить сканирование конкретной страницы.
- Актуальный sitemap.xml. Карта сайта должна обновляться автоматически и содержать дату изменения страниц.
- Ссылки с сильных страниц. Ссылка с главной, из меню или из популярной статьи приводит робота быстрее, чем любая карта сайта.
- Протокол IndexNow. Его поддерживает Яндекс: сайт сам уведомляет поисковик об изменениях. Многие CMS умеют делать это через модуль.
При этом ускорение не заменяет качество. Если страница слабая, поисковик может её быстро просканировать — и так же быстро исключить.
Пошаговая диагностика: порядок действий
Когда страница не находится в поиске, мы проверяем её в таком порядке. Это экономит время: первые пункты занимают минуты, а последние требуют анализа.
- Проверить статус URL в Вебмастере и Search Console: знает ли поисковик об адресе и что он о нём думает.
- Убедиться, что сервер отвечает кодом 200, без редиректов и цепочек.
- Проверить robots.txt на предмет запрета этого адреса.
- Посмотреть код страницы: нет ли метатега noindex или заголовка X-Robots-Tag.
- Проверить canonical: указывает ли он на эту же страницу.
- Открыть исходный HTML и убедиться, что основной текст и ссылки присутствуют без выполнения скриптов.
- Проверить, есть ли на страницу внутренние ссылки и включена ли она в sitemap.xml.
- Сравнить содержимое с похожими страницами сайта: нет ли дублирования.
- Оценить полезность страницы глазами пользователя: отвечает ли она на запрос лучше конкурентов.
Если все пункты пройдены, а страницы по-прежнему нет, стоит подождать один-два цикла обхода и посмотреть, не изменится ли статус. Для молодых сайтов индексация иногда занимает несколько недель — это нормально.
Как не сломать индексацию при изменениях на сайте
Большая часть проблем возникает не сама по себе, а после каких-то работ: редизайна, переезда на новую CMS, смены структуры URL. Несколько правил, которые избавят от неприятных сюрпризов:
- перед запуском новой версии сравните robots.txt, метатеги и canonical со старой;
- при смене адресов настройте постраничные 301-редиректы, а не перенаправление всего на главную;
- после релиза в течение двух-трёх недель ежедневно смотрите отчёты об исключённых страницах;
- держите тестовую копию сайта закрытой паролем, а не только директивой robots.txt — так она точно не попадёт в поиск.
Если сайт уже пострадал после переезда или обновления, разбираться лучше комплексно. В рамках SEO-аудита мы проверяем индексацию всех разделов, сверяем данные краулера с отчётами поисковиков и выдаём список исправлений по приоритету, а внедрение берёт на себя команда технической оптимизации.
Выводы
Индексация — фундамент, без которого не работает ни текст, ни ссылки, ни дизайн. Чаще всего страницы не попадают в поиск по вполне конкретным и устранимым причинам.
- Начинайте с данных Яндекс Вебмастера и Google Search Console: они прямо называют причину исключения.
- Проверьте простое — robots.txt, noindex, canonical, коды ответа — прежде чем переписывать тексты.
- Убедитесь, что контент виден роботу без выполнения JavaScript.
- Не плодите дубли и малополезные страницы: лучше одна сильная страница, чем пять слабых.
- Любые крупные изменения на сайте сопровождайте проверкой индексации в первые недели после релиза.
Регулярный контроль индексации занимает несколько минут в неделю, а избавляет от месяцев потерянного трафика.
$ help --seo
Хотите применить это на своём сайте?
Посмотрим сайт и подскажем, какие шаги дадут результат быстрее всего. Разбор бесплатный.