Индексация и обход 2 мин чтения

Поисковые роботы и краулинговый бюджет

Как поисковик обходит сайт, откуда берётся ограничение на число страниц за визит и почему на большом сайте это становится проблемой.

Поисковый робот (краулер, паук) — программа, которая ходит по ссылкам, скачивает страницы и передаёт их на обработку. У Яндекса это YandexBot, у Google — Googlebot; каждый представляется в заголовке User-Agent.

Цикл выглядит так: робот берёт адрес из очереди → загружает страницу → рендерит её (выполняет JavaScript) → извлекает текст и ссылки → добавляет новые адреса в очередь → передаёт содержимое в индекс. Между обходом и появлением в выдаче проходит от нескольких часов до нескольких недель.

Краулинговый бюджет

Робот не может обходить сайт бесконечно — он тратит и свои ресурсы, и ваш сервер. Количество страниц, которое он готов загрузить за визит, называют краулинговым бюджетом. Он зависит от:

  • скорости ответа сервера — чем быстрее отдаются страницы, тем больше их успевают загрузить (TTFB);
  • авторитетности сайта — популярные ресурсы обходят чаще;
  • частоты обновлений — сайт, который меняется каждый день, посещают чаще, чем неизменную визитку;
  • числа ошибокбитые ссылки и 5xx тратят бюджет впустую.

Сайту на двадцать страниц об этом думать не нужно: их обойдут целиком при любом бюджете. Проблема начинается на интернет-магазинах и каталогах с десятками тысяч адресов, где робот успевает обойти лишь часть.

Куда утекает бюджет

  • Фильтры и сортировки. Комбинации параметров ?color=red&size=xl&sort=price порождают тысячи адресов с почти одинаковым содержимым.
  • Пагинация без ограничений — сотни страниц списка, глубже десятой из которых ничего полезного нет.
  • Дубли: один товар доступен по нескольким адресам через разные категории.
  • Цепочки редиректов — робот тратит по запросу на каждое звено (подробнее).
  • Мусорные адреса, которые отвечают 200 вместо 404 (soft-404).

Что с этим делать

  1. Закрыть в robots.txt служебные разделы и бесполезные комбинации параметров.
  2. Свести дубли к одному адресу через rel=canonical.
  3. Держать актуальную карту сайта с честными датами lastmod — робот пойдёт в первую очередь туда, где что-то изменилось.
  4. Ускорить сервер и убрать битые ссылки.
  5. Выстроить внутреннюю перелинковку так, чтобы до любой важной страницы было не больше трёх переходов от главной.

Проверка на своём сайте

Яндекс Вебмастер → «Индексирование → Статистика обхода» и Google Search Console → «Настройки → Статистика сканирования» показывают, сколько страниц робот загружает в день, какие коды ответа получает и сколько времени ждёт сервер. Если в отчёте много 4xx и 5xx или среднее время ответа исчисляется секундами — бюджет расходуется зря.

Наш аудит и обход

Инструмент «Кверху» обходит выборку внутренних страниц — этого достаточно, чтобы поймать системные проблемы: одинаковые Title, недоступные разделы, ошибки шаблона. Для полного обхода большого каталога нужны специализированные краулеры (Screaming Frog, Netpeak Spider) — они гоняют сайт целиком и строят карту всех адресов.

А что с этим на вашем сайте?

Аудит «Кверху» проверяет этот пункт вместе с остальными пятьюдесятью и показывает конкретику: какие страницы затронуты и что именно исправить. Первая полная проверка проекта — бесплатно.

Проверить сайт бесплатно