Поисковый робот (краулер, паук) — программа, которая ходит по ссылкам, скачивает страницы и передаёт их на обработку. У Яндекса это YandexBot, у Google — Googlebot; каждый представляется в заголовке User-Agent.
Цикл выглядит так: робот берёт адрес из очереди → загружает страницу → рендерит её (выполняет JavaScript) → извлекает текст и ссылки → добавляет новые адреса в очередь → передаёт содержимое в индекс. Между обходом и появлением в выдаче проходит от нескольких часов до нескольких недель.
Краулинговый бюджет
Робот не может обходить сайт бесконечно — он тратит и свои ресурсы, и ваш сервер. Количество страниц, которое он готов загрузить за визит, называют краулинговым бюджетом. Он зависит от:
- скорости ответа сервера — чем быстрее отдаются страницы, тем больше их успевают загрузить (TTFB);
- авторитетности сайта — популярные ресурсы обходят чаще;
- частоты обновлений — сайт, который меняется каждый день, посещают чаще, чем неизменную визитку;
- числа ошибок — битые ссылки и 5xx тратят бюджет впустую.
Сайту на двадцать страниц об этом думать не нужно: их обойдут целиком при любом бюджете. Проблема начинается на интернет-магазинах и каталогах с десятками тысяч адресов, где робот успевает обойти лишь часть.
Куда утекает бюджет
- Фильтры и сортировки. Комбинации параметров
?color=red&size=xl&sort=priceпорождают тысячи адресов с почти одинаковым содержимым. - Пагинация без ограничений — сотни страниц списка, глубже десятой из которых ничего полезного нет.
- Дубли: один товар доступен по нескольким адресам через разные категории.
- Цепочки редиректов — робот тратит по запросу на каждое звено (подробнее).
- Мусорные адреса, которые отвечают 200 вместо 404 (soft-404).
Что с этим делать
- Закрыть в robots.txt служебные разделы и бесполезные комбинации параметров.
- Свести дубли к одному адресу через rel=canonical.
- Держать актуальную карту сайта с честными датами
lastmod— робот пойдёт в первую очередь туда, где что-то изменилось. - Ускорить сервер и убрать битые ссылки.
- Выстроить внутреннюю перелинковку так, чтобы до любой важной страницы было не больше трёх переходов от главной.
Проверка на своём сайте
Яндекс Вебмастер → «Индексирование → Статистика обхода» и Google Search Console → «Настройки → Статистика сканирования» показывают, сколько страниц робот загружает в день, какие коды ответа получает и сколько времени ждёт сервер. Если в отчёте много 4xx и 5xx или среднее время ответа исчисляется секундами — бюджет расходуется зря.
Наш аудит и обход
Инструмент «Кверху» обходит выборку внутренних страниц — этого достаточно, чтобы поймать системные проблемы: одинаковые Title, недоступные разделы, ошибки шаблона. Для полного обхода большого каталога нужны специализированные краулеры (Screaming Frog, Netpeak Spider) — они гоняют сайт целиком и строят карту всех адресов.