Индексация и обход 2 мин чтения

robots.txt — как управлять обходом сайта

Текстовый файл в корне сайта, который говорит роботам, куда ходить можно, а куда не нужно. Синтаксис, примеры и типичные ошибки.

robots.txt — обычный текстовый файл, который лежит по адресу https://ваш-сайт.ру/robots.txt. Это первое, что запрашивает поисковый робот, придя на сайт. В файле написано, какие разделы обходить не нужно и где искать карту сайта.

Как он устроен

User-agent: *
Disallow: /admin/
Disallow: /cart
Disallow: /*?sort=
Allow: /admin/public-info

Sitemap: https://example.ru/sitemap.xml
  • User-agent — для какого робота правило. * — для всех, Yandex — для Яндекса, Googlebot — для Google.
  • Disallow — что не обходить.
  • Allow — исключение из запрета; более длинное правило побеждает более короткое.
  • Sitemap — полный адрес карты сайта, отдельной строкой, вне блоков User-agent.
  • * заменяет любую последовательность символов, $ означает конец адреса.

Пустое значение Disallow: означает «не запрещаю ничего».

Что закрывать имеет смысл

Служебные разделы: админку, корзину, оформление заказа, личный кабинет, страницы результатов внутреннего поиска, технические скрипты. Всё это не должно занимать время робота и место в индексе.

Что закрывать не нужно

CSS и JavaScript. Робот рендерит страницу так же, как браузер. Если стили и скрипты закрыты, он увидит нечто нечитаемое и может решить, что сайт неудобен на мобильных.

Изображения, если вы хотите трафик из поиска по картинкам.

Главная ловушка

robots.txt управляет обходом, а не показом в выдаче. Закрытая здесь страница всё равно может попасть в результаты поиска — по внешним ссылкам, с пустым описанием вида «Информация об этой странице недоступна». А запрет обхода мешает роботу увидеть noindex внутри страницы, если он там есть.

Правило простое: нужно убрать страницу из выдачи — используйте noindex и оставляйте её открытой для обхода. Нужно сэкономить ресурсы робота на служебных разделах — используйте robots.txt.

Второе, что важно помнить: файл не защищает от людей. Всё перечисленное в нём видно любому, кто откроет /robots.txt. Не указывайте там адреса закрытых разделов, которые не должны быть известны.

Как проверить

  • В отчёте аудита — пункт «robots.txt».
  • Откройте https://ваш-сайт.ру/robots.txt в браузере. Файл должен отдаваться с кодом 200 и типом text/plain.
  • Яндекс Вебмастер → «Инструменты → Анализ robots.txt»: покажет ошибки и проверит конкретный адрес.

Как исправить, если файла нет

Создайте его в корне сайта. Минимальный рабочий вариант для сайта, который весь должен быть в поиске:

User-agent: *
Disallow:

Sitemap: https://example.ru/sitemap.xml

Отсутствие файла не катастрофа — сайт всё равно обойдут. Но это упущенная возможность: и указать карту сайта, и убрать из обхода служебные разделы.

Отдельно проверьте, что там нет Disallow: / — одна эта строка закрывает сайт целиком.

А что с этим на вашем сайте?

Аудит «Кверху» проверяет этот пункт вместе с остальными пятьюдесятью и показывает конкретику: какие страницы затронуты и что именно исправить. Первая полная проверка проекта — бесплатно.

Проверить сайт бесплатно