Файл robots.txt: инструкция по настройке для SEO

Представьте, что вы пускаете гостей в свой дом, но просите не заходить в комнату, где идет ремонт. Файл robots.txt – это именно такая просьба, только адресована не людям, а поисковым системам. Он лежит в корне вашего сайта и тихо управляет тем, куда можно и нельзя ходить поисковым роботам.

Если его нет или он настроен неправильно, в индексацию могут попасть служебные папки, черновые страницы или даже админка. Результат? В выдаче Google или Яндекса появляется мусор, который портит впечатление о сайте и отвлекает от главного. Давайте научимся писать четкие инструкции для роботов.

Создаем каркас файла: две ключевые директивы

Файл состоит из правил – директив. Основных две: User-agent и Disallow. Первая указывает, какому именно роботу мы даем указание. Звездочка () означает «всем». Вторая – что запрещаем.

Например, чтобы закрыть от всех роботов папку /admin/, запись будет выглядеть так:

User-agent:
Disallow: /admin/

Что это дает на практике? Робот Googlebot, придя на сайт, первым делом прочтет этот файл, увидит запрет и не станет переходить по ссылкам из этой папки. Вы сэкономите краулинговый бюджет (лимит страниц, которые робот обходит за визит) и защитите служебную область от посторонних глаз.

Тонкая настройка: разрешения, задержки и карта сайта

Иногда нужно не просто запретить, а сделать исключение внутри закрытой зоны. Для этого используют директиву Allow. Допустим, в папке /tmp/ лежат черновые файлы, но один документ – готовый прайс-лист – нужно проиндексировать. Пишем:

User-agent: *
Disallow: /tmp/
Allow: /tmp/price.pdf

Важно: порядок имеет значение. Роботы читают правила сверху вниз и применяют первое подходящее.

Если ваш сайт сильно нагружен или вы хотите уменьшить нагрузку от частых визитов роботов, поможет Crawl-delay. Эта директива просит робота делать паузу между загрузкой страниц. Для Яндекса это особенно актуально: User-agent: Yandex
Crawl-delay: 2 – означает задержку в 2 секунды.

И не забудьте указать путь к Sitemap. Это не обязательное, но очень полезное правило, которое помогает роботам быстрее находить все важные страницы. Просто добавьте в конец файла строку: Sitemap: https://ваш-сайт.ru/sitemap.xml.

Частые ошибки и как их избежать

Главная ошибка – полный запрет доступа ко всему сайту случайно. Строка Disallow: / с User-agent: * действительно скажет всем поисковикам уйти и забыть дорогу к вам. Сайт выпадет из поиска.

Вторая проблема – синтаксические ошибки. Лишние пробелы после двоеточия, неправильные символы в пути. Робот не поймет вашу инструкцию и может проигнорировать ее. Пишите точно.

Проверить конфигурацию просто. В Google Search Console и «Яндекс.Вебмастере» есть инструменты тестирования файла robots.txt. Они покажут, как его видит конкретный робот, и предупредят о потенциальных проблемах с индексацией. Потратьте пять минут на проверку – это убережет от месяцев недопонимания с поисковиками.

  • Файл должен лежать по адресу вашсайт.ru/robots.txt.
  • Начинайте с правила для всех роботов (User-agent: *).
  • Четко перечислите директории и файлы, которые не нужны в поиске (системные, служебные, дубли страниц).
  • Используйте Allow для точечных исключений.
  • Укажите Sitemap.
  • После настройки проверьте файл в инструментах для веб-мастеров.

Правильный robots.txt – это не технический рудимент, а часть SEO-стратегии. Он направляет внимание поисковых систем на ваш лучший контент, скрывая технический бэкграунд. Сделайте его своим союзником.

➤