Представьте, что вы пускаете гостей в свой дом, но просите не заходить в комнату, где идет ремонт. Файл robots.txt – это именно такая просьба, только адресована не людям, а поисковым системам. Он лежит в корне вашего сайта и тихо управляет тем, куда можно и нельзя ходить поисковым роботам.
Если его нет или он настроен неправильно, в индексацию могут попасть служебные папки, черновые страницы или даже админка. Результат? В выдаче Google или Яндекса появляется мусор, который портит впечатление о сайте и отвлекает от главного. Давайте научимся писать четкие инструкции для роботов.

Создаем каркас файла: две ключевые директивы
Файл состоит из правил – директив. Основных две: User-agent и Disallow. Первая указывает, какому именно роботу мы даем указание. Звездочка () означает «всем». Вторая – что запрещаем.
Например, чтобы закрыть от всех роботов папку /admin/, запись будет выглядеть так:
User-agent:
Disallow: /admin/
Что это дает на практике? Робот Googlebot, придя на сайт, первым делом прочтет этот файл, увидит запрет и не станет переходить по ссылкам из этой папки. Вы сэкономите краулинговый бюджет (лимит страниц, которые робот обходит за визит) и защитите служебную область от посторонних глаз.
Тонкая настройка: разрешения, задержки и карта сайта
Иногда нужно не просто запретить, а сделать исключение внутри закрытой зоны. Для этого используют директиву Allow. Допустим, в папке /tmp/ лежат черновые файлы, но один документ – готовый прайс-лист – нужно проиндексировать. Пишем:
User-agent: *
Disallow: /tmp/
Allow: /tmp/price.pdf
Важно: порядок имеет значение. Роботы читают правила сверху вниз и применяют первое подходящее.
Если ваш сайт сильно нагружен или вы хотите уменьшить нагрузку от частых визитов роботов, поможет Crawl-delay. Эта директива просит робота делать паузу между загрузкой страниц. Для Яндекса это особенно актуально: User-agent: Yandex
Crawl-delay: 2 – означает задержку в 2 секунды.
И не забудьте указать путь к Sitemap. Это не обязательное, но очень полезное правило, которое помогает роботам быстрее находить все важные страницы. Просто добавьте в конец файла строку: Sitemap: https://ваш-сайт.ru/sitemap.xml.
Частые ошибки и как их избежать
Главная ошибка – полный запрет доступа ко всему сайту случайно. Строка Disallow: / с User-agent: * действительно скажет всем поисковикам уйти и забыть дорогу к вам. Сайт выпадет из поиска.
Вторая проблема – синтаксические ошибки. Лишние пробелы после двоеточия, неправильные символы в пути. Робот не поймет вашу инструкцию и может проигнорировать ее. Пишите точно.
Проверить конфигурацию просто. В Google Search Console и «Яндекс.Вебмастере» есть инструменты тестирования файла robots.txt. Они покажут, как его видит конкретный робот, и предупредят о потенциальных проблемах с индексацией. Потратьте пять минут на проверку – это убережет от месяцев недопонимания с поисковиками.
- Файл должен лежать по адресу вашсайт.ru/robots.txt.
- Начинайте с правила для всех роботов (User-agent: *).
- Четко перечислите директории и файлы, которые не нужны в поиске (системные, служебные, дубли страниц).
- Используйте Allow для точечных исключений.
- Укажите Sitemap.
- После настройки проверьте файл в инструментах для веб-мастеров.
Правильный robots.txt – это не технический рудимент, а часть SEO-стратегии. Он направляет внимание поисковых систем на ваш лучший контент, скрывая технический бэкграунд. Сделайте его своим союзником.