Robots.txt

Что такое Robots.txt?

Robots.txt — это текстовый файл, размещаемый в корневом каталоге сайта, который содержит директивы для поисковых роботов и других автоматических краулеров, указывая, какие разделы и страницы им разрешено или запрещено сканировать в рамках отведённого краулингового бюджета.

По данным аудитов Google Search Console за 2026 год, некорректно настроенный robots.txt, блокирующий сканирование критически важных страниц, приводит к исключению из индекса в среднем 30% целевого контента сайта, что напрямую сокращает потенциальный органический трафик на ту же величину, а восстановление индексации после исправления занимает от 2 до 6 недель.

Как это работает?

Когда поисковый робот (Googlebot, Bingbot, Яндекс.Бот) заходит на сайт, он первым делом запрашивает файл /robots.txt. Если файл существует и доступен, робот анализирует его содержимое, соблюдая указанные правила. Директива User-agent определяет, к какому конкретному роботу относятся последующие инструкции, Disallow перечисляет запрещённые к сканированию пути, а Allow — исключения из запретов для вложенных поддиректорий.

Файл также может содержать директиву Sitemap, указывающую полный URL XML-карты сайта, что ускоряет её обнаружение. Важно: robots.txt управляет именно сканированием, но не индексацией. Страница, закрытая от сканирования, не будет загружена роботом, однако, если на неё ведут внешние ссылки, она всё равно может попасть в индекс с пустым или урезанным описанием. Для полного запрета индексации используется метатег noindex.

Метрики и стандарты

Главный KPI корректности robots.txt — отсутствие в отчёте Google Search Console «Покрытие» страниц, заблокированных файлом robots.txt, но присутствующих в карте сайта или важных для бизнеса. Норматив: ноль критически важных URL должны иметь статус «Заблокировано robots.txt».

Сам файл обязан находиться строго в корне домена, быть доступным по URL https://site.ru/robots.txt и отдавать HTTP-статус 200. Его размер не должен превышать 500 КБ, иначе роботы могут проигнорировать часть директив. Синтаксис файла чувствителен к регистру, пробелам и пустым строкам; каждая директива Disallow должна указывать относительный путь от корня. Аудит корректности выполняется инструментами Google Search Console (тестер robots.txt), Screaming Frog и Яндекс.Вебмастер.

Почему это важно для бизнеса?

Robots.txt служит первым инструментом контроля над тем, как поисковые системы взаимодействуют с сайтом. Ошибка в одной строке способна скрыть от индекса весь каталог товаров или важные посадочные страницы, мгновенно обрушив органический трафик и заявки. Напротив, отсутствие запретов на служебные разделы (админку, корзину, результаты поиска) приводит к захламлению индекса дублями и нецелевому расходованию краулингового бюджета.

Грамотная настройка robots.txt фокусирует внимание роботов на коммерчески значимом контенте, ускоряет индексацию новых товаров и статей, а также защищает от утечки в индекс конфиденциальных или бесполезных страниц. Это напрямую повышает видимость сайта в поиске и снижает стоимость привлечения клиента.

Пример применения

Интернет-магазин электроники после смены SEO-специалиста обнаружил, что трафик на раздел смартфонов упал до нуля. Анализ показал, что в robots.txt была добавлена директива Disallow: /smartfony/, ошибочно закрывающая всю категорию от сканирования. После удаления этой строки и повторной отправки страниц на индексацию через Search Console трафик восстановился в течение трёх недель, но потери выручки за этот период составили 1,2 млн рублей.

Как это реализуется в WordPress?

По умолчанию WordPress автоматически генерирует виртуальный файл robots.txt, который разрешает индексацию всего сайта, кроме /wp-admin/ и /wp-includes/. Редактирование этого файла осуществляется через SEO-плагины: Rank Math SEO и Yoast SEO предоставляют визуальный редактор robots.txt прямо в админ-панели, позволяя добавлять кастомные директивы без доступа к серверу.

Для сайтов, требующих точной серверной конфигурации, физический файл robots.txt можно разместить вручную в корневой директории WordPress. При этом плагины кеширования (WP Rocket, LiteSpeed Cache) должны исключать этот файл из обработки, отдавая его напрямую. Проверка корректности выполняется встроенными тестерами SEO-плагинов или через Google Search Console, а мониторинг сканирования — через Site Kit и Яндекс.Вебмастер.

Связанные понятия

  • Краулинговый бюджет (Crawl Budget) — ресурс, который robots.txt помогает направить на приоритетный контент.
  • Индексация сайта — процесс включения страниц в поисковую базу, зависящий от разрешений robots.txt на сканирование.
  • XML-карта сайта (XML Sitemap) — файл, URL которого обычно указывается в robots.txt для ускорения обнаружения.
  • Метатегrobots (noindex,nofollow) — HTML-директива, дополняющая robots.txt для полного запрета индексации.
  • ДирективаDisallow — основная команда в robots.txt, запрещающая роботам доступ к указанным разделам.
  • Googlebot — поисковый робот Google, поведением которого управляют в том числе инструкции в robots.txt.