Краулинг сайта
Что такое краулинг сайта?
Краулинг сайта — это непрерывный процесс автоматического обхода веб-страниц поисковым роботом (краулером), который следует по гиперссылкам для обнаружения новых, изменённых или удалённых документов с целью их последующей передачи на индексацию.
Индустриальный ориентир 2026 года: для интернет-магазина с 10 000 товарных позиций полный переобход карточек товаров краулером Google должен выполняться не реже одного раза в 48 часов. Задержка переобхода сверх 72 часов приводит к тому, что более 5 % цен и статусов наличия в поисковом индексе расходятся с реальной витриной, вызывая падение конверсии из органического трафика в среднем на 7–10 %.
Как это работает?
Поисковый робот загружает список исходных URL из собственной базы и карт сайта (sitemap.xml), скачивает содержимое страницы по протоколу HTTP и извлекает из HTML все исходящие ссылки для пополнения очереди обхода.
Перед загрузкой робот проверяет директивы файла robots.txt и мета-теги noindex/nofollow, задающие разрешения на сканирование. Фактическая скорость и глубина обхода регулируются алгоритмом, учитывающим авторитетность страницы, частоту её обновления и ограничения краулингового бюджета, выделяемого каждому сайту.
Сервер должен ответить роботу с приемлемой скоростью и без ошибок: стабильный HTTP-статус 2xx, минимальное время до первого байта и отсутствие блокировок по IP-адресу. Иначе робот замедлит частоту заходов.
Метрики и стандарты
- Краулинговый бюджет: количество URL, которые робот готов обойти на сайте за сутки. Для проекта с 50 000 страниц стандартом является расходование бюджета только на канонические, индексируемые URL, чтобы обеспечить еженедельный полный переобход ключевого каталога.
- Время ответа для краулера (TTFB): целевое значение — не более 600 мс на динамических страницах и до 200 мс на статических. Превышение порога в 1000 мс приводит к снижению скорости обхода и урежает визиты робота.
- Доля ошибок при сканировании: количество ответов сервера с кодами 5xx или 404 не должно превышать 1 % от общего числа запросов робота. Уровень ошибок выше 3 % сигнализирует о проблемах хостинга или структуры, вызывая урезание бюджета.
- Оптимальная частота обхода товаров: для активно торгующих магазинов Googlebot должен переобходить карточки товаров каждые 24–48 часов. Более редкие заходы напрямую снижают CTR, так как пользователь видит неактуальную цену или товар «в наличии».
Почему это важно для бизнеса?
Краулинг — обязательный шлюз к индексации: страница, не обнаруженная роботом, никогда не появится в результатах поиска и не принесёт органический трафик, каким бы качественным ни был её контент.
Быстрый и полный обход гарантирует, что акционные цены, новые поступления и сезонные предложения попадают в индекс одновременно со стартом рекламной кампании, максимизируя охват и продажи.
Медленный или неполный краулинг напрямую обесценивает работу маркетинга: рекламные бюджеты расходуются на продвижение страниц, которых ещё нет в выдаче, а посетители видят устаревшие цены, что увеличивает отказы и возвраты.
Пример применения
Интернет-магазин зоотоваров расширил ассортимент до 15 000 SKU и заметил, что карточки новых товаров появляются в поиске только через 5–7 дней, а цены на ходовые корма обновляются реже раза в неделю.
Аудит показал, что время ответа сервера для бота превышало 1,2 секунды, а robots.txt содержал избыточные правила запрета, замедляющие очередь. После перехода на быстрый хостинг с LiteSpeed и Redis, удаления устаревших запретов и ручной отправки свежих URL на проверку через Google Search Console интервал обхода сократился до 24–36 часов. Через месяц органический трафик на новые товары вырос на 34 %, а количество отказов из-за несовпадения цен упало до нуля.
Как это реализуется в WordPress?
Управление краулингом начинается с настройки файла robots.txt: плагины Rank Math, Yoast SEO и WP Rocket предоставляют визуальный редактор, где закрываются от обхода служебные разделы /wp-admin, /wp-includes, а также параметры сортировки и пагинации.
XML-карты сайта, автоматически генерируемые этими же SEO-плагинами, задают приоритеты обхода: высокая частота для товаров, средняя — для категорий, низкая — для архивных страниц. Карту необходимо вручную отправить в Google Search Console для ускорения первоначального краулинга.
Техническая оптимизация серверного ответа для ботов достигается через кеширование страниц плагинами LiteSpeed Cache или WP Rocket с исключением сессионных кук и параметров utm_* из ключа кеша. Это гарантирует время ответа до 200 мс даже для неавторизованных запросов робота.
Ускорение индексации критически важных страниц выполняется через Instant Indexing API (Rank Math PRO), который мгновенно оповещает Google о публикации или обновлении URL, минуя естественную очередь краулера.
Мониторинг активности робота ведётся в Google Search Console в разделе «Статистика сканирования»: отслеживают общее количество запросов, среднее время ответа и долю ошибок. Падение числа сканируемых страниц в сутки служит ранним сигналом проблем с хостингом или структурой.
Связанные понятия
- Индексация — следующий за краулингом этап анализа и добавления содержимого страницы в поисковую базу данных, без которого страница не может участвовать в выдаче.
- Поисковый робот (краулер,Googlebot) — программа, систематически обходящая веб по ссылкам для сбора информации о страницах.
- Краулинговый бюджет (Crawl Budget) — лимит страниц, которые поисковая система готова просканировать на сайте за определённый промежуток времени.
- Robots.txt — текстовый файл в корне сайта, предписывающий роботам, какие разделы можно или нельзя сканировать.
- ФайлыSitemap — структурированные XML-файлы, помогающие роботу быстрее находить все важные страницы и понимать их приоритет и дату последнего изменения.
