Как правильно составить и проверить robots.txt для Яндекс и Google. Пошаговое руководство: синтаксис директив, правила для разных роботов, частые ошибки (Disallow: /, закрытый sitemap), оптимизация краулингового бюджета и онлайн-инструменты для валидации
Введение: один файл, который может убить ваш трафик
Представьте: вы просыпаетесь утром, открываете статистику — трафик упал до нуля. Паника. Проверяете сайт — работает. Проверяете контент — на месте. Открываете Яндекс.Вебмастер — все страницы исключены. Причина? В файле robots.txt кто-то написал Disallow: / и закрыл весь сайт от индексации. Это не страшилка. По данным исследования Ahrefs за 2025 год, 7% сайтов в зоне .RU имеют критические ошибки в robots.txt, которые блокируют индексацию важных страниц. А 3% вообще закрывают весь сайт, сами того не зная.
Robots.txt — крошечный текстовый файл в корне сайта, но его влияние на SEO колоссально. Это первое, что читает поисковый робот при заходе на сайт. Одна опечатка — и сотни страниц выпадают из поиска. Одно неправильное правило — и краулинговый бюджет расходуется на мусор вместо полезного контента. При этом многие веб-мастера относятся к robots.txt как к «чему-то техническому, что настраивается один раз и забывается». В 2026 году, когда алгоритмы Яндекса и Google стали чувствительнее к структуре сайта, такой подход смертелен.
В этом руководстве — всё, что нужно знать о robots.txt: от базового синтаксиса до продвинутой оптимизации краулингового бюджета для крупных сайтов. С конкретными примерами для WordPress, Битрикс, интернет-магазинов и онлайн-инструментами для проверки.
Что такое robots.txt и как он работает
Robots.txt — это текстовый файл в кодировке UTF-8, который должен находиться в корне сайта по адресу https://вашсайт.ru/robots.txt. Он содержит инструкции для поисковых роботов: какие страницы можно сканировать, а какие — нет.
Ключевой принцип: robots.txt — это рекомендация, а не приказ. Добросовестные поисковые роботы (Яндекс, Google, Bing) соблюдают правила. Вредоносные боты — игнорируют. Поэтому robots.txt не защищает от парсинга или взлома — для этого нужны другие методы.
Что robots.txt НЕ делает:
Не гарантирует исключение страницы из индекса (если на страницу есть внешние ссылки, она может попасть в индекс, но без содержимого). Не защищает конфиденциальные данные (для этого используйте авторизацию). Не заменяет noindex (для гарантированного исключения страницы из индекса нужен мета-тег noindex).
Что robots.txt ДЕЛАЕТ:
Указывает, какие разделы можно сканировать. Помогает экономить краулинговый бюджет. Задаёт расположение sitemap.xml. Указывает основное зеркало сайта (для Яндекса — директива Host).
Синтаксис robots.txt: полный разбор директив
Основные директивы
User-agent: — указывает, для какого робота предназначены правила ниже. Может быть конкретным (YandexBot, Googlebot) или универсальным (* — для всех роботов).
Disallow: — запрещает сканирование указанного пути. Самый важный параметр. Поддержка масок: * (любая последовательность символов) и $ (конец строки).
Allow: — разрешает сканирование, даже если путь подпадает под Disallow. Используется для исключений. Важно: в Яндексе порядок директив неважен (работает наиболее точное правило), в Google — важен порядок (работает первое подходящее правило).
Sitemap: — указывает путь к файлу sitemap.xml. Поддерживается всеми поисковиками. Можно указать несколько sitemap-файлов.
Crawl-delay: — минимальная задержка между запросами робота в секундах. Поддерживается Яндексом, Bing, но НЕ Google (Google использует настройки в Search Console).
Clean-param: — директива Яндекса. Указывает, какие параметры URL не влияют на содержимое страницы. Помогает бороться с дублями. Синтаксис: Clean-param: param1¶m2 /path/.
Host: — директива Яндекса (устаревшая, но до сих пор работающая для определения главного зеркала). Указывает основной домен с протоколом: Host: https://vashsite.ru.
Пример простого, но правильного robots.txt:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/
Disallow: /ajax/
Disallow: /?
Allow: /
Sitemap: https://vashsite.ru/sitemap.xml
User-agent: YandexBot
Clean-param: utm_source&utm_medium&utm_campaign /
Host: https://vashsite.ru
Правила для разных поисковых систем
Яндекс
Поддерживает все базовые директивы. Есть уникальные: Clean-param, Host. Порядок директив неважен — работает правило с наиболее точным путём. Crawl-delay поддерживается (рекомендуется 2.0 для слабых серверов).
Поддерживает не все директивы Яндекса (Clean-param — НЕТ, Host — НЕТ). Порядок директив ВАЖЕН: первое совпадение определяет правило. Crawl-delay НЕ поддерживает (управление через Google Search Console). Понимает расширенный синтаксис: *, $. Лимит размера файла: 500 КБ (Яндекс — без строгого лимита, но рекомендует до 100 КБ).
Как совместить в одном файле:
Общие правила — в секцию User-agent: *. Специфичные для Яндекса — в отдельную секцию User-agent: YandexBot. Специфичные для Google — в отдельную секцию User-agent: Googlebot.
Как составить robots.txt для разных типов сайтов
Интернет-магазин
Что нужно закрыть: корзину (/cart/), личный кабинет (/account/, /profile/), результаты поиска по сайту (/search/), фильтры и сортировки (/? или через Clean-param), AJAX-обработчики (/ajax/), страницы сравнения товаров (/compare/), избранное (/wishlist/).
Что НЕЛЬЗЯ закрывать: категории и подкатегории, карточки товаров, главную страницу, блог и статьи, страницы доставки, оплаты, контактов.
Пример для интернет-магазина:
User-agent: *
Disallow: /cart/
Disallow: /account/
Disallow: /search/
Disallow: /ajax/
Disallow: /compare/
Disallow: /wishlist/
Disallow: /*?
Allow: /
Sitemap: https://shop.ru/sitemap.xml
User-agent: YandexBot
Clean-param: sort&order&filter&color&size /
Host: https://shop.ru
Блог / Контентный сайт
Что нужно закрыть: админку (/wp-admin/, /administrator/), страницы входа (/login/, /wp-login.php), служебные страницы (/feed/, /trackback/), черновики и превью (/?p=&preview=).
Что можно закрыть (опционально): страницы пагинации (/page/*) — зависит от стратегии, архивы тегов (/tag/) — если они дублируют контент, архивы авторов (/author/) — если один автор.
Пример для WordPress:
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-login.php
Disallow: /wp-content/plugins/
Disallow: /feed/
Disallow: /trackback/
Disallow: /*?replytocom=
Allow: /wp-content/uploads/
Allow: /
Sitemap: https://blog.ru/sitemap.xml
Корпоративный сайт / Лендинг
Часто самый простой вариант — закрывать почти нечего.
User-agent: *
Disallow: /admin/
Disallow: /cgi-bin/
Allow: /
Sitemap: https://corp.ru/sitemap.xml
User-agent: YandexBot
Host: https://corp.ru
Частые ошибки в robots.txt и как их найти
Ошибка 1: Disallow: / (закрыт весь сайт). Как выглядит: User-agent: * с Disallow: /. Результат: катастрофа. Ни одна страница не сканируется. Трафик падает до нуля за 1-2 недели. Как проверить: откройте https://vashsite.ru/robots.txt. Если видите Disallow: / без Allow: ниже — срочно исправляйте.
Ошибка 2: Закрыт sitemap.xml. Как выглядит: Disallow: /*.xml$ или sitemap.xml находится в папке, закрытой через Disallow. Результат: робот не может прочитать sitemap. Индексация новых страниц замедляется. Как проверить: откройте sitemap в браузере. Проверьте в Яндекс.Вебмастер и Google Search Console — принимается ли файл.
Ошибка 3: Закрыты CSS и JS файлы. Как выглядит: Disallow: /wp-content/ (без Allow для uploads, themes, plugins). Результат: Googlebot не видит стили и скрипты, рендеринг страницы ломается. Google может понизить сайт в мобильной выдаче. Исправление: Disallow: /wp-content/plugins/ с Allow: /wp-content/uploads/ и Allow: /wp-content/themes/.
Ошибка 4: Неправильный синтаксис. Примеры ошибок: Disallow: https://site.ru/page/ — нельзя указывать полный URL, только путь /page/. Disallow: /page — закроет и /page, и /page-contact, и /pages, нужен слеш в конце /page/. User-agent: Google — неправильно, правильно: Googlebot.
Ошибка 5: Отсутствие sitemap. В robots.txt не указан путь к sitemap.xml. Робот найдёт его и так (если файл в корне), но явное указание ускоряет обнаружение.
Ошибка 6: Пустой robots.txt. Файл существует, но не содержит правил (или только комментарии). Это не ошибка само по себе (означает «всё разрешено»), но часто говорит о том, что про файл забыли.
Как проверить robots.txt онлайн
Ручная проверка через браузер — только первый шаг. Нужна полноценная валидация.
Инструмент 1: Яндекс.Вебмастер. Встроенный анализатор robots.txt. Показывает синтаксические ошибки, предупреждения, проверяет доступность sitemap. Позволяет проверить, доступна ли конкретная страница для робота Яндекса.
Инструмент 2: Google Search Console. Устаревший инструмент проверки robots.txt (был удалён из интерфейса). Сейчас — только в отчётах о покрытии: если страницы заблокированы robots.txt, они появятся в разделе исключённых.
Инструмент 3: Онлайн SEO-аудиторы. Комплексные инструменты (SerpMax и аналоги) проверяют robots.txt в рамках общего аудита сайта: наличие файла, синтаксические ошибки, закрытые важные разделы, доступность sitemap.
Оптимизация краулингового бюджета через robots.txt
Краулинговый бюджет — это количество страниц, которое робот готов сканировать на вашем сайте за один заход. У маленьких сайтов (до 1000 страниц) проблем с бюджетом обычно нет. У крупных (10 000+ страниц) — робот может не успевать обходить всё.
Как robots.txt помогает экономить бюджет: закрывайте от сканирования страницы, не несущие SEO-ценности (фильтры, сортировки, пагинация, внутренний поиск), закрывайте служебные URL (AJAX, API, админка), используйте Clean-param (Яндекс) и настройки параметров URL в Google Search Console.
Что нельзя закрывать для экономии бюджета: важные страницы каталога, карточки товаров, статьи блога, категории и подкатегории.
Частые вопросы (FAQ)
Обязателен ли robots.txt для сайта? Нет, отсутствие robots.txt означает «всё разрешено». Но лучше иметь файл: это хороший тон, помогает управлять краулингом и указывает путь к sitemap.
Как часто обновляется robots.txt поисковыми системами? Яндекс проверяет robots.txt при каждом заходе на сайт, но кеширует на несколько часов. Google — обычно в течение 24 часов. После изменений отправьте файл на перепроверку через панели вебмастеров.
Можно ли закрыть страницу от индексации только через robots.txt? Да, но это не 100% гарантия. Если на страницу ведут внешние ссылки, она может появиться в индексе (без описания и с пометкой «Описание недоступно из-за ограничений в robots.txt»). Для гарантированного исключения используйте noindex в HTML или HTTP-заголовок X-Robots-Tag.
Как проверить, закрыта ли конкретная страница в robots.txt? Используйте инструмент проверки в Яндекс.Вебмастер (укажите URL — покажет, запрещён ли он). Или откройте robots.txt, найдите секцию с нужным User-agent и проверьте правила Disallow/Allow на соответствие пути.
Что делать, если robots.txt сайта заражён (взлом)? Немедленно восстановите файл из бэкапа. Проверьте сайт на вирусы и уязвимости. Сообщите в панели вебмастеров о проблеме. Обычно хакеры добавляют в robots.txt ссылки на вредоносные сайты — это не вредит индексации напрямую, но Google может пометить сайт как скомпрометированный.
Заключение
Robots.txt — маленький файл с огромным влиянием. Его настройка не занимает много времени, но требует внимательности и понимания структуры сайта. Регулярно проверяйте robots.txt при каждом техническом SEO-аудите. Одна ошибка может стоить месяцев работы по продвижению.