Готовые шаблоны robots.txt для WordPress, Bitrix, Joomla, OpenCart и самописных сайтов. Как закрыть служебные разделы и не заблокировать важное. Пошаговая настройка с проверкой в Яндекс.Вебмастере.
Введение
Один неверный символ в robots.txt — и половина сайта вылетает из индекса. Или наоборот: в поиск попадают служебные страницы, админка и результаты внутреннего поиска. Несмотря на кажущуюся простоту, robots.txt остаётся одним из главных источников SEO-проблем. В интернете полно устаревших шаблонов, которые либо не закрывают нужное, либо закрывают лишнее. В этой статье — актуальные шаблоны robots.txt для популярных CMS и правильный алгоритм настройки, который защитит сайт от случайной потери индексации.
Базовые правила robots.txt
Прежде чем копировать шаблон, нужно понимать, как работает файл. Три ключевые директивы. User-agent — указывает, к какому роботу относится правило. Звёздочка означает всех роботов. Disallow — запрещает индексацию раздела или страницы. Allow — разрешает индексацию, даже если раздел закрыт через Disallow (используется для исключений). Sitemap — указывает путь к карте сайта. Важные правила синтаксиса. Каждая директива с новой строки. Нельзя группировать несколько URL в одной строке через запятую. Disallow без параметра разрешает всё, Disallow: / запрещает всё. Регистр имеет значение: Disallow: /Admin и Disallow: /admin — разные правила для разных путей. Для SEO критично: robots.txt не удаляет страницы из индекса, он запрещает их обход. Страница, уже попавшая в индекс, останется в нём, даже если вы закроете её в robots.txt. Для удаления используйте noindex или 404/410. О том, как правильно удалять страницы из поиска, читайте в статье Как удалить страницы из поиска: способы и ошибки.
Шаблон robots.txt для WordPress
WordPress — самая популярная CMS в мире, и её стандартный robots.txt часто требует доработки. Что нужно закрыть. Админку: /wp-admin/. Системные файлы: /wp-includes/. Папку с плагинами: /wp-content/plugins/. Папку с темами: /wp-content/themes/. Результаты поиска: /?s= или /search/. Страницы авторов: /author/. Страницы вложений: /?attachment_id= или /attachment/. Файлы формата .xml, .xsl (карты сайта лучше открыть отдельной директивой Sitemap, а не Allow). Что нельзя закрывать. Папку с загрузками: /wp-content/uploads/ — там лежат картинки, и они должны индексироваться. CSS и JS файлы: они нужны роботу для корректного рендеринга страниц. Карту сайта: её указываем через Sitemap, а не закрываем. Готовый шаблон содержит все базовые правила и требует минимальной адаптации под конкретный сайт.
Шаблон robots.txt для 1С-Битрикс
Битрикс генерирует много служебных URL, которые обязательно нужно закрывать. Что закрыть. Админку: /bitrix/admin/. Системные папки: /bitrix/, /bitrix/components/, /bitrix/templates/. Служебные страницы: /auth/, /personal/, /basket/, /order/. Страницы сравнения и избранного: /compare/, /favorites/. Страницы поиска: /search/. Страницы с GET-параметрами: /?sort=, /?display=, /?PAGEN_. Технические скрипты: /bitrix/php_interface/, /bitrix/tools/. Что нельзя закрывать. Папки с загруженными файлами и изображениями: /upload/ — там лежит весь контент. CSS и JS файлы. Карту сайта. Особенность Битрикса: в нём часто используется композитный кеш, который создаёт URL вида /bitrix/composite/. Их тоже нужно закрыть от индексации, если они попадают в sitemap.
Шаблоны для Joomla и OpenCart
Joomla. Закрываем: /administrator/, /components/, /modules/, /plugins/, /templates/, /cache/, /logs/, /tmp/. Открываем: /images/ (если там нет служебных файлов). OpenCart. Закрываем: /admin/, /catalog/view/theme/, /system/, /vendor/, /image/catalog/ (если там нет товарных изображений). Страницы с параметрами: /?route=common/home, /?sort=, /?order=, /?limit=. Страницы аккаунта: /account/, /checkout/, /cart/. Общий принцип для любой CMS: закрываем всё, что не является полезным контентом для пользователя. Если сомневаетесь — лучше не закрывайте, чем закройте нужное. Проверить, что robots.txt настроен правильно, можно через инструмент в Яндекс.Вебмастере, который подсвечивает ошибки и предупреждения. Подробнее о диагностике индексации читайте в статье Яндекс.Вебмастер для индексации: обзор инструментов.
Типичные ошибки при настройке robots.txt
Ошибка первая: Disallow: / в рабочем сайте. После переноса с тестового домена забыли убрать запрет — весь сайт вылетает из индекса. Ошибка вторая: закрытие CSS и JS. Без них робот не может корректно отрендерить страницу, что ухудшает ранжирование. Ошибка третья: закрытие изображений. Картинки не будут индексироваться, сайт потеряет трафик из поиска по картинкам. Ошибка четвёртая: синтаксические ошибки. Лишний пробел, точка с запятой, неправильный регистр — и правило не работает. Ошибка пятая: использование robots.txt для удаления страниц из индекса. Как уже говорили — robots.txt не удаляет, он предотвращает обход. Если страница уже в индексе, её нужно удалять другими методами. Ошибка шестая: отсутствие директивы Sitemap. Робот не знает, где карта сайта, и индексация замедляется.
Алгоритм настройки robots.txt
Шаг первый: создайте файл robots.txt в корне сайта (должен открываться по site.ru/robots.txt). Если файла нет, создайте в блокноте и загрузите через FTP. Шаг второй: используйте готовый шаблон для вашей CMS. Адаптируйте под себя: уберите лишние правила, добавьте специфичные для вашего сайта. Шаг третий: проверьте синтаксис в Яндекс.Вебмастере. Инструмент «Проверка robots.txt» покажет ошибки и предупреждения. Шаг четвёртый: проверьте, что важные разделы не закрыты. Пройдитесь по основным страницам через инструмент «Проверить URL» в Вебмастере — он покажет, разрешён ли обход. Шаг пятый: после публикации robots.txt отслеживайте статистику обхода в Вебмастере. Если количество проиндексированных страниц резко упало — ищите ошибку.
Часто задаваемые вопросы
Можно ли использовать robots.txt без Sitemap? Технически да, но это замедляет индексацию. Sitemap явно указывает роботу на важные страницы. Всегда добавляйте директиву Sitemap в robots.txt.
Как часто обновлять robots.txt? При изменении структуры сайта, добавлении новых типов страниц, смене CMS. Не реже раза в год проверяйте актуальность правил. Старые правила, оставшиеся от предыдущей версии сайта, могут закрывать новые важные разделы.
Что делать, если robots.txt заблокировал весь сайт? Немедленно удалить Disallow: / и проверить, что robots.txt обновился. Запросить переобход главной страницы в Вебмастере. Индексация восстановится в течение нескольких дней.
Нужен ли robots.txt для одностраничного сайта? Формально нет, но лучше создать с базовыми правилами и указанием Sitemap. Это предотвратит индексацию служебных URL, которые могут появиться в будущем при расширении сайта.
Можно ли закрыть страницу и в robots.txt, и через noindex? Да, это двойная защита. Robots.txt предотвращает обход, noindex — исключает из индекса. Вместе они гарантируют, что страница не попадёт в поиск.