
robots.txt — маленький текстовый файл в корне сайта, который управляет тем, куда пускать поисковых роботов. Он кажется простым, но именно на нём совершают самые дорогие ошибки в SEO: одна лишняя строка способна закрыть от индексации весь сайт и обрушить трафик до нуля. Разберём синтаксис robots.txt, что действительно стоит в нём закрывать, специфику Яндекса и типичные ошибки, из-за которых сайты вылетают из выдачи.
Что делает robots.txt и что нет
robots.txt даёт роботам рекомендации по обходу: какие разделы сканировать, а какие нет. Важно понимать границы его возможностей.
- Он управляет обходом (краулингом), а не индексацией напрямую.
- Закрытая в нём страница всё равно может попасть в индекс, если на неё есть ссылки, — просто робот не увидит её содержимое.
- Для гарантированного исключения из индекса нужен мета-тег
noindexили заголовок, а не только robots.txt.
Это ключевая тонкость: robots.txt говорит «не заходи сюда», а noindex — «не показывай это в выдаче». Их путают, и из-за этого либо страница остаётся в поиске, либо, наоборот, робот не видит noindex, потому что вход закрыт в robots. Системный взгляд на управление обходом — в материале про индексацию сайта.
Базовый синтаксис
Файл состоит из блоков, каждый начинается с указания робота, к которому применяются правила.
| Директива | Назначение |
|---|---|
User-agent: | Для какого робота правила (* — для всех) |
Disallow: | Что запретить к обходу |
Allow: | Что разрешить (исключение внутри запрета) |
Sitemap: | Абсолютный адрес карты сайта |
Clean-param: | Параметры URL, которые Яндекс должен игнорировать |
Минимальный рабочий файл выглядит так: блок User-agent: *, набор Disallow для служебных разделов, отдельные Allow при необходимости и строка Sitemap с полным URL карты. Пустой Disallow: означает «разрешено всё», а Disallow: / — «запрещено всё» (та самая роковая строка).
Что закрывать, а что нет
Здоровая логика: закрывают то, что не должно попадать в выдачу и тратить краулинговый бюджет, но не трогают полезный контент.
Обычно закрывают:
- административные разделы и панель управления;
- корзину, оформление заказа, личный кабинет;
- страницы поиска по сайту и результаты фильтров без спроса;
- служебные и технические параметры URL, дубли сортировок;
- страницы печати, сравнения.
Не закрывают: полезные посадочные, категории, карточки, а также — критично — файлы стилей, скриптов и изображений. Если закрыть CSS и JS, робот не сможет корректно отрендерить страницу и оценит её хуже. Это частая устаревшая ошибка из старых шаблонов robots.
Специфика Яндекса: Clean-param и Host
У Яндекса есть собственные директивы, которых нет у Google. Главная полезная — Clean-param: она указывает роботу игнорировать динамические параметры URL (метки, идентификаторы сессий, utm), склеивая такие адреса с чистым. Это элегантнее, чем закрывать параметры через Disallow, потому что вес страницы сохраняется. Директива Host (указание главного зеркала) устарела — склейку зеркал теперь делают 301-редиректом и в Яндекс Вебмастере, как описано в материале про редиректы и склейку.
Для тонкой работы с дублями по параметрам Clean-param часто предпочтительнее Disallow — она не режет обход, а нормализует адреса.
Опасные ошибки robots.txt
Именно здесь теряют трафик. Топ ошибок, которые встречаются постоянно:
Disallow: /на живом сайте — закрывает весь сайт. Классика после переноса с тестового сервера, где так и надо было, но забыли снять.- Закрытие CSS и JS — робот не рендерит страницу, оценивает как сломанную.
- Попытка через robots убрать страницу из индекса — не работает, нужен
noindex; более того, закрыв вход, вы не даёте роботу увидеть тот самыйnoindex. - Закрытие важных разделов по неосторожной маске
Disallow. - Относительный путь в
Sitemap— адрес карты должен быть абсолютным, с доменом. - Файл недоступен или отдаёт ошибку — тогда правила игнорируются.
Любую из этих ошибок стоит искать первым делом, если сайт внезапно потерял трафик.
Как проверить robots.txt
Файл нельзя настроить «вслепую» — его проверяют инструментами, которые показывают, как его видит поисковик:
- Анализ robots.txt в Яндекс Вебмастере — проверяет доступность конкретного URL для робота и подсвечивает ошибки синтаксиса;
- отчёты Google Search Console — как Google трактует файл;
- ручная проверка: открыть
ваш-сайт/robots.txtв браузере и убедиться, что он отдаётся и читается.
После любой правки robots.txt обязательно тестируют ключевые URL — открыт ли доступ к тому, что должно индексироваться, и закрыт ли к служебному.
robots.txt — это гигиена, а не рост
Правильный robots.txt не поднимает сайт в топ — он лишь предотвращает потери: не даёт роботу тратить силы на мусор и защищает от катастрофических ошибок вроде закрытия всего сайта. Когда техническая база в порядке, рост определяют контент, ссылки и поведение посетителей. Если страницы попадают в выдачу, но их не выбирают, помогает работа с поведенческими факторами — сервис TopBooster приводит на готовые страницы живой трафик из поиска и усиливает сигналы качества. Но это надстройка: сначала убедитесь, что robots.txt не режет то, что должно ранжироваться.
Частые вопросы
Закрывает ли robots.txt страницу от индексации? Не гарантированно. robots.txt управляет обходом, а не индексацией: закрытая страница может попасть в выдачу, если на неё есть ссылки. Для надёжного исключения из индекса используют мета-тег noindex, причём вход к странице в robots при этом должен быть открыт, иначе робот не увидит сам noindex.
Почему нельзя закрывать CSS и JS в robots.txt? Потому что без стилей и скриптов робот не может корректно отрендерить страницу и оценивает её как сломанную или неполную. Это устаревшая практика из старых шаблонов; сегодня CSS и JS должны быть открыты для обхода.
Чем Clean-param лучше Disallow для параметров? Clean-param указывает Яндексу игнорировать динамические параметры и склеивать адреса с чистым URL, сохраняя вес страницы. Disallow же просто запрещает обход, из-за чего вес теряется. Для меток, сессий и utm обычно предпочтительнее Clean-param.
Что будет, если robots.txt отсутствует? Сайт будет обходиться полностью, без ограничений — это не критично для маленького сайта, но означает, что робот тратит бюджет на служебные и мусорные страницы. Для любого проекта, кроме простейшего, robots.txt стоит настроить.
Вывод
robots.txt — инструмент управления обходом, а не индексацией, и в этом его главная тонкость. Настраивают его по принципу гигиены: закрывают служебные разделы, корзину, поиск и мусорные параметры, но оставляют открытыми полезный контент, CSS и JS. Для Яндекса используют Clean-param вместо грубого Disallow по параметрам. И главное — избегают роковых ошибок: Disallow: / на живом сайте, закрытия стилей, попыток убрать страницу из индекса через robots. После каждой правки проверяют файл в Вебмастере. Это не приносит рост сам по себе, но защищает от потерь; а когда техника в порядке, вперёд выводят контент и поведение — оценить нужную поддержку можно на странице тарифов.
Продвинем ваш сайт в ТОП Яндекса и Google
Реальные переходы из поиска, отчёты 24/7, первый результат — до оплаты.
Смотреть тарифы →