TopBooster.ru
Техническое SEO

Файл robots.txt: синтаксис, настройка и опасные ошибки

TBTopBooster6 мин чтенияОбновлено 2026-07-22
Файл robots.txt: синтаксис, настройка и опасные ошибки

robots.txt — маленький текстовый файл в корне сайта, который управляет тем, куда пускать поисковых роботов. Он кажется простым, но именно на нём совершают самые дорогие ошибки в SEO: одна лишняя строка способна закрыть от индексации весь сайт и обрушить трафик до нуля. Разберём синтаксис robots.txt, что действительно стоит в нём закрывать, специфику Яндекса и типичные ошибки, из-за которых сайты вылетают из выдачи.

Что делает robots.txt и что нет

robots.txt даёт роботам рекомендации по обходу: какие разделы сканировать, а какие нет. Важно понимать границы его возможностей.

  • Он управляет обходом (краулингом), а не индексацией напрямую.
  • Закрытая в нём страница всё равно может попасть в индекс, если на неё есть ссылки, — просто робот не увидит её содержимое.
  • Для гарантированного исключения из индекса нужен мета-тег noindex или заголовок, а не только robots.txt.

Это ключевая тонкость: robots.txt говорит «не заходи сюда», а noindex — «не показывай это в выдаче». Их путают, и из-за этого либо страница остаётся в поиске, либо, наоборот, робот не видит noindex, потому что вход закрыт в robots. Системный взгляд на управление обходом — в материале про индексацию сайта.

Базовый синтаксис

Файл состоит из блоков, каждый начинается с указания робота, к которому применяются правила.

ДирективаНазначение
User-agent:Для какого робота правила (* — для всех)
Disallow:Что запретить к обходу
Allow:Что разрешить (исключение внутри запрета)
Sitemap:Абсолютный адрес карты сайта
Clean-param:Параметры URL, которые Яндекс должен игнорировать

Минимальный рабочий файл выглядит так: блок User-agent: *, набор Disallow для служебных разделов, отдельные Allow при необходимости и строка Sitemap с полным URL карты. Пустой Disallow: означает «разрешено всё», а Disallow: / — «запрещено всё» (та самая роковая строка).

Что закрывать, а что нет

Здоровая логика: закрывают то, что не должно попадать в выдачу и тратить краулинговый бюджет, но не трогают полезный контент.

Обычно закрывают:

  • административные разделы и панель управления;
  • корзину, оформление заказа, личный кабинет;
  • страницы поиска по сайту и результаты фильтров без спроса;
  • служебные и технические параметры URL, дубли сортировок;
  • страницы печати, сравнения.

Не закрывают: полезные посадочные, категории, карточки, а также — критично — файлы стилей, скриптов и изображений. Если закрыть CSS и JS, робот не сможет корректно отрендерить страницу и оценит её хуже. Это частая устаревшая ошибка из старых шаблонов robots.

Специфика Яндекса: Clean-param и Host

У Яндекса есть собственные директивы, которых нет у Google. Главная полезная — Clean-param: она указывает роботу игнорировать динамические параметры URL (метки, идентификаторы сессий, utm), склеивая такие адреса с чистым. Это элегантнее, чем закрывать параметры через Disallow, потому что вес страницы сохраняется. Директива Host (указание главного зеркала) устарела — склейку зеркал теперь делают 301-редиректом и в Яндекс Вебмастере, как описано в материале про редиректы и склейку.

Для тонкой работы с дублями по параметрам Clean-param часто предпочтительнее Disallow — она не режет обход, а нормализует адреса.

Опасные ошибки robots.txt

Именно здесь теряют трафик. Топ ошибок, которые встречаются постоянно:

  1. Disallow: / на живом сайте — закрывает весь сайт. Классика после переноса с тестового сервера, где так и надо было, но забыли снять.
  2. Закрытие CSS и JS — робот не рендерит страницу, оценивает как сломанную.
  3. Попытка через robots убрать страницу из индекса — не работает, нужен noindex; более того, закрыв вход, вы не даёте роботу увидеть тот самый noindex.
  4. Закрытие важных разделов по неосторожной маске Disallow.
  5. Относительный путь в Sitemap — адрес карты должен быть абсолютным, с доменом.
  6. Файл недоступен или отдаёт ошибку — тогда правила игнорируются.

Любую из этих ошибок стоит искать первым делом, если сайт внезапно потерял трафик.

Как проверить robots.txt

Файл нельзя настроить «вслепую» — его проверяют инструментами, которые показывают, как его видит поисковик:

  • Анализ robots.txt в Яндекс Вебмастере — проверяет доступность конкретного URL для робота и подсвечивает ошибки синтаксиса;
  • отчёты Google Search Console — как Google трактует файл;
  • ручная проверка: открыть ваш-сайт/robots.txt в браузере и убедиться, что он отдаётся и читается.

После любой правки robots.txt обязательно тестируют ключевые URL — открыт ли доступ к тому, что должно индексироваться, и закрыт ли к служебному.

robots.txt — это гигиена, а не рост

Правильный robots.txt не поднимает сайт в топ — он лишь предотвращает потери: не даёт роботу тратить силы на мусор и защищает от катастрофических ошибок вроде закрытия всего сайта. Когда техническая база в порядке, рост определяют контент, ссылки и поведение посетителей. Если страницы попадают в выдачу, но их не выбирают, помогает работа с поведенческими факторами — сервис TopBooster приводит на готовые страницы живой трафик из поиска и усиливает сигналы качества. Но это надстройка: сначала убедитесь, что robots.txt не режет то, что должно ранжироваться.

Частые вопросы

Закрывает ли robots.txt страницу от индексации? Не гарантированно. robots.txt управляет обходом, а не индексацией: закрытая страница может попасть в выдачу, если на неё есть ссылки. Для надёжного исключения из индекса используют мета-тег noindex, причём вход к странице в robots при этом должен быть открыт, иначе робот не увидит сам noindex.

Почему нельзя закрывать CSS и JS в robots.txt? Потому что без стилей и скриптов робот не может корректно отрендерить страницу и оценивает её как сломанную или неполную. Это устаревшая практика из старых шаблонов; сегодня CSS и JS должны быть открыты для обхода.

Чем Clean-param лучше Disallow для параметров? Clean-param указывает Яндексу игнорировать динамические параметры и склеивать адреса с чистым URL, сохраняя вес страницы. Disallow же просто запрещает обход, из-за чего вес теряется. Для меток, сессий и utm обычно предпочтительнее Clean-param.

Что будет, если robots.txt отсутствует? Сайт будет обходиться полностью, без ограничений — это не критично для маленького сайта, но означает, что робот тратит бюджет на служебные и мусорные страницы. Для любого проекта, кроме простейшего, robots.txt стоит настроить.

Вывод

robots.txt — инструмент управления обходом, а не индексацией, и в этом его главная тонкость. Настраивают его по принципу гигиены: закрывают служебные разделы, корзину, поиск и мусорные параметры, но оставляют открытыми полезный контент, CSS и JS. Для Яндекса используют Clean-param вместо грубого Disallow по параметрам. И главное — избегают роковых ошибок: Disallow: / на живом сайте, закрытия стилей, попыток убрать страницу из индекса через robots. После каждой правки проверяют файл в Вебмастере. Это не приносит рост сам по себе, но защищает от потерь; а когда техника в порядке, вперёд выводят контент и поведение — оценить нужную поддержку можно на странице тарифов.

Продвинем ваш сайт в ТОП Яндекса и Google

Реальные переходы из поиска, отчёты 24/7, первый результат — до оплаты.

Смотреть тарифы →