TopBooster.ru
Техническое SEO

Управление индексацией сайта: robots.txt, sitemap и canonical

TBTopBooster7 мин чтенияОбновлено 2026-07-21
Управление индексацией сайта: robots.txt, sitemap и canonical

Управление индексацией — это контроль над тем, какие страницы сайта поисковый робот обходит, какие добавляет в индекс, а какие игнорирует. От этого напрямую зависит, за что вы вообще сможете бороться в выдаче: то, чего нет в индексе, не ранжируется в принципе. Основные инструменты — файл robots.txt, карта sitemap.xml, атрибут rel="canonical" и метатег noindex. Разберём механику каждого и типичные ошибки.

Обход и индексация — это разные вещи

Прежде чем что-то настраивать, важно различать два процесса. Обход (сканирование) — робот заходит на URL и считывает содержимое. Индексация — поисковик решает, добавлять ли страницу в базу, из которой формируется выдача. Одно не гарантирует другого: страницу можно обойти и не проиндексировать, а можно закрыть от обхода — и она всё равно попадёт в индекс по внешним ссылкам.

Отсюда главное правило: robots.txt управляет обходом, а не индексом. Чтобы гарантированно убрать страницу из выдачи, нужен noindex, а не запрет в robots.

robots.txt: управление обходом

Файл лежит в корне сайта (site.ru/robots.txt) и первым считывается роботом. Яндекс и Google понимают базовый набор директив:

  • User-agent — для какого робота правила (* — для всех, Yandex, Googlebot).
  • Disallow — запретить обход раздела или страницы.
  • Allow — исключение внутри запрещённого раздела.
  • Sitemap — полный адрес карты сайта (на неё не действуют остальные правила).
  • Clean-param — только для Яндекса, о ней ниже.

Обычно закрывают служебные разделы: /cart/, /search/, /admin/, оформление заказа, личный кабинет. Ключевая ошибка — блокировать CSS и JS: без них робот не отрисует страницу и оценит её как некачественную. Вторая ошибка — надеяться, что Disallow уберёт страницу из индекса. Не уберёт: закрытый в robots URL может показываться в выдаче без сниппета, если на него ведут ссылки.

Clean-param: борьба с дублями от параметров

Clean-param — директива, понятная только Яндексу. Она велит роботу игнорировать GET-параметры, которые не меняют содержимое страницы: метки utm_, идентификаторы сессий, параметры сортировки. Без неё каждый такой параметр плодит дубль, а робот тратит на них краулинговый бюджет.

Пример: Clean-param: utm_source&utm_medium /catalog/. Директиву стоит держать полной и актуальной — новый неучтённый параметр снова начнёт плодить дубли и замедлит обход.

Что Яндекс больше не учитывает

Две директивы устарели, но до сих пор кочуют по старым шаблонам:

  • Crawl-delay — Яндекс перестал её учитывать ещё в феврале 2018 года. Скорость обхода теперь задаётся в Вебмастере, в разделе «Скорость обхода сайта».
  • Host (указание главного зеркала) — отменена с марта 2018 года. Склейка зеркал делается через 301-редирект и «Переезд сайта» в Вебмастере.

sitemap.xml: карта для робота

Карта сайта — это список URL, которые вы хотите отдать в индекс. Она не заставляет робота индексировать страницы, но помогает быстрее находить новые и обновлённые. Технические рамки одинаковы для Яндекса и Google:

  • не более 50 000 URL и 50 МБ в одном файле; при превышении — индексный файл, ссылающийся на несколько карт;
  • только канонические страницы с кодом ответа 200 OK — без редиректов, 404 и закрытых в robots;
  • тег <lastmod> с реальной датой изменения: и Яндекс, и Google используют его для планирования обхода, но лишь если дата достоверна;
  • теги <priority> и <changefreq> Google игнорирует — на них можно не тратить силы;
  • ссылку на карту укажите в robots.txt и добавьте сайт в Яндекс.Вебмастер и Google Search Console.

Грязный sitemap с битыми и редиректными URL вредит: робот теряет к нему доверие и обходит реже.

canonical: склейка дублей без потери веса

rel="canonical" — указание основной версии страницы среди дубликатов или похожих URL. Если у товара есть адреса с разными параметрами (?color=red, ?sort=price), canonical говорит: «индексируй и учитывай вот этот, основной». В отличие от noindex, атрибут передаёт накопленные сигналы (ссылочный вес, поведение) с дубля на каноническую страницу, а не обнуляет их. Поэтому Яндекс советует бороться с дублями в первую очередь именно через canonical.

Важные нюансы:

  • canonical — это рекомендация, а не приказ: если содержимое сильно различается, поисковик вправе выбрать другой URL;
  • на самодостаточных страницах прописывают ссылку на саму себя (self-canonical);
  • канонический URL должен отдавать 200 OK и не быть закрыт в robots.txt — иначе сигнал противоречив.

noindex и X-Robots-Tag: жёсткое исключение

Когда страницу нужно гарантированно убрать из индекса, в её <head> добавляют метатег <meta name="robots" content="noindex, follow"> — он исключает страницу из выдачи, но позволяет роботу переходить по ссылкам. Тег <meta name="yandex"> работает только для Яндекса, googlebot — только для Google.

Для файлов без HTML-кода (PDF, DOC, изображения) метатег прописать негде — здесь помогает X-Robots-Tag: та же инструкция noindex, но передаётся в HTTP-заголовке ответа сервера.

Главная ловушка новичков — закрыть страницу и в robots.txt, и через noindex одновременно. Так нельзя: если URL запрещён в robots, робот на него не зайдёт и noindex не увидит — страница может остаться в индексе. Правильный порядок: сначала noindex, дождаться выпадения из выдачи, и только потом при желании закрыть в robots.

СпособУбирает из индексаСохраняет весКогда применять
Disallow (robots)нет, только обходслужебные разделы, экономия бюджета
rel="canonical"склеивает дублидапараметрические дубли, похожие URL
noindexданетстраницы, которых не должно быть в поиске

Краулинговый бюджет: что закрывать от индекса

Краулинговый бюджет — это число адресов, которые робот успевает проверить за сутки или неделю. У сайта-визитки это порядка 100–200 URL в день, у крупного магазина — десятки и сотни тысяч. Если бюджет уходит на мусорные страницы, важные обновления робот замечает с задержкой.

Что имеет смысл закрывать от индекса:

  • корзину, оформление и оплату заказа;
  • внутренний поиск, авторизацию и личный кабинет;
  • фильтры и сортировки каталога, порождающие дубли;
  • служебные страницы, версии для печати, адреса с utm-метками;
  • теги и архивы, дублирующие основной контент.

Экономят бюджет чистая структура, Clean-param, canonical на параметрических URL и аккуратный sitemap без битых ссылок.

Ускорение индексации: IndexNow и переобход

Ждать планового обхода можно неделями — есть способы поторопить робота:

  • IndexNow — протокол, которым вы сами уведомляете поисковики о новых, изменённых и удалённых страницах. Его поддерживает Яндекс; лимит выше, чем у ручного переобхода, — до 10 000 страниц в день. Одна отправка расходится сразу по Яндексу, Bing, Seznam и другим участникам протокола. Нужен ключевой файл в корне сайта.
  • Переобход страниц в Яндекс.Вебмастере — ручная отправка важных URL. Лимиты назначаются каждому сайту индивидуально и автоматически.
  • Актуальный sitemap с lastmod — самый простой фоновый способ подсказать роботу, что обновилось.

Индексация — необходимое, но не достаточное условие роста: когда страницы уже в индексе, их судьбу дальше решают релевантность и поведенческие сигналы. Системной работой с поведением занимается сервис TopBooster — но подключать его стоит только после того, как техническая база в порядке.

Частые вопросы

Почему страница закрыта в robots.txt, а всё равно в поиске?

Потому что Disallow запрещает обход, а не индексацию. Если на страницу ведут внешние или внутренние ссылки, поисковик может добавить её в индекс без содержимого. Чтобы убрать наверняка, откройте страницу для обхода и поставьте noindex.

canonical или noindex — что выбрать для дублей?

Если дубль полезен пользователю и накопил сигналы (например, карточка с параметрами), используйте canonical — он склеит вес на основную версию. Если страница не нужна в поиске в принципе, ставьте noindex.

Как проверить, в индексе ли страница?

В Яндекс.Вебмастере — раздел «Страницы в поиске» и инструмент проверки URL; в Google Search Console — «Проверка URL». Быстрая прикидка — оператор url: в поиске Яндекса. Сверяйте число проиндексированных страниц с реальным объёмом сайта.

Нужен ли IndexNow, если уже есть sitemap?

Они не заменяют, а дополняют друг друга. Sitemap — фоновая карта для планового обхода, IndexNow — мгновенное уведомление о конкретных изменениях. На часто обновляемых сайтах связка ускоряет попадание страниц в индекс заметно сильнее, чем один sitemap.

Вывод

Управление индексацией сводится к простой логике: robots.txt регулирует обход, sitemap.xml показывает роботу приоритетные страницы, canonical склеивает дубли без потери веса, а noindex и X-Robots-Tag жёстко убирают лишнее из выдачи. Держите в индексе только качественные страницы, не блокируйте CSS и JS, не смешивайте Disallow с noindex и экономьте краулинговый бюджет.

Когда индекс под контролем и нужные страницы в поиске, следующий шаг — усиливать их поведенческими факторами: посмотрите тарифы и решите, вписывается ли это в вашу стратегию. Порядок в индексации сам по себе позиций не даёт, но без него не работает всё остальное.

Продвинем ваш сайт в ТОП Яндекса и Google

Реальные переходы из поиска, отчёты 24/7, первый результат — до оплаты.

Смотреть тарифы →