
Управление индексацией — это контроль над тем, какие страницы сайта поисковый робот обходит, какие добавляет в индекс, а какие игнорирует. От этого напрямую зависит, за что вы вообще сможете бороться в выдаче: то, чего нет в индексе, не ранжируется в принципе. Основные инструменты — файл robots.txt, карта sitemap.xml, атрибут rel="canonical" и метатег noindex. Разберём механику каждого и типичные ошибки.
Обход и индексация — это разные вещи
Прежде чем что-то настраивать, важно различать два процесса. Обход (сканирование) — робот заходит на URL и считывает содержимое. Индексация — поисковик решает, добавлять ли страницу в базу, из которой формируется выдача. Одно не гарантирует другого: страницу можно обойти и не проиндексировать, а можно закрыть от обхода — и она всё равно попадёт в индекс по внешним ссылкам.
Отсюда главное правило: robots.txt управляет обходом, а не индексом. Чтобы гарантированно убрать страницу из выдачи, нужен noindex, а не запрет в robots.
robots.txt: управление обходом
Файл лежит в корне сайта (site.ru/robots.txt) и первым считывается роботом. Яндекс и Google понимают базовый набор директив:
- User-agent — для какого робота правила (
*— для всех,Yandex,Googlebot). - Disallow — запретить обход раздела или страницы.
- Allow — исключение внутри запрещённого раздела.
- Sitemap — полный адрес карты сайта (на неё не действуют остальные правила).
- Clean-param — только для Яндекса, о ней ниже.
Обычно закрывают служебные разделы: /cart/, /search/, /admin/, оформление заказа, личный кабинет. Ключевая ошибка — блокировать CSS и JS: без них робот не отрисует страницу и оценит её как некачественную. Вторая ошибка — надеяться, что Disallow уберёт страницу из индекса. Не уберёт: закрытый в robots URL может показываться в выдаче без сниппета, если на него ведут ссылки.
Clean-param: борьба с дублями от параметров
Clean-param — директива, понятная только Яндексу. Она велит роботу игнорировать GET-параметры, которые не меняют содержимое страницы: метки utm_, идентификаторы сессий, параметры сортировки. Без неё каждый такой параметр плодит дубль, а робот тратит на них краулинговый бюджет.
Пример: Clean-param: utm_source&utm_medium /catalog/. Директиву стоит держать полной и актуальной — новый неучтённый параметр снова начнёт плодить дубли и замедлит обход.
Что Яндекс больше не учитывает
Две директивы устарели, но до сих пор кочуют по старым шаблонам:
- Crawl-delay — Яндекс перестал её учитывать ещё в феврале 2018 года. Скорость обхода теперь задаётся в Вебмастере, в разделе «Скорость обхода сайта».
- Host (указание главного зеркала) — отменена с марта 2018 года. Склейка зеркал делается через 301-редирект и «Переезд сайта» в Вебмастере.
sitemap.xml: карта для робота
Карта сайта — это список URL, которые вы хотите отдать в индекс. Она не заставляет робота индексировать страницы, но помогает быстрее находить новые и обновлённые. Технические рамки одинаковы для Яндекса и Google:
- не более 50 000 URL и 50 МБ в одном файле; при превышении — индексный файл, ссылающийся на несколько карт;
- только канонические страницы с кодом ответа 200 OK — без редиректов, 404 и закрытых в robots;
- тег
<lastmod>с реальной датой изменения: и Яндекс, и Google используют его для планирования обхода, но лишь если дата достоверна; - теги
<priority>и<changefreq>Google игнорирует — на них можно не тратить силы; - ссылку на карту укажите в
robots.txtи добавьте сайт в Яндекс.Вебмастер и Google Search Console.
Грязный sitemap с битыми и редиректными URL вредит: робот теряет к нему доверие и обходит реже.
canonical: склейка дублей без потери веса
rel="canonical" — указание основной версии страницы среди дубликатов или похожих URL. Если у товара есть адреса с разными параметрами (?color=red, ?sort=price), canonical говорит: «индексируй и учитывай вот этот, основной». В отличие от noindex, атрибут передаёт накопленные сигналы (ссылочный вес, поведение) с дубля на каноническую страницу, а не обнуляет их. Поэтому Яндекс советует бороться с дублями в первую очередь именно через canonical.
Важные нюансы:
- canonical — это рекомендация, а не приказ: если содержимое сильно различается, поисковик вправе выбрать другой URL;
- на самодостаточных страницах прописывают ссылку на саму себя (self-canonical);
- канонический URL должен отдавать 200 OK и не быть закрыт в robots.txt — иначе сигнал противоречив.
noindex и X-Robots-Tag: жёсткое исключение
Когда страницу нужно гарантированно убрать из индекса, в её <head> добавляют метатег <meta name="robots" content="noindex, follow"> — он исключает страницу из выдачи, но позволяет роботу переходить по ссылкам. Тег <meta name="yandex"> работает только для Яндекса, googlebot — только для Google.
Для файлов без HTML-кода (PDF, DOC, изображения) метатег прописать негде — здесь помогает X-Robots-Tag: та же инструкция noindex, но передаётся в HTTP-заголовке ответа сервера.
Главная ловушка новичков — закрыть страницу и в robots.txt, и через noindex одновременно. Так нельзя: если URL запрещён в robots, робот на него не зайдёт и noindex не увидит — страница может остаться в индексе. Правильный порядок: сначала noindex, дождаться выпадения из выдачи, и только потом при желании закрыть в robots.
| Способ | Убирает из индекса | Сохраняет вес | Когда применять |
|---|---|---|---|
| Disallow (robots) | нет, только обход | — | служебные разделы, экономия бюджета |
| rel="canonical" | склеивает дубли | да | параметрические дубли, похожие URL |
| noindex | да | нет | страницы, которых не должно быть в поиске |
Краулинговый бюджет: что закрывать от индекса
Краулинговый бюджет — это число адресов, которые робот успевает проверить за сутки или неделю. У сайта-визитки это порядка 100–200 URL в день, у крупного магазина — десятки и сотни тысяч. Если бюджет уходит на мусорные страницы, важные обновления робот замечает с задержкой.
Что имеет смысл закрывать от индекса:
- корзину, оформление и оплату заказа;
- внутренний поиск, авторизацию и личный кабинет;
- фильтры и сортировки каталога, порождающие дубли;
- служебные страницы, версии для печати, адреса с utm-метками;
- теги и архивы, дублирующие основной контент.
Экономят бюджет чистая структура, Clean-param, canonical на параметрических URL и аккуратный sitemap без битых ссылок.
Ускорение индексации: IndexNow и переобход
Ждать планового обхода можно неделями — есть способы поторопить робота:
- IndexNow — протокол, которым вы сами уведомляете поисковики о новых, изменённых и удалённых страницах. Его поддерживает Яндекс; лимит выше, чем у ручного переобхода, — до 10 000 страниц в день. Одна отправка расходится сразу по Яндексу, Bing, Seznam и другим участникам протокола. Нужен ключевой файл в корне сайта.
- Переобход страниц в Яндекс.Вебмастере — ручная отправка важных URL. Лимиты назначаются каждому сайту индивидуально и автоматически.
- Актуальный sitemap с
lastmod— самый простой фоновый способ подсказать роботу, что обновилось.
Индексация — необходимое, но не достаточное условие роста: когда страницы уже в индексе, их судьбу дальше решают релевантность и поведенческие сигналы. Системной работой с поведением занимается сервис TopBooster — но подключать его стоит только после того, как техническая база в порядке.
Частые вопросы
Почему страница закрыта в robots.txt, а всё равно в поиске?
Потому что Disallow запрещает обход, а не индексацию. Если на страницу ведут внешние или внутренние ссылки, поисковик может добавить её в индекс без содержимого. Чтобы убрать наверняка, откройте страницу для обхода и поставьте noindex.
canonical или noindex — что выбрать для дублей?
Если дубль полезен пользователю и накопил сигналы (например, карточка с параметрами), используйте canonical — он склеит вес на основную версию. Если страница не нужна в поиске в принципе, ставьте noindex.
Как проверить, в индексе ли страница?
В Яндекс.Вебмастере — раздел «Страницы в поиске» и инструмент проверки URL; в Google Search Console — «Проверка URL». Быстрая прикидка — оператор url: в поиске Яндекса. Сверяйте число проиндексированных страниц с реальным объёмом сайта.
Нужен ли IndexNow, если уже есть sitemap?
Они не заменяют, а дополняют друг друга. Sitemap — фоновая карта для планового обхода, IndexNow — мгновенное уведомление о конкретных изменениях. На часто обновляемых сайтах связка ускоряет попадание страниц в индекс заметно сильнее, чем один sitemap.
Вывод
Управление индексацией сводится к простой логике: robots.txt регулирует обход, sitemap.xml показывает роботу приоритетные страницы, canonical склеивает дубли без потери веса, а noindex и X-Robots-Tag жёстко убирают лишнее из выдачи. Держите в индексе только качественные страницы, не блокируйте CSS и JS, не смешивайте Disallow с noindex и экономьте краулинговый бюджет.
Когда индекс под контролем и нужные страницы в поиске, следующий шаг — усиливать их поведенческими факторами: посмотрите тарифы и решите, вписывается ли это в вашу стратегию. Порядок в индексации сам по себе позиций не даёт, но без него не работает всё остальное.
Продвинем ваш сайт в ТОП Яндекса и Google
Реальные переходы из поиска, отчёты 24/7, первый результат — до оплаты.
Смотреть тарифы →