Веб-студия полного цикла

Работаем
по всей России

Звоните Пн-Пт: 9:00 - 18:00

+7 (999) 200-07-75

Меню сайта

Robots txt как мы скрываем от индексации на сайте технический мусор

Настройка robots.txt для SEO: как правильно закрыть технический мусор от индексации в Яндекс и Google

Правильно настроенный robots.txt помогает управлять обходом ресурса поисковыми роботами: ограничивать сканирование служебных URL, результатов внутреннего поиска, фильтров, корзины, параметрических адресов и других страниц, которые не должны расходовать краулинговый ресурс. Обычно достаточно 1 текстового файла в корне домена и нескольких точных правил User-agent и Disallow. Однако важно различать сканирование и индексирование: запрет обхода URL сам по себе не гарантирует его удаления из поисковой выдачи. Для надежного исключения HTML-страницы из индекса применяют noindex при доступном для робота URL, авторизацию, корректный HTTP-статус 404/410 или удаление документа. Поэтому настройка выполняется не по принципу «закрыть все лишнее», а после анализа структуры, типов URL и задач SEO, например, при проведении SEO-аудита перед запуском сайта.

Пример из практики. У интернет-магазина после внедрения фильтров появились тысячи адресов с параметрами: варианты сортировки, страницы результатов поиска, комбинации характеристик и служебные URL корзины. Значительная часть таких документов не имела самостоятельной ценности для посетителей из поиска, но была доступна поисковому роботу. После технического аудита URL разделили на полезные посадочные страницы и служебные комбинации. Для последних ограничили обход там, где это было оправдано, а для документов, которые требовалось именно исключить из поисковой выдачи, использовали отдельные механизмы управления индексированием. В результате поисковая система получила более понятную структуру ресурса без риска случайно закрыть коммерческие категории и карточки товаров, что мы всегда тщательно проверяем при аудите сайта перед разработкой или редизайном.

Статистически проблема ошибок в правилах доступа далеко не формальна. Google в 2019 году сообщил, что при анализе неподдерживаемых инструкций, включая noindex внутри robots.txt, такие правила противоречили другим настройкам во всех случаях, кроме примерно 0,001% исследованных файлов. С 1 сентября 2019 года Google окончательно прекратил поддержку noindex непосредственно в этом файле. Актуальная документация Google также прямо указывает: документ, заблокированный от сканирования, при определенных условиях все равно может быть известен поисковой системе и его URL способен появиться в результатах поиска. Именно поэтому техническое SEO должно разделять задачи ограничения обхода и исключения документа из индекса.

Что такое robots.txt и какую задачу он решает

robots.txt — текстовый служебный документ, через который владелец ресурса сообщает автоматическим краулерам правила доступа к определенным URL. Он размещается в корне хоста и доступен по стандартному адресу с окончанием /robots.txt. Когда поисковый робот начинает обход, он может обратиться к этому документу и определить, какие пути разрешены, а какие ограничены соответствующей директивой.

Основная функция заключается в управлении сканированием, а не в гарантированном удалении информации из результатов поиска. Это принципиальное различие. Если закрывать URL только через Disallow, робот перестает запрашивать его содержимое, однако сама ссылка может оставаться известной системе из внешних или внутренних источников.

На практике такой способ полезен прежде всего там, где автоматическому краулеру нет необходимости регулярно посещать определенные адреса. Это позволяет сделать обход структуры более рациональным, особенно для крупных интернет-магазинов, каталогов, маркетплейсов и информационных проектов с большим количеством автоматически создаваемых URL.

Что обычно стоит ограничивать для поисковых роботов

Универсального набора запретов не существует. Перед изменениями специалист изучает структуру проекта, CMS, внутреннюю перелинковку, параметры URL и данные панелей вебмастеров. Одинаковая папка на двух проектах может выполнять совершенно разные функции: на одном ресурсе она содержит бесполезные системные документы, а на другом — ценные посадочные страницы.

  • результаты внутреннего поиска, если они не используются как самостоятельные SEO-страницы;
  • корзину, оформление заказа и другие этапы пользовательской сессии;
  • служебные URL личного кабинета;
  • ненужные комбинации фильтрации и сортировки;
  • дубли, которые возникают из-за параметров адресной строки;
  • тестовые и вспомогательные разделы, если выбранный способ ограничения соответствует задаче;
  • бесконечные или практически бесконечные пространства URL, создаваемые технической логикой проекта.

Перед добавлением любого пути необходимо проверить, не приводит ли он к органическому трафику и не участвует ли в формировании полезной посадочной страницы. Особенно внимательно нужно работать с фасетной навигацией. Комбинация фильтров «бренд + категория» иногда представляет ценную страницу спроса, тогда как десятки вариантов сортировки той же выдачи действительно являются лишними для поискового обхода.

Как устроены основные директивы

Базовая логика достаточно проста. User-agent определяет, для какого краулера действует группа инструкций. Disallow сообщает путь, который соответствующему краулеру не следует обходить. Пустое значение ограничения означает отсутствие запрета в рамках соответствующего правила. В реальном проекте конфигурация может быть сложнее из-за разных групп User-agent и шаблонов URL.

Анализ директив User-agent и Disallow в файле robots.txt при техническом SEO-аудите сайта

Элемент Назначение Пример применения Что важно проверить
User-agent Указывает робота, которому адресованы инструкции User-agent: * Какие краулеры должны выполнять правило
Disallow Ограничивает сканирование указанного пути Disallow: /cart/ Нет ли внутри пути нужных документов
Allow Разрешает доступ к более конкретному пути при наличии ограничения Зависит от структуры URL Поддержку и взаимодействие с другими правилами
Sitemap Сообщает расположение карты ресурса Адрес sitemap.xml Доступность карты и наличие в ней канонических URL
noindex Не является поддерживаемой Google инструкцией внутри robots.txt Для HTML используют meta robots Робот должен получить страницу, чтобы увидеть meta noindex
X-Robots-Tag Передает правила индексирования через HTTP-заголовок X-Robots-Tag: noindex Доступность URL для сканирования
HTTP 404/410 Сообщает, что документ отсутствует Удаленный URL Не возвращает ли сервер ошибочный код 200
Авторизация Защищает закрытую информацию от публичного доступа Личный кабинет, внутренняя система Действительно ли контент недоступен без входа

Таблица показывает главное: один инструмент не решает все задачи. Когда требуется сократить ненужное сканирование, используется правило доступа. Когда требуется убрать HTML-документ из выдачи, чаще нужен noindex. Когда информация конфиденциальна, правильный вариант — реальное ограничение доступа, а не попытка скрывать адрес от краулера строкой в открытом служебном документе.

Почему Disallow и noindex нельзя считать одним и тем же

Это одна из наиболее распространенных ошибок при технической оптимизации. Disallow регулирует получение содержимого краулером. Noindex регулирует возможность присутствия полученного документа в поисковой выдаче. Для обработки meta noindex поисковая система должна иметь возможность загрузить документ и прочитать соответствующий тег.

Если одновременно запрещать сканирование URL и размещать внутри него meta noindex, возникает логическое противоречие: краулер не получает HTML-код и поэтому может не увидеть инструкцию. Google прямо предупреждает об этом в своей документации. Если URL уже известен благодаря ссылкам, сам адрес потенциально способен оставаться в поисковых результатах без обычного сниппета.

Поэтому сначала определяется цель. Если задача — уменьшить число запросов краулера к бесконечным фильтрам, применяются ограничения сканирования. Если задача — удалить доступный документ из органической выдачи, необходимо выбрать механизм запрета индексирования, например, через правильную настройку SEO-метатегов. Если документ вообще больше не существует, корректнее вернуть соответствующий HTTP-статус.

Как мы определяем технический мусор

Под этим термином обычно понимаются URL, которые автоматически возникают в работе CMS, фильтров, сортировок, поиска, пользовательских сценариев и других компонентов, но не дают самостоятельной ценности пользователю из органической выдачи. Нельзя считать ненужным документ только потому, что его адрес содержит параметр или находится в служебно выглядящей папке.

Аудит начинается со сбора доступных URL из нескольких источников: внутреннего обхода, XML-карты, данных поисковых систем, логов сервера при их наличии и структуры CMS. Затем адреса группируются по шаблонам. Такой подход помогает найти не единичные документы, а причины появления сотен или тысяч однотипных адресов.

  1. Собираем основные типы URL и определяем механизм их создания.
  2. Проверяем, какие документы доступны краулерам и какие уже известны поиску.
  3. Отделяем коммерческие, информационные и навигационные посадочные страницы от служебных.
  4. Проверяем внутренние ссылки, canonical, meta robots, HTTP-ответы и карту сайта (Sitemap.xml).
  5. Для каждого шаблона выбираем действие: оставить доступным, ограничить обход, поставить noindex, удалить или изменить генерацию URL.
  6. После внедрения повторно проверяем критические категории и отслеживаем изменения в инструментах для вебмастеров.

Такой порядок снижает вероятность массовой ошибки. Самый опасный сценарий — добавить слишком широкую маску и случайно закрыть каталог, карточки продукции, изображения, CSS/JavaScript, необходимые для корректного отображения, или другой важный раздел. Изменения лучше тестировать на конкретных примерах URL, а после публикации контролировать доступность ключевых документов.

Фильтры, сортировки и параметры URL

Для интернет-магазинов именно фасетная навигация часто создает наиболее сложную ситуацию. Допустим, каталог позволяет выбрать 10 брендов, 8 размеров, 7 цветов, несколько ценовых диапазонов и варианты сортировки. Число потенциальных комбинаций быстро становится значительно больше количества действительно полезных посадочных документов.

При этом запрещать все фильтры одним правилом не всегда правильно. Запросы по сочетаниям характеристик могут иметь реальный спрос. Например, категория определенного бренда или типа товара способна отвечать на самостоятельный коммерческий запрос. Поэтому SEO-специалист сначала формирует перечень индексируемых комбинаций, а затем определяет правила для остальных вариантов.

Отдельное внимание уделяется параметрам сортировки: по цене, популярности, рейтингу или дате. Если меняется только порядок тех же товаров, создание множества доступных поиску вариантов редко дает дополнительную ценность. Но конкретное решение зависит от реализации проекта, внутренних ссылок и того, как система формирует канонические адреса, например, создавая понятные ЧПУ URL для сайта.

Какие ошибки встречаются при настройке

Первая ошибка — воспринимать служебный документ как универсальный инструмент удаления URL из выдачи. Вторая — копировать готовую конфигурацию с другого проекта без проверки структуры. Даже сайты на одной CMS могут иметь разные плагины, маршруты, каталоги и SEO-логику. Третья ошибка — запрещать папку только из-за ее названия, не проверяя содержимое.

  • слишком широкое правило перекрывает полезный каталог;
  • важные ресурсы страницы становятся недоступны краулеру;
  • noindex размещается на URL, который одновременно запрещен для обхода;
  • в sitemap.xml остаются ненужные или неканонические адреса;
  • внутренние ссылки продолжают массово вести на бесполезные комбинации;
  • служебный документ изменяют без последующей проверки ключевых URL;
  • конфиденциальные данные пытаются защитить только правилом для поискового краулера.

Последняя ошибка особенно критична. Служебные инструкции не являются средством информационной безопасности. Они доступны публично и предназначены для управления поведением добросовестных автоматических систем. Закрытые кабинеты, административные интерфейсы и конфиденциальные документы должны защищаться авторизацией и серверными механизмами доступа.

Как правильно исключать страницу из поиска

Выбор зависит от состояния документа. Для существующей публичной HTML-страницы, которую пользователь может открывать напрямую, но которая не должна находиться в Google, применяется meta noindex либо X-Robots-Tag. При этом краулеру оставляют возможность загрузить URL и прочитать инструкцию. Google указывает, что после обнаружения noindex документ исключается из результатов.

Для удаленной информации логичнее вернуть код 404 или 410. Если содержимое перенесено и существует релевантная замена, рассматривается перенаправление. Если доступ разрешен только определенным пользователям, применяется авторизация. Такой подход решает исходную задачу на уровне архитектуры, а не маскирует ее дополнительными SEO-настройками.

Нужно учитывать и историю конкретного адреса. Если страница давно находится в выдаче, изменение правил не означает мгновенного исчезновения результата. Поисковой системе требуется повторно обработать URL. Скорость зависит от частоты обхода, авторитетности ресурса, внутренних и внешних ссылок и других факторов.

Как проверяем результат после внедрения

Проверка индексации и настроек robots.txt в Яндекс Вебмастер и Google Search Console

Настройка не заканчивается загрузкой нового файла на сервер. Сначала проверяется его доступность по стандартному адресу. Затем специалист тестирует ключевые шаблоны: главную, категории, карточки, статьи, изображения и URL, которые намеренно ограничены. После этого оцениваются данные инструментов поисковых систем.

Для Google полезны URL Inspection, отчет об индексировании страниц и статистика сканирования Search Console. Они помогают увидеть, получает ли Googlebot конкретный документ и как система воспринимает его состояние. Проверка особенно важна после редизайна, миграции, изменения CMS, структуры каталога или логики формирования фильтров.

Нельзя оценивать эффект только по количеству URL в индексе. Цель технической оптимизации — не добиться минимального числа документов, а оставить поисковой системе понятный набор полезных адресов и рационально организовать их обход. На крупном проекте тысячи индексируемых страниц могут быть нормой, если каждая отвечает самостоятельному пользовательскому спросу.

robots.txt, meta robots и X-Robots-Tag: что выбрать

Если необходимо управлять сканированием группы адресов, удобнее использовать служебные правила доступа. Если требуется управлять присутствием отдельной HTML-страницы в поисковой выдаче, применяется meta robots. Для PDF, изображений и других ресурсов, где HTML-тег использовать невозможно или неудобно, может применяться HTTP-заголовок X-Robots-Tag.

В сложных проектах эти инструменты дополняют друг друга, но их нельзя комбинировать механически. Сначала формулируется требуемый результат, затем выбирается средство. Правильный вопрос звучит не «что написать в файле», а «должен ли краулер посещать этот URL и должен ли сам документ присутствовать в поиске».

Когда требуется пересматривать правила

Даже корректная сегодня конфигурация может стать ошибочной после изменения проекта. Интернет-магазин добавляет новый фильтр, разработчики меняют маршрутизацию, появляются поддомены, личный кабинет, языковые версии или новая CMS. Старый запрет способен начать действовать на адреса, которых раньше не существовало.

Поэтому правила желательно проверять после крупных технических релизов и периодически в рамках SEO-аудита. Особого внимания требуют миграции и смена структуры URL, чтобы обеспечить миграцию сайта без потерь трафика и позиций. Перед переносом нужно зафиксировать текущие инструкции, определить новые пути и проверить их уже после запуска.

Часто задаваемые вопросы

Можно ли полностью убрать документ из Google через Disallow?
Не следует рассчитывать на это как на надежный способ. Google указывает, что заблокированный URL в некоторых случаях может появляться в результатах, если поисковая система узнала о нем из других источников. Для исключения доступной HTML-страницы используется noindex, причем URL должен оставаться доступным краулеру для чтения инструкции.

Где должен находиться robots.txt?
Он размещается в корне соответствующего хоста и доступен по стандартному пути /robots.txt. Правила относятся к тому протоколу, хосту и порту, где расположен документ, поэтому при сложной структуре с поддоменами необходимо учитывать область их действия.

Нужно ли закрывать все URL с параметрами?
Нет. Параметр сам по себе не означает низкое качество. Сначала проверяют назначение страницы, спрос, уникальность предложения, внутреннюю перелинковку и роль URL в структуре проекта. Часть параметрических адресов может быть полезными посадочными документами.

Можно ли написать noindex прямо в robots.txt?
Для Google это неподдерживаемое правило. Для управления индексированием используют meta robots или HTTP-заголовок X-Robots-Tag. Google официально отказался от обработки неподдерживаемой инструкции noindex в таком формате еще в 2019 году.

Нужно ли скрывать административную панель таким способом?
Не стоит считать его защитой. Если раздел содержит закрытые данные, необходимы серверное ограничение доступа и авторизация. Публичный перечень правил для краулеров не заменяет средства информационной безопасности.

Что такое robot в контексте SEO?
Это автоматическая программа-краулер, которая обнаруживает URL, запрашивает доступные документы и передает полученные сведения поисковой системе для дальнейшей обработки. У разных систем и сервисов существуют собственные идентификаторы User-agent.

Заключение

Грамотная настройка доступа начинается с технического аудита, а не с копирования готового шаблона. Необходимо определить полезные посадочные документы, найти дубли и служебные комбинации, проверить внутренние ссылки, sitemap.xml, canonical, HTTP-ответы и правила индексирования. После этого для каждой группы URL выбирается подходящий способ управления. Если вам нужно провести аудит структуры, найти лишние адреса, безопасно настроить правила обхода и исключить риск закрытия важных страниц, закажите техническую SEO-оптимизацию. Вы можете рассчитать стоимость проекта в квиз-калькуляторе или связаться с нами для обсуждения деталей. Мы проанализируем проект, подготовим инструкции для разработчиков, проверим внедрение и проконтролируем, чтобы поисковым системам были доступны именно те документы, которые должны участвовать в продвижении. Мы также оказываем комплексное техническое сопровождение сайта для долгосрочной стабильности вашего ресурса.

Бесплатно
и интересно!

Заказжите консультацию по разработке сайта
Как проверить сайт по чек-листу базового SEO
Бесплатно пошаговая
инструкция

Выберите куда вам выслать?

Cогласен с условиями политики конфиденциальности данных

Бесплатно
и интересно!

Рассчитайте стоимость проекта прямо сейчас