Google может учитывать директиву noindex из исходного HTML-кода страницы, даже если после обработки JavaScript в отрендеренной версии этот тег отсутствует.
Проверка URL в Google Search Console показала, что главная страница без www имеет статус noindex, хотя после рендеринга на странице этот мета-тег уже не отображается. Найти причину удалось только с помощью стороннего инструмента для анализа рендера.
Проблема возникла из-за конфликта двух директив на одном URL. Исходный HTML главной страницы содержал одновременно мета-тег robots с noindex и мгновенный редирект через meta refresh на другую версию сайта:
После рендера Google переходил на страницу /en/ и видел уже чистую версию документа без noindex. Однако поисковая система ранее успевала обработать исходный HTML, где запрет на индексацию уже присутствовал.
Ранее Джон Мюллер отмечал, что сочетание meta refresh и noindex может приводить к непредсказуемому поведению. У Google нет строгого правила, какой из сигналов должен иметь приоритет в такой ситуации: редирект или запрет на индексацию.
По словам автора, Google учитывает мета‑тег robots, если он есть хотя бы в одной из версий страницы — исходном HTML или после рендеринга. При этом noindex является прямой директивой для поисковика, а canonical — только рекомендацией. Поэтому в подобных случаях запрет на индексацию может сработать, а канонический URL, указанный в коде, не будет учтён.
В результате страница может исчезнуть из поисковой выдачи, а передача веса через canonical не произойдёт.
SEO‑специалист рекомендует несколько вариантов решения проблемы:
- убрать автоматический редирект через meta refresh, чтобы исключить конфликт директив;
- заменить его на серверный 301‑редирект, если корневой домен не должен участвовать в ранжировании;
- удалить noindex из исходного HTML и убедиться, что canonical совпадает в исходной и отрендеренной версиях страницы.
Отдельно специалист отмечает проблему диагностики в Google Search Console. Инструмент «Проверка URL» проходит по цепочке редиректов и показывает информацию о финальной странице, из‑за чего исходная причина конфликта может быть скрыта. При этом исходный HTML, который получает робот до рендера, не отображается в стандартных отчётах GSC.
Для SEO это означает, что при проблемах с индексацией недостаточно проверять только отрендеренную версию страницы. Необходимо анализировать исходный HTML‑ответ сервера и проверять, нет ли в нём директив, которые могут запретить Google добавлять страницу в индекс.
Источник: Telegram‑канал Mike Blazer