SEO и продвижение

Как проверить индексацию сайта
Вебмастер и GSC — база. site: — приближение. Логи — визиты робота.
Зачем вообще проверять индекс
Позиции и тексты бессмысленны, если важных URL нет в индексе или в индексе живут мусорные копии. Индексация — не «сайт добавлен». Это набор конкретных адресов, которые поиск готов показывать. Проверка отвечает на три вопроса: робот ходит; нужные страницы известны; ненужные не размазывают краулинговый бюджет и выдачу.
Источник правды — панели вебмастера плюс выборка ключевых URL. Не скрин «site:домен» из браузера и не ощущение, что «вчера всё было».
Яндекс Вебмастер
Подтвердите права на главное зеркало — то, на которое склеиваются www и протокол. Дальше смотрите не одну цифру «страниц в поиске», а состав:
- Какие URL в поиске и какие исключены — и почему: дубль, редирект, robots, ошибка ответа.
- Обход: ходит ли робот, нет ли массовых 5xx и таймаутов.
- Важные посадочные услуг и разделов: есть ли они в индексе поштучно, а не «сайт в целом».
Переобход отдельных URL полезен после публикации или правки шаблона. Не как ежедневный ритуал по всему каталогу. Лимиты очереди в интерфейсе плавают — ориентируйтесь на текущую панель, не на статью 2020 года с «точным числом в день». Если квота кончилась, приоритет: коммерческие посадочные, не теги блога.
Диагностика дублей и каноникала рядом: canonical и дубли. Часто «не индексируется» = склеено на другой URL или закрыто.
Google Search Console
Логика та же, названия другие. Отчёт по страницам (индексация): какие URL известны, какие исключены, с какой причиной. Проверка URL — снимок конкретного адреса: каноникал, доступность, последняя известная версия.
GSC не обещает мгновенный индекс после «запросить индексирование». Это заявка в очередь, не кнопка публикации. Не выдумывайте суточные лимиты из чужих скриншотов — смотрите, что показывает аккаунт сейчас, и не спамьте одну и ту же корзину.
Если Google и Яндекс расходятся по одному URL, это нормально: разные обходы, разные оценки малополезности. Чинить нужно, когда важная услуга отсутствует у обоих или у того поиска, откуда у вас спрос.
Операторы поиска — осторожно
Конструкции вроде site:example.ru и site:example.ru/uslugi/ удобны как дымовая проверка: «живёт ли раздел в выдаче». Они плохо годятся как перепись:
- не показывают полный индекс;
- зависят от персонализации и региона;
- могут показывать неканонические копии;
- запаздывают относительно панелей.
Ими пользуйтесь, чтобы быстро поймать пропажу зеркала или целого каталога после релиза. Не чтобы отчитаться «в индексе N тысяч». Для среза коммерческих URL держите таблицу: адрес, каноникал, статус в Вебмастере, статус в GSC, дата публикации.
Точные операторы вроде поиска по title имеют те же ограничения. Если панель говорит «в индексе», а site: молчит — верьте панели, подождите, не ломайте robots.
Логи сервера
Панели показывают, что поиск *знает*. Логи показывают, что робот *делал*. Это разные слои. В логах ищите user-agent роботов Яндекса и Google, коды ответа, цепочки редиректов, запросы к CSS/JS, если рендеринг важен.
Картина «робот не ходит» часто оказывается «ходит на 301 по кругу» или «ходит в закрытый /admin и в бесконечные параметры». Тогда чинят сервер и правила, а не «просят индекс ещё раз».
Служебные пути должны быть закрыты осмысленно — см. robots.txt. Нужные URL должны быть доступны без случайного Disallow и без цепочки из четырёх редиректов.
Карта сайта как сверка, не как кнопка «в индекс»
Sitemap — список кандидатов. Сверьте: все ли канонические коммерческие URL в карте; нет ли в карте noindex, редиректов, пагинации фильтров. Как собирать карту — в статье sitemap.xml. Расхождение «в карте 5000, в индексе 800» само по себе не катастрофа: в карте могли оказаться тонкие теги. Катастрофа — нет в индексе двадцати услуг.
Порядок проверки, который не разъезжается
- Зеркало, HTTPS, слэш: один главный хост.
- Выборка 20–50 URL, без которых бизнес не существует.
- Код ответа 200, без авторизации, каноникал на себя или на выбранный оригинал.
- Статус в Вебмастере и в GSC поштучно.
- Не вышли — логи, robots, noindex, каноникал, цепочка редиректа.
- Вышли мусорные — закрытие, склейка, чистка карты.
Этот контур входит в технический аудит и в работу по продвижению. Отдельная «услуга индексации» без правки причин — театр переобхода.
Одна страница: что смотреть руками
Возьмите URL услуги. В браузере без авторизации: 200, не редирект на главную, каноникал в коде совпадает с адресной строкой (или с выбранным оригиналом). Title и H1 на месте. Потом панель Яндекса — статус и причина исключения, если исключена. Потом GSC — проверка URL: «URL есть в индексе» это не то же самое, что «URL известен и исключён». Известен + исключён = робот видел, но не показывает. Лечить причину исключения, не жать переобход по кругу.
Если обе панели молчат, а site: тоже пуст — смотрите, видит ли робот хост вообще: главная в индексе? Если главной нет, проблема зеркала, robots или недоступности, не «этой услуги».
Не сравнивайте абсолютные числа «страниц в индексе» Яндекса и Google. Разный учёт, разные малополезные, разный срок жизни копий. Сравнивайте судьбу *одного и того же* бизнес-URL.
Логи без мистики
В access-логе полезны не красивые графики «ботов стало больше», а ответы. 200 на HTML услуг. 301 туда, куда вы задумали, одним прыжком. 404 на старые адреса после переезда — нормально, если есть редирект с карты переносов; плохо, если робот продолжает стучаться в тысячу умерших фильтров. 5xx пачками — обход сжимается, индекс отстаёт, и это не лечится sitemap.
Отличайте краулер поиска от парсеров и мониторингов. User-agent подделывают. Смотрите сети и частоту. Если «Яндекс» бьёт /search/?q= десять тысяч раз — закрывайте генератор, не увеличивайте Crawl-delay как стратегию.
После деплоя с новым robots.txt или авторизацией на стенде проверьте, что прод не перенял basic auth. Робот, получивший 401 на каталог, честно не проиндексирует каталог.
Переезд, смена CMS, новый раздел
Это моменты, когда индекс ломают чаще всего. Чек после релиза:
- Главное зеркало то же, что в панелях.
- Карта отдаёт новые канонические пути, не старые
index.php?id=. - Редиректы со старых услуг 301, не 302 «на время».
- Выборка старых URL: куда робот попадает.
- Выборка новых: не висит noindex из демо-контента.
Квоту переобхода тратьте на эти выборки. Не на каждую пагинацию. Точные дневные лимиты кнопок в Вебмастере и GSC здесь намеренно не названы: они меняются в интерфейсе. Смотрите, что доступно в аккаунте в день проверки.
Типичные самообманы
Сайт «в поиске» по бренду, а услуг нет. Индекс раздут пагинацией и UTM. После смены CMS карта старая, robots новый. Закрыли тестовый стенд Disallow:/ и скопировали файл на прод. Отправили на переобход URL, который отдаёт 404.
«В индексе 12 тысяч — значит SEO идёт». Может значить, что открыты архивы дат и параметры. «В индексе 80 — значит нас не любят». Может значить, что у вас 80 реальных страниц, и это здоровый визиточный контур.
Индексация проверяется списком адресов, не настроением. Пока нет списка важных URL, цифра из панели — просто цифра.
Частые вопросы
Почему site: показывает меньше, чем Вебмастер?
Оператор — не перепись индекса. Выдача ограничена, кэш запаздывает, часть URL скрыта как малополезные. Для учёта берите отчёты панелей и список важных страниц, не цифру из поиска.
Нужно ли раз в неделю отправлять все URL на переобход?
Нет. Квоты на переобход ограничены и меняются. Тратьте их на новые и изменённые важные страницы, не на каталог фильтров и черновики.
Страница в sitemap, но не в индексе. Это поломка карты?
Не обязательно. Карта — подсказка. Робот может счесть URL дублем, малополезным, закрытым директивой или каноникалом на другой адрес. Сначала HTML-заголовки и каноникал, потом карта.


