Проверка robots.txt
Вставьте robots.txt и адреса страниц — и посмотрите, какие из них закрыты для Яндекса и Google, каким правилом, и какие ошибки есть в файле.
Зачем проверять robots.txt
Одна строка в robots.txt может закрыть от поисковиков весь сайт или важный раздел. Чаще всего так бывает после переноса сайта с тестового сервера, где весь сайт закрывали строкой «Disallow: /», а убрать её забыли. Трафик из поиска при этом пропадает постепенно, и связь с файлом замечают не сразу. Подробнее — в статье «Почему сайт не индексируется».
Как инструмент проверяет
Правила применяются так, как описано в справке Яндекс Вебмастера и документации Google:
- Каждый поисковик выбирает свой блок User-agent. Яндекс берёт блок для своего основного робота (YandexBot), если его нет — блок «Yandex», и только потом общий блок «*». Google берёт блок «Googlebot», а если его нет — «*». Остальные блоки робот не читает.
- Если к адресу подходят несколько правил Disallow и Allow, побеждает самое длинное. При равной длине — Allow. Порядок строк в файле значения не имеет.
- Звёздочка * означает любые символы, $ — конец адреса. Регистр в путях важен: /Catalog и /catalog — разные адреса.
Файл и адреса проверяются прямо в вашем браузере и никуда не отправляются. Инструмент не скачивает robots.txt с сайта сам — скопируйте его содержимое в поле.
Чего robots.txt не делает
Запрет в robots.txt закрывает страницу от обхода, но не гарантирует, что её не будет в поиске: если на страницу ведут ссылки, адрес может попасть в выдачу и без содержимого. Чтобы убрать страницу из поиска, используйте noindex в мета-теге или в заголовке ответа сервера — и не закрывайте такую страницу в robots.txt, иначе робот не увидит noindex.