Файл robots.txt підказує пошуковим роботам, які розділи сайту можна сканувати, а до яких звертатися не варто. Він не гарантує видалення сторінки з пошуку і не замінює захист паролем, але допомагає керувати навантаженням на сервер та уникати зайвого обходу технічних URL. Помилка в одному рядку може закрити від сканування важливий розділ, тому налаштовувати файл потрібно обережно й обов’язково перевіряти після змін.
Що робить robots.txt і де він розташований
Robots.txt — звичайний текстовий файл у корені домену. Для сайту example.com він має відкриватися за адресою example.com/robots.txt. Правила групуються за назвою робота в директиві User-agent. Значення зі зірочкою стосується всіх роботів, які підтримують стандарт. Директива Disallow просить не сканувати зазначений шлях, а порожнє значення Disallow означає, що загальної заборони немає.
Важливо розрізняти сканування та індексацію. Якщо URL заборонено в robots.txt, пошукова система може не прочитати його вміст, однак сама адреса іноді все одно з’являється в результатах через зовнішні посилання. Для контрольованого вилучення сторінки з індексу використовують meta robots noindex або HTTP-заголовок X-Robots-Tag, причому робот повинен мати можливість прочитати цю вказівку.
Базова структура безпечного файлу
Для більшості невеликих сайтів краще починати з мінімальної конфігурації, а не копіювати довгий шаблон з іншого проєкту. Простий варіант дозволяє сканування всього відкритого сайту та вказує адресу XML-карти:
User-agent: * Disallow: Sitemap: https://example.com/sitemap_index.xml
Замість example.com потрібно використати власний домен і фактичну адресу sitemap. У WordPress карта може створюватися ядром CMS або SEO-плагіном, тому адресу спочатку слід перевірити в браузері. Для OpenCart, Laravel чи самописного сайту шлях залежить від реалізації. Директива Sitemap не відкриває закриті сторінки, а лише допомагає роботу знайти карту.
Якщо потрібно обмежити технічний каталог, додають окреме правило, наприклад Disallow: /private-area/. Шлях слід перевірити на тестовому списку URL: правило для каталогу може охопити більше адрес, ніж очікувалося. Не варто блокувати CSS, JavaScript або зображення, потрібні для коректного відображення сторінки пошуковим роботом.
Типові помилки під час налаштування
Найнебезпечніша помилка — комбінація User-agent: * та Disallow: /. Вона просить усіх сумісних роботів не сканувати сайт. Таке правило іноді залишається після розробки на тестовому домені або з’являється під час невдалого перенесення. Після запуску потрібно перевірити саме робочий домен, а не локальну копію.
Інша поширена проблема — спроба сховати конфіденційні дані через robots.txt. Файл доступний публічно, а правила є рекомендаціями для добросовісних роботів. Адміністративні панелі, резервні копії та приватні документи потрібно захищати авторизацією, правами доступу і налаштуваннями сервера. Не слід публікувати в robots.txt назви секретних каталогів, покладаючись на нього як на засіб безпеки.
Також трапляються неправильні символи, зайві пробіли в URL, правила для чужого домену та посилання на неіснуючу sitemap. Зміни в CMS або плагіні можуть перезаписати віртуальний robots.txt, тому важливо з’ясувати, де саме формується файл: фізично на сервері, плагіном чи кодом застосунку.
Як перевірити robots.txt після змін
Спочатку відкрийте файл за прямою адресою та переконайтеся, що сервер повертає текст без перенаправлення на помилку або сторінку входу. Потім перевірте кілька важливих URL: головну, категорію, товар або послугу, статтю блогу, адміністративний та технічний розділи. Критичні посадкові сторінки не повинні випадково потрапити під Disallow.
У Google Search Console варто переглянути звіт про індексацію та перевірити окремі адреси інструментом перевірки URL. Якщо з’являється причина «Заблоковано файлом robots.txt», потрібно визначити, чи є блокування навмисним. Після виправлення Google потрібен час, щоб повторно отримати файл і пересканувати сторінки; миттєвого оновлення статусів очікувати не слід.
Зберігайте копію попередньої версії та дату зміни. Після публікації перевірте доступність sitemap, ключових сторінок і журнал сервера, якщо він доступний. Для складного сайту корисний технічний аудит AriZone: він допоможе зіставити robots.txt, meta robots, canonical, sitemap та фактичні індексаційні сигнали.
Практичний чекліст
- Файл відкривається за адресою /robots.txt і повертає текст.
- Немає випадкового Disallow: / для всіх роботів.
- Важливі сторінки, CSS і JavaScript доступні для сканування.
- Адреса Sitemap правильна та сама карта відкривається.
- Приватні дані захищені не robots.txt, а авторизацією.
- Після змін перевірені ключові URL у Search Console.
Окремо перевірте поведінку службових URL після оновлення теми, плагінів або структури сайту. Нові каталоги, параметри фільтрів і сторінки пошуку можуть з’явитися непомітно, тому robots.txt варто переглядати після технічних змін. Зберігайте попередню версію файлу: це допоможе швидко порівняти правила й відкотити невдале редагування. Якщо сайт має окремі піддомени, пам’ятайте, що кожен із них потребує власного robots.txt.
Висновок
Хороший robots.txt зазвичай короткий, зрозумілий і відповідає реальній структурі сайту. Його завдання — керувати скануванням, а не приховувати дані чи примусово видаляти сторінки з Google. Починайте з мінімальних правил, перевіряйте кожну заборону на конкретних URL і узгоджуйте файл із sitemap, canonical та meta robots. Якщо структура сайту складна або в Search Console вже накопичилися помилки, AriZone допоможе провести перевірку й підготувати безпечну конфігурацію.