robots.txt — один из самых старых стандартов в вебе, старше самого Google. Его часто воспринимают как формальность: создали один раз при запуске сайта — и забыли. Но именно этот файл первым встречает любого бота, который приходит на сайт, — и от того, что в нём написано, зависит, увидит ли контент не только Googlebot и Яндекс.Bot, но и GPTBot, ClaudeBot, PerplexityBot и десяток других краулеров, от которых сегодня зависит видимость в GEO и AEO.

Как работает robots.txt в двух словах

Файл лежит в корне сайта по адресу /robots.txt и состоит из блоков вида User-agent (для какого бота правило) и Allow/Disallow (что можно и нельзя сканировать). Отдельной строкой обычно указывается Sitemap — ссылка на карту сайта. Никакого исполняемого кода, просто список инструкций, которые бот обязан соблюдать добровольно — это протокол доверия, а не техническая блокировка.

Роль в классическом SEO

Для Google и Яндекса robots.txt решает практическую задачу — управление crawl budget: сколько страниц бот вообще успеет обойти за визит. На больших сайтах это критично: если робот тратит ресурс на дубли, служебные параметры фильтров или страницы админки, до части реального контента он может просто не дойти. На маленьких сайтах crawl budget почти никогда не проблема, но неправильные директивы всё равно могут случайно закрыть от индексации то, что индексировать было нужно.

Роль в GEO и AEO — то, о чём часто забывают

У генеративных поисковиков и языковых моделей есть собственные краулеры, и они читают тот же самый robots.txt. Если сайт закрыт директивой Disallow: / для конкретного бота — модель просто не получит доступ к контенту и не сможет ни включить его в обучающую выборку, ни процитировать в ответе пользователю. Это прямой рычаг GEO/AEO-видимости, который сплошь и рядом настраивают вслепую или вообще не трогают со времён запуска сайта.

User-agentКто этоЗачем разрешать
GooglebotGoogle, классический поиск и AI OverviewsБез него нет ни SEO, ни GEO в Google
GPTBotOpenAI — обучение моделей и ChatGPT searchУпоминания и цитирования в ChatGPT
ClaudeBotAnthropic — Claude и веб-поиск в нёмВидимость в ответах Claude
PerplexityBotPerplexity AIЦитирования в ответах Perplexity
Google-ExtendedОтдельное разрешение для AI-функций GoogleУчастие контента в Gemini и AI Overviews
CCBotCommon Crawl — датасет, на котором учат многие моделиПопадание в обучающие корпуса разных LLM

Стоит ли блокировать AI-краулеров ради защиты контента

Это осознанный компромисс, а не однозначно правильное или неправильное решение. Часть изданий и авторов сознательно закрывает GPTBot и подобных ботов, чтобы контент не использовался для обучения моделей бесплатно. Это законное решение — но у него есть цена: сайт выпадает из выдачи GEO и AEO, потому что модель физически не видит его контент. Если продвижение в ИИ-поиске — часть стратегии бизнеса, закрывать этих ботов и одновременно рассчитывать на GEO-видимость — противоречие сработать не может.

Частые ошибки

  • Забытый Disallow: / после тестового сайта. Классика: на этапе разработки весь сайт закрыли от индексации, а после запуска забыли снять директиву.
  • Блокировка CSS и JS. Если поисковик не может загрузить стили и скрипты, он не может корректно отрендерить страницу и оценить, как она выглядит для пользователя — это бьёт по ранжированию.
  • Отсутствие ссылки на sitemap.xml. Мелочь, которая экономит боту время на поиск карты сайта самостоятельно.
  • Противоречивые правила. Общее правило для User-agent: * и отдельное более узкое для конкретного бота должны быть согласованы — иначе поведение бота становится непредсказуемым.
  • Слепое копирование чужого robots.txt. Структура и служебные пути у каждого сайта свои — директивы, скопированные с другого проекта, могут закрыть совсем не то, что нужно.

Как выглядит robots.txt на нашем сайте

На сайте ПОС МАСТЕР файл сознательно оставлен открытым: User-agent: * с Allow: /, закрыты только служебные файлы — обработчик формы и партиалы вёрстки. Никаких ограничений для AI-краулеров, потому что GEO — часть собственной стратегии продвижения студии, а не только услуга, которую мы продаём клиентам.

robots.txt — это не разовая настройка при запуске, а живой документ, который стоит пересматривать при каждом стратегическом повороте: появилось направление GEO — самое время перечитать, кого файл пускает на сайт, а кого нет.