Если ChatGPT ни разу не назвал ваш сайт в ответе, первое, что стоит проверить, — не заблокирован ли он в robots.txt. Не потому что это самая частая причина (обычно дело в разметке — мы писали об этом в разборе 30 сайтов клиник Алматы), а потому что это единственная причина, из-за которой все остальные усилия бессмысленны: сколько угодно можно размечать цены и часы работы, но если робот закрыт на пороге, он ничего этого не увидит.
Коротко
- GPTBot — не единственный робот ChatGPT. У OpenAI их три: GPTBot (обучение), OAI-SearchBot (поиск в ChatGPT), ChatGPT-User (просмотр по прямой ссылке). Заблокировать один — не значит заблокировать все три.
- По данным на 2026 год 25% топ-1000 сайтов блокируют GPTBot — рост с 5% в начале 2023 года. Среди сайтов помладше блокировка встречается чаще: у доменов, зарегистрированных в 2026 году, — 13,6%, у доменов 2023 года — 6,9%.
- Ощутимая доля блокировок — случайность: анализ топ-5000 сайтов нашёл 238, которые блокируют цитирование в ChatGPT непреднамеренно — обычно из-за общего шаблона robots.txt, скопированного не глядя.
- Из 30 сайтов стоматологий Алматы, которые мы разобрали своим движком 8 сентября, ни один не блокирует ни одного ИИ-робота. Проблема этого рынка не в блокировке — в том, что на открытых страницах нечего читать. Но это не значит, что стоит пропустить проверку: один шаблонный robots.txt из статьи «защита от парсеров» — и ваш сайт окажется исключением.
- Проверка занимает минуту: открыть
вашсайт.kz/robots.txtи посмотреть, что написано послеUser-agent: GPTBot.
Что вообще такое GPTBot
GPTBot — робот OpenAI, который обходит страницы в интернете и передаёт их содержимое в процесс обучения и пополнения знаний моделей. Он представляется в заголовке запроса строкой GPTBot и, как и любой добросовестный робот, перед обходом сайта читает robots.txt — это не техническое ограничение, а договорённость: соблюдение правил добровольное, но OpenAI, как и другие крупные компании, их придерживается.
Важная тонкость, которую путают чаще всего: GPTBot — это про будущее. Он не отвечает на вопрос пользователя прямо сейчас, а собирает материал, который может лечь в базу знаний модели в одном из следующих обновлений. За то, что происходит в моменте, отвечают два других робота:
| Робот | Зачем ходит | Что будет, если заблокировать |
|---|---|---|
| GPTBot | Сбор данных для обучения и пополнения знаний | Модель не узнает о вас в будущих обновлениях; то, что уже выучено, никуда не денется |
| OAI-SearchBot | Формирует результаты поиска внутри ChatGPT | ChatGPT не сможет процитировать вас, отвечая на поисковый запрос пользователя |
| ChatGPT-User | Заходит по прямой ссылке, когда пользователь просит «открой этот сайт» | ChatGPT не сможет открыть и пересказать конкретную страницу по ссылке |
Заблокировать нужно осознанно и по отдельности: правило User-agent: GPTBot не действует на OAI-SearchBot и наоборот. Владелец, который блокирует только GPTBot, думая, что «убрал сайт из ChatGPT», на самом деле оставил открытыми ровно те два робота, которые определяют, назовёт ли ChatGPT сайт прямо сейчас.
Кто ещё, кроме OpenAI
ChatGPT — не единственный ИИ-поиск, и GPTBot — не единственный робот, которого стоит проверить. Всего у крупных ИИ-сервисов около десятка роботов с разным назначением:
| Робот | Сервис | Зачем ходит |
|---|---|---|
| GPTBot, OAI-SearchBot, ChatGPT-User | ChatGPT / OpenAI | обучение, поиск, просмотр по ссылке |
| ClaudeBot | Claude / Anthropic | обучение и поиск |
| PerplexityBot | Perplexity | индекс для ответов Perplexity |
| Google-Extended | Google AI | Gemini и AI Overviews |
| Googlebot | обычный поиск и AI Overviews | |
| Bingbot | Bing | поиск и Copilot |
| Applebot-Extended | Apple | Apple Intelligence |
| CCBot | Common Crawl | открытый архив, на котором обучается много других моделей |
| YandexBot | Яндекс | Алиса и Нейро |
Девять групп, одиннадцать роботов. Проверять по одному GPTBot — значит видеть десятую часть картины.
Сколько сайтов реально блокируют ИИ-роботов
Цифры выросли заметно за последние два-три года. Среди топ-1000 сайтов интернета GPTBot блокируют 25% — в 2023 году таких было 5%. Среди сайтов вообще (не только крупных) блокировка встречается реже, около 10% по срезу 2026 года, но новые домены блокируют чаще старых: у сайтов, зарегистрированных в 2026 году, блокировка стоит у 13,6%, у сайтов 2023 года — у 6,9%. Крупные издатели закрывают ИИ-роботов активнее малого бизнеса — это видно и по отдельному анализу трафика Cloudflare: издатели сейчас чаще блокируют роботов, которые учат модели, и оставляют открытыми тех, кто отвечает на вопросы пользователей в моменте, — то самое разделение GPTBot vs OAI-SearchBot/ChatGPT-User, о котором мы писали выше.
Заметная часть блокировок — не решение, а случайность. Анализ топ-5000 сайтов нашёл 238 (почти 5%), которые блокируют цитирование в ChatGPT непреднамеренно: обычно потому, что кто-то скопировал общий robots.txt из статьи про защиту от парсеров, где GPTBot стоит в одном списке с откровенно вредоносными ботами, без разбора, что это разные вещи.
Что мы увидели на своём рынке
8 сентября мы разобрали 30 сайтов стоматологий Алматы собственным движком — полное исследование с таблицами здесь. Результат по доступу роботов однозначный: ни один из 30 сайтов не блокирует ни одного ИИ-робота. Открыты все, от GPTBot до YandexBot.
Это хорошая новость и плохая одновременно. Хорошая — на рынке медицинских услуг Алматы пока никто не закрывает дверь сам себе, конкурировать приходится не за доступ, а за то, что робот найдёт внутри. Плохая — раз никто не проверяет robots.txt намеренно, случайная блокировка (например, при смене хостинга, переезде на новый CMS или установке «защиты от ботов» без разбора, кто есть кто) может остаться незамеченной месяцами: сайт продолжит нормально работать для людей и для Google, но исчезнет из ответов ChatGPT — и никто не поймёт почему, потому что искать будут в контенте, а не в одной строке technical-файла.
Как проверить свой сайт за минуту
- Откройте в браузере
вашсайт.kz/robots.txt(наш собственный лежит на infolady.online/robots.txt — можно свериться с образцом). - Найдите строки, начинающиеся с
User-agent:. Каждая такая строка открывает блок правил для конкретного робота или для всех сразу (User-agent: *). - Под именем робота, который вас интересует, посмотрите на
Disallow:Disallow: /— робот заблокирован полностью;Disallow: /admin/(или другая конкретная папка) — заблокирован только этот раздел, остальное открыто;Allow: /или robота вообще нет в файле — открыт.
- Отдельно проверьте блок
User-agent: *в самом верху файла. Если там стоитDisallow: /— заблокированы вообще все роботы, включая Google, и это гораздо серьёзнее отдельной строки про GPTBot.
Пример нашего файла — открытый для всех девяти групп:
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
Строка Allow: / не обязательна юридически — отсутствие робота в файле уже означает разрешение, — но она явно фиксирует намерение и снимает вопрос «а вдруг забыли прописать».
💡 Проверить сразу все 11 роботов, не читая файл вручную, покажет бесплатный разбор — вместе с наличием llms.txt, карты сайта и тем, какие факты о бизнесе машина может прочитать на самих страницах. Без регистрации.
Частые ошибки
Общий шаблон «от парсеров». Скопированный откуда-то блок правил валит в одну кучу вредоносных скрейперов, спам-ботов и легитимные ИИ-роботы. Результат — сайт закрыт от ChatGPT теми же руками, что пытались защититься от спама.
Забытый Disallow: / с тестового окружения. Разработчик ставит блокировку всех роботов на staging, чтобы черновик не попал в поиск раньше времени, — и забывает снять её после переноса на прод.
Блокировка GPTBot вместо OAI-SearchBot и ChatGPT-User. Владелец решает «убрать себя из ChatGPT», блокирует только GPTBot — и не понимает, почему ассистент по-прежнему может процитировать сайт: два других робота остались открытыми.
Уверенность без проверки. «Мы никого не блокировали» — правда в 30 случаях из 30 на нашем рынке, но это не повод не проверять именно свой файл: одна строка, добавленная год назад ради другой задачи, могла остаться незамеченной.
Заключение
Доступ роботов — не самая частая причина, по которой ИИ не называет сайт: чаще дело в том, что на открытых страницах нет размеченных фактов о бизнесе. Но это единственная причина, которую стоит исключить в первую очередь: одна строка в robots.txt способна перечеркнуть любую другую работу над сайтом. Полминуты на проверку файла стоят потенциально нескольких месяцев ушедшего трафика.
Источники: HasData «The AI Crawler Block Index» (срез Q3 2026, 1744 сайта); Quattr / GetPassionfruit «Understanding OpenAI’s GPTBot» (25% топ-1000 сайтов блокируют GPTBot, рост с 5% в 2023); DEV Community, анализ топ-5000 сайтов на случайную блокировку цитирования ChatGPT; TechnologyChecker.io, отчёт по логам Cloudflare о блокировке ИИ-роботов издателями (сентябрь 2026). Данные по 30 сайтам стоматологий Алматы — собственный разбор InfoLady, 8 сентября 2026.