журнал Практика

Как сделать сайт видимым для нейросетей: роботы, доступ, рендеринг и проверка по логам

Восемь технических проверок за час: какие роботы нейросетей ходят на сайт, где их закрывают robots.txt, CDN и скрипты, как это увидеть curl-ом и в логах сервера.

28 августа 202617 мин чтения

Плакат: сова SEENGO в фуражке швейцара у бархатного каната и двери в виде окна браузера, к двери стоит очередь маленьких роботов

Сайт может быть невидим для нейросетей физически. Тексты и разметка здесь ни при чём: робот модели получает от сервера 403, пустой каркас без текста или капчу. Владелец открывает сайт в браузере, всё на месте, и он идёт переписывать главную. Робот при этом не видит ни старой главной, ни новой.

Хорошая новость в том, что физическая невидимость проверяется за час и без подрядчика. Ниже восемь проверок в том порядке, в котором они ломаются чаще всего. У каждой три части: что смотреть, как смотреть и что делать с результатом. Про общую логику четырёх групп сигналов мы писали в статье про оптимизацию сайта под нейросети, здесь идём в технику: команды, имена роботов, строки логов.

Проверка 1. robots.txt и роботы нейросетей

Что проверить. Пускает ли файл robots.txt роботов моделей поимённо. У каждой компании их несколько, и они ходят за разным: один собирает материал для обучения, другой строит поисковый индекс, третий приходит за страницей в тот момент, когда пользователь задал вопрос. Закрыть можно любого по отдельности, и это надо сделать осознанно.

Таблица ниже собрана по официальным страницам поставщиков, ссылки в разделе источников. Роботы без официальной страницы с правилами в неё не вошли - например, Bytespider от ByteDance: адрес из его user-agent открывается только из Китая, и никакой публичной политики по robots.txt у него нет.

User-agentЧейЗачем ходитЗакрыть отдельно
GPTBotOpenAIОбучение моделейДа, robots.txt. На поиск ChatGPT не влияет
OAI-SearchBotOpenAIПоисковый индекс ChatGPTДа, robots.txt. Закрыли - выпали из поиска ChatGPT
ChatGPT-UserOpenAIВизит в момент ответа пользователюrobots.txt может не применяться: действие инициирует человек
ClaudeBotAnthropicОбучение моделейДа, robots.txt
Claude-SearchBotAnthropicПоисковый индекс ClaudeДа, robots.txt
Claude-UserAnthropicВизит в момент ответа пользователюДа, robots.txt
PerplexityBotPerplexityПоисковый индекс Perplexity, не обучениеДа, robots.txt
Perplexity-UserPerplexityВизит в момент ответа пользователюrobots.txt игнорирует, только WAF по user-agent и IP
GooglebotGoogleИндекс поиска Google и его ИИ-функцийДа, но вместе с поиском Google
Google-ExtendedGoogleОбучение Gemini и groundingДа, robots.txt. На поиск не влияет
ApplebotAppleSpotlight, Siri, SafariДа, robots.txt
Applebot-ExtendedAppleОбучение моделей Apple. Сам страницы не забираетДа, robots.txt. Поиск Apple не трогает
YandexBotЯндексОсновной индекс. Нейро и Алиса в поиске опираются на негоДа, но вместе с поиском Яндекса
YandexAdditional, YandexAdditionalBotЯндексБыстрые ответы YandexGPT и ответы Поиска с АлисойТолько отдельной секцией: общие правила не учитывают
CCBotCommon CrawlОткрытый архив веба, из него собирают обучающие наборыДа, robots.txt
Роботы нейросетей по официальным страницам поставщиков на 28.08.2026

Из таблицы видна общая логика. Поставщики развели обучение и поиск по разным именам, и запрет обучения не выбрасывает сайт из ответов. А вот запрет поискового робота выбрасывает: OpenAI прямо пишет, что OAI-SearchBot можно разрешить, чтобы появляться в результатах, и одновременно закрыть GPTBot. С Яндексом развилки нет: у Нейро и Алисы в поиске нет своего индексирующего робота, они берут страницы из общего индекса YandexBot, а за быстрыми ответами приходят YandexAdditional и YandexAdditionalBot, которые общие правила robots.txt не читают вовсе.

Как проверить. Откройте https://ваш-сайт.ru/robots.txt в браузере. Ищите два типа проблем: явный Disallow: / под именем робота из таблицы и общий запрет под User-agent: *, который срабатывает для всех, кому не выписано отдельное разрешение. Второе встречается чаще первого.

Самая частая находка в аудитах выглядит так: секции User-agent: Yandex и User-agent: Googlebot открыты, а ниже стоит User-agent: * с Disallow: /. Разработчик закрывал парсеры конкурентов и спам-боты, а закрыл заодно OAI-SearchBot, ClaudeBot, PerplexityBot и всех остальных: они попадают под звёздочку, потому что своей секции у них нет. Сайт при этом прекрасно живёт в Яндексе и Google, и никто не замечает потери годами.

Что сделать. Решить, что вы хотите: присутствовать в ответах и поиске моделей или закрыться от них. Компромиссный вариант: поиск разрешить, обучение запретить. Так выглядит рабочий robots.txt для этого случая:

# Поиск и визиты в момент ответа - разрешены
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: YandexAdditional
User-agent: YandexAdditionalBot
Allow: /

# Обучение моделей - запрещено
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

User-agent: *
Allow: /
Sitemap: https://ваш-сайт.ru/sitemap.xml

Общий блок со звёздочкой оставьте открытым, а конкретных вредителей закрывайте по именам или на уровне сервера. OpenAI предупреждает, что изменения robots.txt их системы подхватывают примерно за сутки, так что перепроверять логи в тот же час бессмысленно. И не путайте этот файл с llms.txt: тот ничем не управляет, зачем он нужен и нужен ли вообще, разобрано отдельно.

Проверка 2. Блокировки выше сервера: CDN, WAF, хостинг

Что проверить. Открытый robots.txt ничего не значит, если запрос робота не доходит до сервера. Между роботом и вашим nginx стоят Cloudflare или другой CDN, файрвол хостинга, защита от DDoS, капча, лимит запросов и геоблок по странам. Каждый из них умеет отдавать роботу 403, 429 или страницу с проверкой браузера вместо контента.

С Cloudflare отдельная история. В его панели есть настройка блокировки ИИ-ботов с тремя режимами: блокировать везде, блокировать на страницах с рекламой, не блокировать. По официальной документации с 15 сентября 2026 года для новых доменов по умолчанию будут блокироваться боты категорий "обучение" и "агент" на страницах с рекламой, а поисковые останутся открытыми. Если сайт заводили в Cloudflare недавно или кто-то нажал "Block AI bots" в момент паники, роботы упираются в стену до robots.txt.

Геоблок бьёт по всем сразу. Роботы OpenAI, Anthropic и Perplexity приходят с зарубежных адресов, и правило "пускать только Россию и СНГ", поставленное от ботнета, закрывает их полностью. Такое правило часто живёт на стороне хостинга, и в панели сайта его не видно.

Как проверить. Сымитируйте робота curl-ом и посмотрите на код ответа. Строки user-agent берутся с официальных страниц, для проверки достаточно короткого имени:

curl -sI -A "GPTBot" https://ваш-сайт.ru/ | head -1
curl -sI -A "OAI-SearchBot" https://ваш-сайт.ru/ | head -1
curl -sI -A "ClaudeBot" https://ваш-сайт.ru/ | head -1
curl -sI -A "PerplexityBot" https://ваш-сайт.ru/ | head -1

Норма - HTTP/2 200 на каждую строку. Если для обычного браузерного user-agent приходит 200, а для робота 403 или 503, вы нашли фильтр. Второй прогон сделайте с зарубежного сервера или через VPN: геоблок не увидеть из Москвы. Обратите внимание и на тело ответа: код 200 с текстом "Checking your browser" - это тоже блок, просто вежливый.

Что сделать. В Cloudflare проверить раздел Security и правила для ИИ-ботов, в WAF добавить исключения по user-agent и по официальным спискам IP: их публикуют OpenAI, Anthropic, Perplexity и Common Crawl. У хостинга спросить про геофильтр и лимиты. Капчу оставить на формах, а не на всех страницах. Лимит запросов держать таким, чтобы робот с интервалом в секунду не попадал под него.

Проверка 3. Текст собирается скриптами

Что проверить. Робот забирает исходный HTML, который отдал сервер. Большинство сборщиков JavaScript не исполняют, и если текст страницы появляется только после отработки скриптов, для робота она пустая. Типичные жертвы: сайты на React и Vue без серверного рендеринга, конструкторы, витрины, где каталог подгружается из API после загрузки, страницы с текстом внутри табов и аккордеонов, которые рисуются на клиенте.

Как проверить. Отличайте два инструмента браузера. "Просмотр кода страницы" (Ctrl+U) показывает исходный HTML, каким его отдал сервер, а вкладка Elements в DevTools показывает дерево после исполнения скриптов. Робот видит первое. Возьмите фразу из середины страницы, откройте Ctrl+U и поищите её. Ещё точнее через терминал:

curl -s https://ваш-сайт.ru/uslugi/ | grep -c "фраза из середины страницы"
curl -s https://ваш-сайт.ru/uslugi/ | wc -c

Ноль в первой команде и несколько килобайт во второй означают, что страница для робота - это подключение скриптов и пустой div. Сравните с размером страницы во вкладке Network: если исходный HTML в двадцать раз меньше того, что в итоге видит человек, разница - это невидимый роботу текст.

Что сделать. Идеал - рендеринг на сервере: SSR или статическая генерация, у всех современных фреймворков это штатный режим. Промежуточный вариант - пререндер: сервис или модуль, который отдаёт роботам готовый HTML. Минимум, если переписывать нечем: заголовок, первый абзац, описание услуг и контакты выносятся в HTML прямо в шаблоне, а интерактив остаётся скриптам. Этого минимума хватает на удивление часто: модели нужен ответ на вопрос, анимацию она не оценит.

Проверка 4. Карта сайта и канонические адреса

Что проверить. Роботам моделей, как и поисковым, нужен список страниц и один адрес у каждой. Сломано обычно одно из трёх: карта сайта отсутствует или отдаёт устаревшие адреса, сайт открывается по четырём адресам сразу (http и https, с www и без), у страниц нет canonical или он указывает на другую страницу.

Дубли вредят не только SEO. Модель, которая нашла четыре копии одной страницы с разными адресами, распределяет между ними сигналы и ни одной не доверяет полностью. А в источники под ответом попадает случайная из копий, часто http-версия из старого индекса.

Как проверить. Четыре команды на редиректы и одна на карту сайта:

curl -sI http://ваш-сайт.ru/ | grep -i "HTTP\|location"
curl -sI http://www.ваш-сайт.ru/ | grep -i "HTTP\|location"
curl -sI https://www.ваш-сайт.ru/ | grep -i "HTTP\|location"
curl -sI https://ваш-сайт.ru/sitemap.xml | head -1

Три первых должны отдавать 301 на один и тот же основной адрес, четвёртая - 200. Затем откройте пять случайных страниц из карты и посмотрите в исходном коде тег <link rel="canonical">: он должен указывать на саму страницу в основном формате адреса. В Яндекс Вебмастере и Google Search Console дубли и битые ссылки из карты видны в отчётах об индексировании.

Что сделать. Один основной адрес, 301 с остальных трёх, canonical на каждой странице, карта сайта с датами изменения и без страниц, которые отдают не 200. Карту укажите в robots.txt последней строкой, как в примере выше.

Проверка 5. Скорость и стабильность ответа

Что проверить. У роботов есть таймауты, и они короче человеческого терпения. Страница, которая открывается за восемь секунд, для человека медленная, а для робота может оказаться недоступной: он ушёл, не дождавшись. Вторая беда - нестабильность. Сайт, который раз в час отдаёт 502 из-за перезапуска, для робота работает "иногда", и он снижает частоту визитов.

Как проверить. Время до первого байта и полное время ответа:

curl -s -o /dev/null -w "code=%{http_code} ttfb=%{time_starttransfer}s total=%{time_total}s\n" https://ваш-сайт.ru/

Прогоните по пять раз в разное время суток и по нескольким страницам, не только по главной. Ориентир для времени до первого байта - до секунды, для полного ответа HTML - до двух-трёх. Стабильность проверяется по логам: команда из проверки 7 с фильтром по кодам 5xx покажет, сколько раз за неделю сервер не ответил.

Что сделать. Кэш страниц на сервере, сжатие, отказ от тяжёлых запросов в базу на каждый показ. Если сайт падает при пиках, роботам моделей достаются как раз пики: они приходят пачками. Мониторинг доступности с проверкой раз в минуту стоит копейки и покажет, что происходит ночью, когда никто не смотрит.

Проверка 6. Страница отвечает на вопрос

Что проверить. Когда доступ есть, робот должен найти на странице ответ, который можно вынуть одним куском. Три вещи смотрятся за минуту: заголовок H1 совпадает с тем, что человек спросил бы у модели; первый абзац отвечает прямо, без разгона про историю компании; факты об организации на месте и одинаковы на всех страницах - название, город, адрес, телефон, чем занимается.

Как проверить. Прочитайте заголовок и первый абзац страницы услуги вслух как ответ на вопрос "кто делает X в городе Y". Если после первого абзаца ответить нельзя, модель тоже не сможет. Затем проверьте разметку организации: инструмент проверки Schema.org покажет, что заявлено в JSON-LD, и совпадает ли это с текстом на странице.

Что сделать. Заголовок и первый абзац переписать как прямой ответ, факты об организации вынести в разметку и в подвал каждой страницы. Подробно про то, какие тексты берут в ответ, а какие пропускают, и про разметку Schema.org для нейросетей написано отдельно. Здесь важна очерёдность: эти работы идут после первых пяти проверок, пока доступ закрыт, они уходят в стену.

Проверка 7. Логи сервера: были ли роботы вообще

Что проверить. Всё выше - предположения о том, что робот увидит. Логи веб-сервера показывают, что он увидел на самом деле: приходил ли, какие страницы просил, что получил в ответ. Это единственная проверка, которая не зависит от ваших ожиданий.

Как проверить. Access-лог nginx или Apache обычно лежит в /var/log/nginx/access.log или в панели хостинга в разделе логов. Одна команда покажет визиты роботов моделей за период:

grep -Ei "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|YandexAdditional" /var/log/nginx/access.log | tail -50

Вторая - сводку, кто сколько раз приходил и с каким результатом:

grep -Eio "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|YandexAdditional" /var/log/nginx/access.log | sort | uniq -c | sort -rn

Дальше читаете три колонки: имя робота, запрошенный адрес и код ответа. Если у робота сплошь 403 или 503, вернитесь к проверке 2. Если 200, но роботы просят только robots.txt и уходят, вернитесь к проверке 1: они прочитали запрет и послушались. Если робот забирает страницы, а в исходном HTML этих страниц текста нет - проверка 3. Рядом не забудьте посмотреть, что за адреса просят: старые URL из чужих ссылок, отдающие 404, - повод настроить редиректы.

Учтите, что строку user-agent может подделать кто угодно, и часть визитов "GPTBot" в логах - обычные парсеры под маской. Для точности сверяйте IP с официальными списками, ссылки в источниках. Для первой диагностики это не критично: подделки не меняют картину "есть визиты или нет".

Что сделать. Разберём два крайних результата. Роботов моделей нет вообще за месяц, при том что robots.txt открыт и curl отдаёт 200. Это значит одно из двух: либо блок стоит выше и на IP хостинга роботы не доходят (проверка 2 с зарубежного адреса), либо сайт роботам неизвестен - на него никто не ссылается, и в поисковых индексах, откуда модели берут кандидатов, он глубоко. Второе лечится не на сайте, об этом проверка 8.

Другой крайний случай: в логах есть ChatGPT-User, Claude-User или Perplexity-User. Это значит, что живой человек задал вопрос, и модель в момент ответа пришла читать вашу страницу. Лучший сигнал из возможных: вы найдены, и страница понадобилась для ответа. Посмотрите, какие именно адреса забирают эти роботы - вот страницы, которые уже работают. Их стоит держать в порядке в первую очередь и по ним же понимать, какие вопросы приводят к вам. Как различать сети, которые ищут в вебе, и те, что отвечают по памяти, разобрано в статье кто из нейросетей ищет в вебе.

Проверка 8. Что сайт не решает

Все семь проверок делают сайт доступным и читаемым. Они не делают его рекомендованным. Когда пользователь просит модель посоветовать компанию, она перечисляет названия из тех текстов, где компании сравнивают и перечисляют: подборки, каталоги, отзывы, отраслевые обзоры, обсуждения. Ваш сайт для неё - один источник из многих, притом самый предвзятый.

Так что после технической части работа переезжает на чужие площадки, и там она устроена иначе: по шагам это разобрано в статье как стать источником для нейросетей. На примере одной сети видно, что в ChatGPT можно изменить, а что купить нельзя. Проверки из этой статьи - условие участия в отборе, а не его результат.

Как это проверяем мы

Бесплатный аудит сайта по 39 маркерам закрывает технику из проверок 1-6 за минуту: доступ роботам моделей поимённо, читаемость страниц без скриптов, коды ответов, разметку организации и вопросов, даты публикации и авторство. Логи он не читает - к серверу у нас доступа нет, эту часть делает разработчик по командам выше.

аудит сайта · 39 проверокоткрыть демо-кабинет
Аудит сайта: общий балл, готовность к поиску и к ответам нейросетей, список правок

Аудит раскладывает 39 маркеров по блокам с объяснением каждого провала. Доступ роботам и читаемость без скриптов идут первыми: пока они красные, остальные тридцать с лишним пунктов ничего не дают.

Дальше идёт то, что на сайте не проверить: ссылаются ли сети на вас вообще. Исследование задаёт восьми нейросетям и нейровыдаче Яндекса реальные вопросы покупателей и под каждым ответом собирает домены источников с пометками свой, конкурент, нейтральный. Отсюда две цифры. Доля цитирований - сколько среди всех ссылок под ответами ведёт на ваш сайт. И список доменов, которые сети цитируют вместо вас: он и есть карта площадок для проверки 8. У каждой доли интервал погрешности, и если ответов меньше трёх, вместо цифры стоит метка "мало данных".

Что клиент получает и где границы, честно: мы измеряем и показываем источники, план работ от тарифа "Продвинутый" раскладывает находки на задачи с приоритетом. Правки в robots.txt, на CDN и в шаблонах делает ваш разработчик, тексты на внешних площадках пишете вы или подрядчик. Гарантий попадания в ответ не даём, потому что решение принимает модель.

Посмотреть, как это выглядит на живых данных, можно в демо-кабинете без регистрации. Бесплатный тариф даёт одно исследование по пяти вопросам и аудит сайта, остальные объёмы и цены открыты. Чтобы начать, нужно зарегистрироваться и выбрать тариф.

Прогнать восемь проверок за час

Порядок такой. Откройте robots.txt и сверьте с таблицей из проверки 1, исправьте секцию со звёздочкой. Прогоните четыре curl-а с именами роботов, один из них с зарубежного адреса. Возьмите фразу со страницы услуги и найдите её через Ctrl+U. Проверьте редиректы с трёх лишних адресов и ответ карты сайта. Замерьте время ответа пять раз. Прочитайте первый абзац главной страницы услуги как ответ на вопрос клиента.

Потом отдайте разработчику команду из проверки 7 и попросите сводку по роботам за месяц. Через сутки после правок в robots.txt повторите её. Если роботы пришли и получили 200, техника закрыта, и можно переходить к площадкам. Если не пришли - у вас есть список, где искать, и он в этой статье.

Источники

вопросы

Частые вопросы

  • 01Достаточно ли открыть GPTBot, чтобы попасть в ответы ChatGPT?

    Нет. GPTBot собирает материал для обучения будущих моделей, а поиск ChatGPT ходит под именем OAI-SearchBot, и страницу в момент ответа забирает ChatGPT-User. Для присутствия в ответах с поиском нужен открытый OAI-SearchBot, обучение можно закрыть отдельно.

  • 02Чем закрытие обучения отличается от закрытия поиска?

    Обучение - это то, что модель запомнит к следующей версии, поиск - то, что она найдёт сегодня. OpenAI, Anthropic, Google и Apple выделили обучение в отдельные имена роботов, и запрет GPTBot, ClaudeBot, Google-Extended или Applebot-Extended не убирает сайт из поиска и ответов.

  • 03Почему в robots.txt всё открыто, а роботов нейросетей в логах нет?

    Чаще всего доступ режется выше сервера: защита от ботов в Cloudflare, капча, геоблок по стране или лимит запросов. Проверяется curl-ом с чужим user-agent из-за границы. Второй вариант проще: сайт молодой или на него никто не ссылается, и роботы пока не знают о нём.

  • 04Как понять, читает ли робот текст на моём сайте, если страницы собираются скриптами?

    Откройте исходный код страницы (Ctrl+U) или заберите её curl-ом и поищите в ответе фразу с экрана. Если фразы нет - её нет и для робота. Лечится рендерингом на сервере, пререндером или хотя бы выносом ключевого текста в HTML.

  • 05Что значит, если в логах есть ChatGPT-User?

    Кто-то задал ChatGPT вопрос, и модель в момент ответа пришла читать вашу страницу. Это лучший из сигналов: сайт найден, страница нужна для ответа. Посмотрите, какие URL забирает робот - это страницы, которыми модель уже пользуется.

  • 06Сайт открыт и читается, но нейросети всё равно не называют компанию. Что дальше?

    Сайт убирает препятствия, но названия компаний модели берут из внешних источников: подборок, каталогов, отзывов, обзоров. Дальше нужно понять, на какие площадки сети ссылаются в вашей нише, и попасть туда. Исследование показывает эти домены под каждым ответом.

проверить свой бренд

Узнайте, что нейросети отвечают о вас

Первая оценка по вашему сайту занимает десять секунд: SEENGO соберёт вопросы клиентов и покажет, где бренд виден, а где отвечают конкурентами.

читать дальше

Узнайте, что нейросети говорят о вашей компании

Попробуйте бесплатно или оставьте заявку — покажем платформу на ваших данных. Разовая оценка — 5 900 ₽, подписка от 19 900 ₽, все цены открыты.