llms.txt и роботы ИИ: как открыть сайт для моделей
Языковые модели читают сайты своими роботами. Многие компании закрывают их по инерции, вместе со всем подозрительным трафиком, — и потом удивляются, почему их не упоминают в ответах. Разберём, как этим управлять осознанно.
llms.txt — короткий файл, где вы человеческим языком описываете, что за компания и где что лежит. Он не обязателен и ничего не гарантирует, но стоит десяти минут и помогает моделям не ошибиться. Важнее другое: не закрывайте роботов ИИ в robots.txt, если хотите попадать в их ответы.
В этой статье8 раздела
Кто ходит по вашему сайту
Помимо привычных роботов Google и Яндекса, по сайтам ходят роботы ИИ-сервисов. Они делятся на два типа, и это различие важно.
| Тип | Зачем ходит | Стоит ли пускать |
|---|---|---|
| Робот обучения | Собирает тексты для обучения моделей | Решать вам |
| Робот поиска в реальном времени | Читает страницу, чтобы ответить на вопрос человека сейчас | Обычно да |
Второй тип — тот, от которого зависит, назовут вас в ответе или нет. Закрыв его, вы гарантированно выпадаете из канала.
Частая ситуация: администратор закрыл в robots.txt всё незнакомое, включая роботов ИИ. Формально безопасно, фактически — добровольный отказ от растущего источника клиентов.
Как разрешить доступ
Управление идёт через тот же файл robots.txt, где вы указываете правила для обычных поисковиков. Роботам ИИ прописываются отдельные правила по их именам.
Основные, которые имеет смысл разрешить бизнесу: роботы OpenAI, Anthropic, Perplexity, а также расширенные роботы Google и Apple. Имена меняются, поэтому список стоит пересматривать раз в полгода.
- Разрешение прописывается явно — по имени робота с директивой Allow.
- Разрешать доступ к техническим папкам не нужно, только к содержательным страницам.
- Страницы с личными данными и служебные разделы закрываются, как и для обычных роботов.
Что такое llms.txt
Это молодой стандарт: текстовый файл в корне сайта, где компания в свободной, но структурированной форме описывает себя для языковых моделей. Что-то вроде краткой справки: чем занимаемся, какие услуги, какие цены, где находимся, куда вести за подробностями.
Формально его поддержка пока не гарантирована ни одним сервисом. Практически он стоит недорого — это один текстовый файл — и полезен как чёткий, непротиворечивый источник фактов о компании.
Что писать внутри
- Короткое описание компании: чем занимается, для кого, где работает.
- Ключевые факты для цитирования: направления, цены, сроки, города.
- Список основных страниц с пояснением, что на каждой.
- Честные ограничения: что вы не делаете и чего не гарантируете.
- Контакты.
Главное правило — те же факты, что на сайте. Файл не должен противоречить страницам, иначе он не помогает, а мешает.
Что ещё влияет на доступность сайта для моделей
- Содержимое должно быть в HTML. Если текст появляется только после выполнения скриптов, часть роботов его не увидит.
- Страница должна открываться быстро. Роботы ограничены по времени ожидания.
- Не должно быть блокировок по региону и агенту, если вы хотите, чтобы вас читали.
- Карта сайта помогает роботам находить страницы, а не только ходить по ссылкам.
Когда доступ стоит закрыть
Есть законные причины не пускать роботов обучения, и это нормальное решение.
- Уникальный платный контент, который вы продаёте.
- Авторские материалы, которые вы не хотите отдавать в обучение.
- Персональные данные пользователей — их вообще не должно быть в открытом доступе.
При этом роботов поиска в реальном времени обычно всё равно оставляют открытыми: они приводят людей, а не забирают тексты.
Как понять, что вы случайно закрылись
Ситуация встречается чаще, чем кажется: правило добавили давно, причину забыли, а канал молча не работает.
- Откройте свой robots.txt — он лежит по адресу вашсайт.ru/robots.txt.
- Найдите строки Disallow под именами роботов ИИ или под общим User-agent.
- Проверьте, не закрыт ли доступ на уровне сервера — по имени агента или по стране.
- Спросите у хостинга, не блокирует ли защита от ботов эти запросы.
Последний пункт — самая частая скрытая причина. Системы защиты от нежелательного трафика нередко блокируют роботов ИИ по умолчанию, и в файле robots.txt это никак не отражается.
Что писать в llms.txt: пример структуры
| Раздел | Что в нём |
|---|---|
| Заголовок | Название компании и одна строка о том, чем занимается |
| Ключевые факты | Направления, цены, сроки, города, форма собственности |
| Разделы сайта | Список главных страниц с пояснением, что на каждой |
| Ограничения | Что вы не делаете и чего не гарантируете |
| Контакты | Почта, мессенджер, адреса офисов |
Объём — одна-две страницы текста. Файл должен читаться человеком: если он понятен человеку, он понятен и модели.
Чего этот файл не делает
- Не заменяет содержание сайта: модель всё равно смотрит на страницы.
- Не гарантирует упоминание — это не заявка на включение в ответы.
- Не влияет на обычный поиск.
- Не защищает от использования текстов: для этого нужны технические ограничения, а не декларация.
Частые вопросы
Обязателен ли llms.txt?
Нет, это добровольный и молодой стандарт без гарантий поддержки. Но стоит он один файл, а пользы приносит достаточно, чтобы не отказываться.
Не украдут ли мой контент?
Тексты на открытом сайте и так доступны всем. Если материал ценен и продаётся — его надо закрывать авторизацией, а не надеяться на запрет роботам.
Как узнать, ходят ли ко мне роботы ИИ?
По логам сервера: там видны имена агентов. Если у вас нет доступа к логам, спросите хостинг — обычно такая статистика есть.
Влияет ли это на обычное SEO?
Разрешение роботам ИИ на позиции в Google и Яндексе не влияет. Это отдельный канал со своими правилами.
Замедляют ли роботы ИИ работу сайта?
На обычном сайте нагрузка незаметна. Если запросов слишком много, их частоту можно ограничить на стороне сервера, не блокируя полностью.
Нужно ли указывать llms.txt в robots.txt?
Не обязательно, файл ищут по стандартному адресу в корне. Но упомянуть его ссылкой не мешает — это не нарушает никаких правил.
Материалы отвечают на общие вопросы. Разберём именно вашу ситуацию — бесплатно и без обязательств.