llms.txt, разметка и robots: что нейросети читают на сайте
Нейросеть не читает сайт глазами. Она забирает текст, разметку и служебные файлы — и если на этом уровне беспорядок, никакие тексты не помогут. Разбираем, что именно проверить в технической части.

Как нейросеть видит ваш сайт
Разница между человеком и роботом ИИ простая. Человек открывает страницу, ждёт загрузки, смотрит на картинки, понимает по оформлению, где цена, а где меню. Робот забирает исходный текст страницы, служебные заголовки и разметку — и всё. Оформление для него не существует.
Из этого следуют все практические выводы. Цена, нарисованная на баннере, для нейросети не существует. Преимущества, разложенные по иконкам без подписей, — тоже. А вот понятный текст с прямым утверждением и разметкой она заберёт целиком.
Шаг первый: пустить роботов
Бывает обидно: компания вкладывается в контент, а её сайт технически закрыт от тех, для кого он писался. У краулеров нейросетей свои имена, и часть сайтов блокирует их по инерции — вместе с парсерами и ботами.
Проверьте файл robots.txt на запреты для роботов, собирающих данные для ИИ, и посмотрите, не режет ли их защита от ботов на уровне сервера. Заодно убедитесь, что содержимое страницы отдаётся сразу, а не подгружается скриптом после открытия: часть роботов не ждёт.
Решение здесь осознанное, а не автоматическое. Если вы принципиально не хотите, чтобы ваши тексты использовали для обучения, доступ можно и закрыть — но тогда не ждите упоминаний в ответах.
Разметка Schema.org: факты без догадок
Разметка — это способ сказать машине прямо: вот организация, вот её телефон, вот услуга, вот её цена, вот вопрос и вот ответ на него. Без неё нейросеть вынуждена догадываться по тексту и иногда ошибается.
Минимальный набор, который стоит иметь почти любому сайту:
| Что размечаем | Зачем |
|---|---|
| Организация | Название, телефон, почта, адрес, регион работы, ссылки на профили |
| Услуга | Что вы оказываете, для кого, с какими условиями |
| Вопросы и ответы | Готовые пары «вопрос — ответ», которые удобно цитировать |
| Товар | Цена, наличие, характеристики — для магазинов обязательно |
| Хлебные крошки | Понимание, где страница находится в структуре сайта |
Важный нюанс: разметка должна совпадать с тем, что видит человек. Если в разметке одна цена, а на странице другая, это не хитрость, а ошибка — и поиск, и нейросети такое замечают.
Что такое llms.txt
Это текстовый файл в корне сайта, где коротко и однозначно написано, что за компания, чем занимается и где что лежит. По смыслу — как robots.txt, только не про запреты, а про содержание.
Стандартом он пока не стал, и ни одна нейросеть не обязана его читать. Но делается он за час, весит килобайты и ничему не мешает. Мы ставим его всем проектам по принципу «дёшево и может пригодиться».
Что писать внутри: абзац о компании простым языком, список ключевых разделов со ссылками и короткие ответы на самые частые вопросы. Без маркетинга и превосходных степеней — файл читает машина, на неё эпитеты не действуют.
Структура страницы под машинное чтение
Есть формат, который нейросети берут охотнее всего: вопрос в подзаголовке, прямой ответ в первом же предложении под ним, дальше подробности. Такой фрагмент можно процитировать целиком, не рискуя вырвать мысль из контекста.
Отсюда несколько практических правил:
- Подзаголовки формулируйте как вопросы клиента, а не как рубрики.
- Первое предложение после подзаголовка — законченный ответ, а не подводка.
- Конкретика вместо оценок: «от 15 рабочих дней» вместо «в короткие сроки».
- Важные цифры — в текст, а не только в таблицу-картинку.
Побочный эффект приятный: такие страницы удобнее читать и людям. Формат «сначала ответ» экономит время всем.
Скорость и доступность
Роботы не бесконечно терпеливы. Если сервер отвечает долго, часть страниц просто не будет обойдена. Здесь работают те же вещи, что и для обычного поиска: адекватное время ответа, сжатые изображения, отсутствие лишних редиректов.
Отдельно проверьте, что важные страницы не закрыты случайно — ни в robots.txt, ни метатегом, ни авторизацией. Мы регулярно находим сайты, где половина услуг недоступна роботам по недосмотру, оставшемуся с этапа разработки.
В каком порядке это делать
Если начинать с нуля, разумная очерёдность такая. Сначала доступ: убедиться, что сайт вообще читают. Потом факты о компании и разметка организации — это основа, на которую опирается всё остальное. Затем разметка услуг и вопросов. И только потом llms.txt и тонкая настройка.
Вся эта работа делается один раз и дальше живёт сама. Обновлять её нужно, когда меняются цены, услуги или контакты, — то есть примерно тогда же, когда вы обновляете сайт для людей.
Разберём вашу ситуацию и скажем, что даст результат быстрее всего. Без обязательств.
















