Между вопросом пользователя в ChatGPT и появлением конкретного сайта в ответе стоит не один алгоритм, а целая цепочка технических решений: поиск документов, отбор лучших фрагментов, генерация текста и прикрепление источников. Разберём этот путь шаг за шагом, от запроса до цитаты, и покажем, на каком именно этапе решается, попадёт страница в ответ ИИ или нет.
Раздел 01
Что такое retrieval-augmented generation (RAG) в AEO и GEO-продвижении
RAG, retrieval-augmented generation, — это механизм, при котором модель сначала находит релевантные документы в реальном времени, а затем формирует ответ на их основе, а не полагается только на то, что «запомнила» во время обучения. Именно этот механизм делает AEO и GEO вообще возможными: без RAG у контента не было бы шанса попасть в свежий ответ модели, только у самой модели «в памяти».
Пайплайн состоит из шести последовательных шагов. Сначала запрос пользователя превращается в вектор для семантического поиска. Затем система ищет релевантные документы или их фрагменты в базе знаний. Из найденного отбирается ограниченное число лучших кандидатов, обычно от трёх до десяти. На основе этих кандидатов собирается новый контекст, который вместе с исходным вопросом передаётся модели. Модель генерирует ответ строго в границах этого контекста, а не «из памяти». В конце система прикрепляет ссылки к тем фрагментам, которые реально использовались при генерации.
| Без RAG | С RAG |
|---|---|
| Запрос → модель → синтезированный текст без источников | Запрос → поиск документов → топ фрагментов → модель → атрибуция → проверяемый ответ |
Поиск документов внутри RAG тоже устроен не одним способом. BM25 ищет по точному совпадению ключевых слов, векторный поиск ищет по смысловому сходству, а гибридный поиск сочетает оба метода и в продакшн-системах уже становится стандартом, потому что каждый метод по отдельности пропускает часть релевантных материалов.
Раздел 02
Что такое chunking и как он влияет на появление сайта в ответах ИИ
Chunking — это разбиение документа на фрагменты для индексирования и поиска. Модель никогда не оценивает страницу целиком, она работает с отдельными кусками текста размером примерно 300–600 токенов, и именно чанк, а не вся страница, становится единицей отбора.
Способ разбиения имеет значение. Разбиение по фиксированному числу токенов часто рвёт мысль посередине и плохо подходит для цитирования. Разбиение по абзацам работает приемлемо. Лучший вариант для цитируемости — разбиение по заголовкам, когда H2 и все абзацы под ним образуют один смысловой чанк. Между соседними чанками обычно оставляют нахлёст в 10–20% текста, чтобы факт не разрывался ровно на границе двух фрагментов, а у каждого чанка должны быть метаданные: источник, заголовок раздела, дата публикации.
Практический вывод для авторов: ключевой факт нельзя разбивать между двумя H2-разделами. Если цифра или вывод оказывается на стыке двух чанков, модель может увидеть только половину мысли и не процитировать её вообще, даже если на странице есть полный и точный ответ.
Раздел 03
Что такое Top-K фрагменты и как они влияют на появление страницы в ответах ИИ
Top-K — это количество лучших фрагментов, которые система передаёт модели после этапа поиска: три, пять, десять, в зависимости от настройки конкретного движка. Модель в принципе не видит всю базу целиком, только эти K кандидатов.
Здесь возникает жёсткая точка отсечения. Если релевантный факт технически существует на сайте, но при ранжировании попал, например, на шестую позицию, а K равно пяти, для конкретного ответа этот факт как будто не существует. Позиция внутри списка Top-K тоже важна: первый по релевантности фрагмент цитируется чаще, чем пятый, даже если оба формально прошли отбор. Слишком маленький K означает риск пропустить нужные факты, а слишком большой размывает внимание модели между избыточным числом фрагментов.
Раздел 04
Как AI выбирает источники и решает, кого цитировать
Система выбирает не сайт целиком и не домен по его авторитету, а конкретный фрагмент текста, который лучше прочих отвечает на вопрос и физически попадает в короткий список Top-K.
Здесь и обнаруживается не всегда очевидный эффект: авторитет домена сам по себе не гарантирует цитирование. Если у известной страницы высокий авторитет, но текст размытый и без чёткого прямого ответа, а у менее известной страницы есть плотный, самодостаточный фрагмент с конкретным ответом, модель с большей вероятностью процитирует именно второй источник, даже если по классическому SEO-ранжированию первая страница стоит выше. У LLM нет «любимых брендов», есть только плотные и релевантные фрагменты текста.
На финальное решение, попадёт ли конкретный чанк в ответ, влияют четыре фактора: сам факт попадания в Top-K (без этого никакого цитирования не будет вообще), позиция фрагмента внутри этого списка, плотность фактов в самом чанке и степень совпадения формулировок с запросом пользователя. Все четыре работают вместе, а не по отдельности.
Раздел 05
Как нейросети выбирают источники для ответов в России
Общий механизм retrieval один и тот же по сути, но реализация отличается от движка к движку, и для российского рынка это особенно заметно. Яндекс Нейро устроен иначе, чем ChatGPT или Perplexity, и использует собственную логику поиска и ранжирования источников, во многом опирающуюся на индекс самого Яндекса.
Это значит, что усреднять результат по всем платформам сразу, российским и международным, — методологическая ошибка, которая портит точность диагностики. Для отдельных ниш на российском рынке хорошо работающим источником цитирования оказывается vc.ru, что стоит учитывать при планировании дистрибуции контента, а не только публикаций на собственном сайте. Perplexity в целом строже относится к источникам и предпочитает первичные материалы с ссылками на исходные данные, а Google AI Overviews заметно наследует авторитет обычной органической выдачи Google, что также нужно учитывать отдельно от логики Яндекса.
Раздел 06
Что такое LLM-цитирование в AEO и GEO-продвижении
LLM-цитирование — это механизм атрибуции контента, использованного при генерации ответа: система явно указывает, откуда взят факт или формулировка, вместо того чтобы просто выдать текст без источников. Ключевой практический эффект в том, что пользователь получает возможность проверить достоверность ответа, а не полагаться исключительно на вероятностные предположения модели.
Для российского рынка это работает с той же механикой RAG и chunking, что описана выше, но с поправкой на то, какие движки в принципе доступны и популярны у аудитории: помимо международных ChatGPT, Perplexity, Gemini и Claude, отдельное значение имеет Яндекс Нейро. Полезно различать два состояния, которые легко перепутать: видимость, когда бренд просто упоминается в ответе, и цитирование, когда модель даёт прямую ссылку именно на ваш URL, а не на статью о вас на стороннем ресурсе.
Раздел 07
Какие элементы страницы наиболее критичны для машинной извлекаемости контента
Извлекаемость — это последнее из трёх «ворот» retrieval: даже технически доступная и релевантная запросу страница может не пройти этот этап, если из неё физически нельзя вытащить нужный фрагмент.
| Элемент страницы | Почему критичен |
|---|---|
| Аккордеоны и вкладки | Прячут текст от парсера до клика пользователя, чанк остаётся пустым |
| Тяжёлый JS-рендеринг | Может блокировать получение финального текста краулером |
| Ответ в изображении, а не в тексте | Текст внутри картинки не извлекается как текстовый чанк |
| Структура заголовков H2/H3 | Формирует границы чанка при heading-aware разбиении |
| Прямой ответ в первых 1–2 предложениях раздела | Увеличивает плотность факта в самом начале чанка |
| Таблицы и списки | Хорошо режутся на чанки и легко извлекаются целиком |
Формула agent-ready контента простая: страница должна быть доступной технически, структурированной по заголовкам, спискам и таблицам, и сформулированной как прямой ответ, а не как маркетинговый текст общего плана.
Раздел 08
Какие базовые требования к контенту для LLM-цитирования
Минимальный структурный порог, ниже которого статьи практически не цитируются в принципе: FAQ-блок, списки, хотя бы одна таблица сравнения или чек-лист, и объём от 1500 слов. Заголовки разделов в форме вопроса пользователя, а не просто тематические ярлыки, дают заметную прибавку к цитируемости, а таблица или чек-лист в ключевом разделе статьи работает похожим образом, потому что это идеальный формат для извлечения моделью.
Есть и не всегда очевидный нюанс. Простое количество фактов и цифр само по себе не спасает статью, если тема и площадка публикации выбраны неудачно, — факты без правильного контекста вокруг них не работают. И ещё один момент, который легко упустить: явное указание целевой аудитории прямо в заголовке скорее снижает цитируемость, чем повышает её, аудиторию стоит описывать в теле текста, а не выносить в H1.
Раздел 09
По каким метрикам измерять результат продвижения через ИИ
Главное — не путать общую видимость бренда с цитируемостью именно ваших страниц, это разные метрики с разной динамикой.
| Метрика | Что показывает |
|---|---|
| Visibility | Как часто бренд вообще упоминается в ответах AI-систем |
| Citation | Как часто AI даёт прямую ссылку именно на ваш URL |
| Citation supply chain | Откуда фактически берётся ссылка на бренд: с вашего сайта или со стороннего источника |
| Mention share vs citation share | Доля упоминаний бренда против доли ответов с цитатой именно вашего URL |
| Answer state | Текущее состояние по конкретному запросу: бренд отсутствует, упомянут, процитирован или рекомендован |
Замер стоит вести раздельно по каждой платформе, а не усреднять: ChatGPT, Gemini, Perplexity и Яндекс Нейро используют разную логику retrieval, и усреднённая цифра маскирует то, где реально есть прогресс, а где нет.
Раздел 10
Какие метрики указывают на ошибки после внедрения AEO/GEO и как их диагностировать
Если после начала работы с AEO и GEO видимых улучшений нет, обычно дело не в одной общей проблеме, а в одном из нескольких конкретных сценариев, и у каждого свой способ диагностики.
| Симптом | Вероятная причина | Что делать |
|---|---|---|
| Бренд вообще отсутствует в ответах | Нет чёткой страницы-ответа по теме или слабо описана сущность бренда | Создать или усилить каноническую страницу под конкретный вопрос |
| Бренд упомянут, но без ссылки на сайт | Утверждение есть, но источник не готов к цитированию | Собрать источник фактов, таблицу и FAQ вокруг клейма |
| Сторонний материал о бренде цитируется чаще собственного сайта | Каноничность контента размыта между площадками | Перенести основной материал на canonical-страницу, внешние публикации сделать явной адаптацией со ссылкой на неё |
| В ответах чаще рекомендуют конкурента | Нет собственного сравнения или кейса под этот сценарий использования | Опубликовать сравнение или кейс с проверяемыми доказательствами |
Отдельно стоит проверять, не является ли просадка результатом изменения самой методики замера: например, добавления новой платформы в панель, из-за которого сравнение с прошлым периодом становится некорректным, а не реальным падением видимости.
Раздел 11
FAQ
Что физически происходит между вопросом пользователя и появлением сайта в ответе ИИ?
Запрос превращается в вектор, система ищет релевантные документы, отбирает ограниченное число лучших фрагментов, собирает из них контекст, генерирует ответ в границах этого контекста и в конце прикрепляет источники к использованным фрагментам. Это и есть механизм retrieval-augmented generation.
Почему высокий авторитет домена не гарантирует цитирование?
Модель выбирает не домен целиком, а конкретный фрагмент текста внутри Top-K. Если у авторитетной страницы текст размытый, а у менее известной есть плотный прямой ответ на вопрос, процитирован с большей вероятностью будет именно второй источник.
Что такое Top-K и почему это важно для видимости сайта?
Top-K — это ограниченное число лучших фрагментов, которые модель вообще видит после этапа поиска. Если факт технически есть на сайте, но не попал в этот короткий список, для конкретного ответа он не существует, независимо от качества остального контента страницы.
Чем видимость бренда отличается от цитируемости?
Видимость — это когда бренд просто упоминается в ответе AI-системы. Цитируемость — это когда модель даёт прямую ссылку именно на ваш URL, а не на стороннюю статью о вас. Можно иметь высокую видимость и низкую цитируемость собственных страниц одновременно.
Как понять, что пошло не так, если после работы с AEO/GEO результата нет?
Стоит проверить конкретный сценарий: бренд вообще отсутствует в ответах, упомянут без ссылки, или сторонний материал цитируется чаще собственного сайта. У каждого сценария своя причина и свой способ починки, а не одно универсальное решение.
Нужно ли по-разному настраивать стратегию под Яндекс Нейро и международные движки?
Да. Яндекс Нейро использует собственную логику поиска и ранжирования, отличную от ChatGPT или Perplexity, и усреднять результат по всем платформам сразу — распространённая ошибка, которая портит точность диагностики именно для российского рынка.
Для вашей команды
Хватит нанимать агентства и фрилансеров
Нанимайте не агентства и фрилансеров — а Marketing AI-агентов под AI-поиск.
- Карта цитирований по 9 нейросетям
- Контент и schema, которые зарабатывают цитирование
- Честный 30-минутный звонок до оплаты
Цитируемся в
- ChatGPT
- Claude
- Perplexity
- Gemini
- Grok
- DeepSeek
- Kimi
- Google AIO
- Copilot