Когда Perplexity отвечает на ваш вопрос и внизу ставит четыре ссылки на источники — это работает RAG. Когда Алиса зачитывает один ответ вслух и он опирается на конкретные сайты — это тоже RAG. Аббревиатура расшифровывается как Retrieval-Augmented Generation, «генерация с дополненным поиском». Если вы занимаетесь маркетингом и хотите, чтобы нейросети упоминали вашу компанию, разобраться в RAG нужно раньше, чем в любых тактиках. Потому что от того, как устроен этот механизм, зависит, попадёте вы в ответ ИИ или нет.
Главное
- RAG — это связка «поисковик + языковая модель», а не одна нейросеть. Модель перед ответом ищет документы во внешней базе и отвечает по ним.
- Почти весь современный AI-поиск устроен так. Perplexity, ChatGPT с веб-поиском, Google AI Overviews, нейропоиск Алисы — это всё RAG-системы.
- Чтобы вас процитировали, нужно пройти два этапа. Сначала вас должны найти на шаге поиска, потом — удобно процитировать на шаге генерации.
- Оптимизация под ИИ (AEO/GEO) — это подстройка под RAG. Технический доступ, прямой ответ на поверхности, конкретика и свежесть решают, попадёте вы в ответ или нет.
- Дообучать модель под свою компанию не нужно и невозможно. У вас нет доступа к обучению ChatGPT или Алисы — а вот в их retrieval-корпус из открытого веба попасть можно.
RAG — это связка «поисковик + языковая модель», а не одна нейросеть
Коротко: RAG — это архитектура, в которой языковая модель перед ответом сначала ищет релевантные документы во внешней базе знаний, а потом генерирует ответ, опираясь на найденное. Термин ввела команда исследователей из Facebook AI (сейчас Meta) в статье 2020 года — авторы предложили дополнять генеративную модель модулем извлечения фактов из внешнего источника.
Обычная языковая модель без RAG обучена на огромном массиве текстов и хранит знания в своих весах — в памяти, зашитой на этапе обучения. У такой памяти два больных места. Первое — она устаревает: модель с обучением до 2024 года не знает, что случилось в 2026-м. Второе — она любит выдумывать: когда фактов не хватает, модель достраивает ответ правдоподобной ерундой, и это называют галлюцинациями.
Вместо того чтобы полагаться только на память, RAG на каждый запрос лезет в свежий внешний источник — веб-индекс, базу документов, справочник — вытаскивает подходящие куски и передаёт их модели вместе с вопросом. Модель отвечает уже не по памяти, а по документам, которые лежат прямо перед ней. Как студент, которому на экзамене разрешили открыть учебник на нужной странице.
Как это работает внутри: четыре шага от запроса до ответа
Когда вы задаёте вопрос нейропоиску, под капотом происходит следующее.
- Запрос превращается в вектор. Ваш вопрос прогоняют через модель-эмбеддер, которая переводит текст в набор чисел — координаты смысла. Похожие по смыслу фразы получают близкие координаты, даже если слова разные.
- Поиск по базе. Система сравнивает вектор запроса с векторами документов в базе (её называют векторной) и достаёт несколько самых близких фрагментов. Это и есть retrieval — извлечение.
- Сборка контекста. Найденные фрагменты подклеивают к вашему вопросу в один большой промпт. Получается инструкция вида «вот вопрос, вот выдержки из источников — ответь по ним».
- Генерация ответа. Языковая модель читает всё это и формулирует ответ, опираясь на переданные фрагменты. Хорошая RAG-система тут же проставляет ссылки на те источники, откуда взяла факты.

Весь путь занимает секунды, и пользователь видит только финал — связный ответ со сносками. Но для маркетолога важен второй шаг. Если ваш сайт не попал в базу и не был извлечён на шаге поиска, до генерации он просто не дойдёт. Нейросеть физически не сможет вас процитировать, потому что не будет держать вас перед глазами.
Как мы разбирали в тексте «Почему ИИ не видит ваш сайт», чаще всего компания выпадает именно на этом шаге — робот получает пустую страницу и добавить в базу нечего.
Почти весь современный AI-поиск — это RAG
Продукты, которыми люди пользуются каждый день, устроены одинаково — просто вслух про RAG говорят редко.
- Perplexity — поисковик, который так и построен: находит источники, отвечает по ним, показывает ссылки. Классический RAG в чистом виде.
- ChatGPT с веб-поиском — когда включён режим поиска, модель достаёт свежие страницы и отвечает по ним, а не по памяти.
- Google AI Overviews — те самые AI-ответы над выдачей Google подтягивают информацию из живого поискового индекса.
- Нейропоиск Алисы — по отчёту Ашманова «Поиск с Алисой», Алиса сначала ищет в органике Яндекса, берёт верхние результаты и уже по ним строит генеративный ответ. Попадание в ответ = попадание в топ органики плюс пригодность текста для цитирования.

Чтобы нейросеть вас упомянула, вашего контента должно хватать сразу на двух этапах. Сначала — чтобы вас нашли на шаге retrieval (это про индексацию и релевантность). Потом — чтобы вас удобно было процитировать на шаге генерации (это про то, как написан сам текст).
Почему RAG — это фундамент оптимизации под нейросети
Оптимизацию под ИИ-ответы называют по-разному: AEO (Answer Engine Optimization), GEO (Generative Engine Optimization). За модными аббревиатурами стоит ровно одна идея — подстроить сайт под то, как RAG вытаскивает и использует источники. Ahrefs в своём разборе прямо связывает видимость в AI-поиске с попаданием в retrieval-этап: нет вас в извлекаемом корпусе — нет и в ответе.
Из механики RAG вытекают вполне конкретные требования к контенту.
Вас должно быть легко найти технически. Если страница отдаётся только после выполнения JavaScript, а робот получает пустой HTML, ваш текст может не попасть в индекс, из которого RAG достаёт документы. Чистый серверный HTML, открытый доступ для AI-краулеров, аккуратная структура — это входной билет.
Ответ на вопрос должен лежать на поверхности. RAG вытаскивает фрагменты, а не весь сайт целиком. Если прямой ответ спрятан в середине длинного абзаца, шанс, что именно этот кусок извлекут и процитируют, падает. Поэтому в текстах под нейросети работает приём «сначала ответ, потом детали»: чёткий тезис в первом предложении раздела, подзаголовки-утверждения, короткие самодостаточные блоки.
Факты нужно подкреплять. Модель охотнее цитирует куски с конкретикой — цифрами, датами, именами, ссылками на первоисточник. Абстрактная вода на шаге генерации проигрывает фрагменту, где есть за что зацепиться. По этой же логике хорошо заходят структурированные данные и понятная разметка: они помогают машине разобрать, что перед ней.
Свежесть имеет цену. Раз RAG на каждый запрос лезет за актуальными документами, устаревшая страница проигрывает обновлённой. Регулярный рефреш помогает остаться в выдаче, из которой набирают контекст. Про то, как быстро ИИ забывает источник, мы писали отдельно — в разборе мифа о строчке в robots.txt видно, что технический доступ и актуальность решают больше, чем кажется.
Чем RAG отличается от дообучения модели
Частый вопрос: если нужно, чтобы ИИ знал про мою компанию, может, проще дообучить модель на своих данных? Это другой подход, и для задачи видимости он почти всегда лишний.

Дообучение (файн-тюнинг) меняет саму модель — долго, дорого, и результат живёт внутри одной конкретной модели. RAG ничего в модели не меняет: он просто подаёт свежие документы в момент запроса. Для бизнеса, который хочет попадать в ответы публичных нейросетей, файн-тюнинг вообще не вариант — вы не имеете доступа к обучению ChatGPT или Алисы. А вот в их retrieval-корпус попасть можно: он собирается из открытого веба. Именно поэтому работа над видимостью в ИИ — это работа с RAG, а не с обучением моделей. IBM в своём объяснении формулирует так же: RAG даёт модели доступ к актуальным внешним знаниям без переобучения.
Что делать с этим на практике
- Проверьте, что ваши ключевые страницы отдаются роботам как обычный HTML и открыты для AI-краулеров.
- Перепишите важные страницы под принцип «прямой ответ вперёд»: тезис — в начало раздела, детали — потом.
- Добавьте конкретику: цифры, даты, источники. Убирайте абстрактные формулировки, которые нечего цитировать.
- Следите, попадаете ли вы в топ органики по своим темам — для Алисы это прямой пропуск в ответ.
- Обновляйте материалы, а не бросайте их после публикации.
RAG звучит как термин для инженеров, но по сути это правила игры, по которым нейросети выбирают, кого показать пользователю. Понимаете механику — понимаете, за счёт чего одни компании попадают в ответы ИИ, а другие остаются невидимыми, хотя сайт у них вроде бы есть.