RAG (Retrieval-Augmented Generation) — архитектура, в которой генерация ответа LLM дополняется поиском информации в внешней базе знаний. Сначала система извлекает релевантные документы, затем передаёт их в контекст языковой модели для формирования финального ответа. Такой подход снижает вероятность ошибок и выдуманных фактов («галлюцинаций»), потому что модель опирается на актуальные данные. RAG используют, когда важно получать ответы с опорой на свежую и достоверную информацию.
Пример
В поисковике Bing с ИИ RAG ищет статьи и документы по запросу пользователя, а затем формирует итоговый ответ на основе найденных материалов.