Retrieval augmented generation нужен, когда ответ должен опираться на конкретную базу знаний: документы компании, инструкции, учебники, регламенты. Документы разбивают на chunks, превращают в embeddings, сохраняют в vector store и по запросу достают наиболее близкие фрагменты. Затем модель получает не «всё знание мира», а релевантный контекст.
Качество RAG зависит от скучных инженерных решений: размер фрагмента, overlap, очистка HTML/PDF, метаданные, фильтры доступа, reranking, цитирование и регулярное переиндексирование. Хороший RAG умеет сказать: «в источниках нет ответа», а не уверенно выдумывать.