Опорная идея
Prompt injection опасен тем, что вредная инструкция приходит не только от пользователя, но и из документа, сайта, письма или тикета, который читает модель. Если приложение доверяет retrieved text как системной инструкции, атакующий может заставить его раскрыть данные или вызвать tool.
Защита строится слоями: разделение инструкций и данных, source isolation, output validation, tool permissions, citations and refusal policy.