me_edu
AI Security и Red Team: prompt injection, model abuse и защита LLM-приложенийШаг 9 из 13 · 0% пройдено
Threat model LLM-приложения

Prompt injection

Шаг 9 из 1310 минТеория
Цель

Понять основной механизм темы «Prompt injection» без заучивания отдельных терминов.

Как работать

Прочитайте блок один раз целиком, затем вернитесь к схеме или примеру и перескажите идею своими словами.

Критерий

Сформулированное правило, пример применения и одно ограничение метода.

PROCESS DIAGRAM1untrusted text2retrieval3model4tool request5policy check6safe action
Prompt injection: недоверенный текст не должен становиться командой для инструментов
Опорная идея

Prompt injection опасен тем, что вредная инструкция приходит не только от пользователя, но и из документа, сайта, письма или тикета, который читает модель. Если приложение доверяет retrieved text как системной инструкции, атакующий может заставить его раскрыть данные или вызвать tool.

Защита строится слоями: разделение инструкций и данных, source isolation, output validation, tool permissions, citations and refusal policy.

Назад

Обсуждение

Войдите, чтобы участвовать в обсуждении.

Пока нет сообщений.