Прогон приложения набором атак: подмена инструкции, скрытая команда в загруженном документе, выманивание системного промпта, злоупотребление инструментами агента, вывод данных, которых пользователь видеть не должен.
Защита переносится из формулировок системного промпта в права инструментов, разметку недоверенного текста и регулярный прогон атак.

Приложение с языковой моделью ломается не так, как обычное: вредоносная инструкция приходит не от пользователя, а из документа, письма или ответа стороннего сервиса — модель читает это как текст и исполняет как команду. Обычный пентест такого не видит: уязвимости в коде здесь нет.
Защита строится снаружи модели, а не внутри промпта: инструкция и данные приходят одним текстом, и никакая разметка внутри промпта не отделит одно от другого — её модель тоже прочитает как текст.
Заказчик получает набор атак, привязанный к своему приложению, урезанные права инструментов и порядок повторной проверки при обновлении модели.