Назад
Искусственный интеллект и машинное обучение

Моя защита от prompt-injection пропустила 0 из 20 атак. Часть, которую я почти не стал строить, поймала их все

Dev.to
Advertisement468 × 90
Моя защита от prompt-injection пропустила 0 из 20 атак. Часть, которую я почти не стал строить, поймала их все

Разработчик Вишал Хабиб поделился опытом создания системы проверки для ИИ-советов по пенсионному планированию. Система использует код для проверки числовых фактов и LLM-«судей» для оценки нечислового контента. В ходе тестирования Хабиб обнаружил, что, хотя судьи были устойчивы, системе не хватало механизма для идентификации и маркировки атак через инъекции промптов. Он внедрил многоуровневую защиту, включая логику «fail-closed» и regex-фильтр. Однако второй раунд тестирования показал, что regex не смог поймать ни одной из 20 новых, замаскированных атак. В конечном итоге успех системы зависел от инструкции судьям рассматривать все черновики как ненадежные данные, а не полагаться на хрупкое сопоставление с шаблонами. Хабиб подчеркивает, что разработчики должны проверять, может ли их система явно распознать атаку, а не просто предполагать, что они защищены, если их не удалось обмануть.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Advertisement970 × 250