Моя защита от prompt-injection пропустила 0 из 20 атак. Часть, которую я почти не стал строить, поймала их все

Разработчик Вишал Хабиб поделился опытом создания системы проверки для ИИ-советов по пенсионному планированию. Система использует код для проверки числовых фактов и LLM-«судей» для оценки нечислового контента. В ходе тестирования Хабиб обнаружил, что, хотя судьи были устойчивы, системе не хватало механизма для идентификации и маркировки атак через инъекции промптов. Он внедрил многоуровневую защиту, включая логику «fail-closed» и regex-фильтр. Однако второй раунд тестирования показал, что regex не смог поймать ни одной из 20 новых, замаскированных атак. В конечном итоге успех системы зависел от инструкции судьям рассматривать все черновики как ненадежные данные, а не полагаться на хрупкое сопоставление с шаблонами. Хабиб подчеркивает, что разработчики должны проверять, может ли их система явно распознать атаку, а не просто предполагать, что они защищены, если их не удалось обмануть.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Недавняя статья на Dev.to подчеркивает критическую уязвимость автономных ИИ-агентов: их неспособность осознавать последствия своих действий. В то врем…
Основатель агрегатора нейросетей BotHub делится наблюдениями о специализации современных языковых моделей. Несмотря на общую архитектуру трансформеров…
В недавней статье на Dev.to разработчик описывает создание FORGE, системы ИИ-агентов для выполнения исследовательских задач. Проект, на создание котор…



