Я попытался протащить четырех плохих агентов через свой собственный шлюз сертификации. Все четверо были заблокированы.

Разработчик Дебашиш Госал недавно протестировал надежность своей платформы HivePlane, попытавшись обойти ее системы безопасности с помощью четырех намеренно вредоносных ИИ-агентов. Эксперимент был направлен на моделирование реальных производственных сбоев, включая несертифицированных агентов, несанкционированную подмену моделей, регрессивное поведение и чрезмерное потребление бюджета. Каждый агент был успешно заблокирован средствами контроля доступа HivePlane, которые проверяют рабочие нагрузки на соответствие строгим требованиям аттестации перед выполнением. Госал подчеркивает, что тестирование безопасности должно выходить за рамки «счастливых путей» и включать негативные сценарии, проверяющие поведение агента, а не только качество вывода. Он утверждает, что эффективное управление ИИ требует блокировки в той точке, где вред становится измеримым. Статья служит важным напоминанием о том, что в производственной среде правдоподобно выглядящий агент может быть самым опасным, что требует строгих, автоматизированных процессов сертификации для предотвращения операционных и рисков безопасности.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Рекурсивное самосовершенствование: что на самом деле делает исследование Google Dream-RSI
Исследователи Google опубликовали работу Dream-RSI, посвященную рекурсивному самосовершенствованию ИИ. Хотя некоторые заголовки намекают на прорыв в о…
В статье на Habr рассматривается концепция «смысловых» эмбеддингов, которая расширяет возможности современных нейросетей. Автор предлагает метод, позв…
Автор представил обновленную версию архитектуры LSWM спустя всего два дня после первого релиза. В ходе повторного тестирования и экспериментов были вы…



