Я создал две агентные системы. Каждая из них доказала ошибочность другой

Разработчик Дебашиш Госал делится результатами создания двух различных агентных систем на базе LLM, приходя к выводу, что полагаться на промпты в вопросах безопасности — фундаментальная ошибка. В своих проектах 'PlannerCritic' и 'AdversarialDebate' Госал пытался решить поведенческие проблемы с помощью промпт-инжиниринга, например, давая моделям инструкции быть 'состязательными' или 'независимыми'. Оба подхода провалились, приведя к ненадежным вердиктам и 'театральным' результатам. Госал обнаружил, что решением для обеих систем стал перенос границ безопасности из промптов в детерминированный код. Внедряя структурные инварианты, такие как программные контракты строгости и механическая изоляция, он добился гораздо более надежных результатов. Автор утверждает, что, поскольку LLM по своей природе недетерминированы, разработчикам следует прекратить попытки сделать их надежными через промпты и вместо этого строить архитектуры, где вывод модели не влияет на ключевые границы безопасности системы.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Mistral AI привлекла €3 млрд под руководством Samsung: насколько это суверенно?
Парижская компания Mistral AI привлекла €3 млрд в рамках раунда финансирования серии D, в результате чего ее оценка превысила €21 млрд. Раунд, возглав…
Автор статьи анализирует текущий ажиотаж вокруг инструментов генеративного искусственного интеллекта в разработке программного обеспечения. В тексте п…
Engram — это сэмплер, превращающий «галлюцинации» ИИ в музыку
Музыкальный стартап Thoughtful Things запустил кампанию на Kickstarter для Engram, инновационного сэмплера и грувбокса, который интегрирует искусствен…



