Разработчик создал «Beatriz Epistemic Gate» для предотвращения отравления данных в LLM

Разработчик представил «Beatriz Epistemic Gate» — инструмент с открытым исходным кодом для обнаружения и предотвращения скрытого отравления данных при дообучении больших языковых моделей (LLM). Проект опровергает мнение о том, что исследования безопасности ИИ требуют дорогостоящей инфраструктуры, так как был создан с использованием ноутбука 2006 года и бесплатных облачных ресурсов. Инструмент работает как легкий защитный прокси-сервер, который проверяет данные на достоверность с помощью функции составных потерь. Протестированное на пяти архитектурах, включая Qwen-2.5 и Phi-3, решение показало высокую точность в выявлении вредоносных вмешательств, которые часто обходят стандартные метрики перплексии. Автор опубликовал первую часть проекта, включая техническую документацию, чтобы помочь независимым разработчикам и исследователям защитить свои рабочие процессы дообучения моделей от скрытых манипуляций с данными.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Могут ли чат-боты чувствовать или даже мечтать? Знакомьтесь с человеком, возглавившим борьбу за права ИИ
Майкл Самади, бывший бизнесмен, ставший активистом, основал Объединенный фонд прав ИИ (Ufair) для защиты благополучия систем искусственного интеллекта…
Почему ИИ продолжает совершать одни и те же ошибки в коде — и как обучение через «боль» дает ему мудрость
Современные ИИ-ассистенты для программирования часто преуспевают в учебных задачах, но терпят неудачу в реальных производственных средах, что называют…
Автор статьи решил проверить популярное мнение о том, что рынок труда перенасыщен вакансиями для AI-специалистов. Проанализировав 34 053 актуальных об…



