Моя локальная 7B модель считает «убить процесс Python» насильственным преступлением — и мой regex оказался лучше

Разработчик, тестирующий протоколы безопасности ИИ, обнаружил, что локальная модель Qwen 2.5 Coder с 7 миллиардами параметров часто ошибочно классифицирует безобидные технические запросы как насильственный контент. Используя пары омонимов, такие как «убить процесс Python» в сравнении с реальными угрозами, автор продемонстрировал, что LLM испытывает трудности с контекстом, помечая безвредные фразы как «небезопасные». Удивительно, но простой самописный regex-скрипт со списком исключений превзошел LLM в этих задачах классификации. Автор утверждает, что текущие бенчмарки безопасности ИИ часто измеряют не интеллект модели, а всю «обвязку» вокруг нее — парсеры и фильтры. Этот эксперимент подчеркивает ограничения использования только больших моделей для фильтрации безопасности и предполагает, что традиционные системы на основе правил все еще могут обеспечивать превосходную точность для конкретных, четко определенных задач, особенно при работе на ограниченном локальном оборудовании.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Как ИИ-агенты могут привести к неконтролируемым расходам для предприятий
По мере того как предприятия все чаще внедряют автономных ИИ-агентов в свои рабочие процессы, возникает значительный финансовый риск: неконтролируемое…
Чтобы остановить неконтролируемые угрозы ИИ, нужно больше, чем просто разговоры о P(doom)
В своей гостевой колонке для CNET автор Джейми Бартлетт исследует растущие риски, связанные с передовым искусственным интеллектом. Бартлетт утверждает…
OpenAI формирует математическую консультативную группу, так как её ИИ решил более 100 открытых задач
OpenAI официально создала специализированную математическую консультативную группу для контроля за исследованиями в области продвинутого ИИ-мышления.…



