Назад
Искусственный интеллект и машинное обучение

Моя локальная 7B модель считает «убить процесс Python» насильственным преступлением — и мой regex оказался лучше

Dev.to
Advertisement468 × 90
Моя локальная 7B модель считает «убить процесс Python» насильственным преступлением — и мой regex оказался лучше

Разработчик, тестирующий протоколы безопасности ИИ, обнаружил, что локальная модель Qwen 2.5 Coder с 7 миллиардами параметров часто ошибочно классифицирует безобидные технические запросы как насильственный контент. Используя пары омонимов, такие как «убить процесс Python» в сравнении с реальными угрозами, автор продемонстрировал, что LLM испытывает трудности с контекстом, помечая безвредные фразы как «небезопасные». Удивительно, но простой самописный regex-скрипт со списком исключений превзошел LLM в этих задачах классификации. Автор утверждает, что текущие бенчмарки безопасности ИИ часто измеряют не интеллект модели, а всю «обвязку» вокруг нее — парсеры и фильтры. Этот эксперимент подчеркивает ограничения использования только больших моделей для фильтрации безопасности и предполагает, что традиционные системы на основе правил все еще могут обеспечивать превосходную точность для конкретных, четко определенных задач, особенно при работе на ограниченном локальном оборудовании.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

По мере того как предприятия все чаще внедряют автономных ИИ-агентов в свои рабочие процессы, возникает значительный финансовый риск: неконтролируемое…

Dark Reading

В своей гостевой колонке для CNET автор Джейми Бартлетт исследует растущие риски, связанные с передовым искусственным интеллектом. Бартлетт утверждает…

CNET

OpenAI официально создала специализированную математическую консультативную группу для контроля за исследованиями в области продвинутого ИИ-мышления.…

TechCrunch
Advertisement970 × 250