Назад
Искусственный интеллект и машинное обучение

Мой раздел комментариев спроектировал мой следующий эксперимент. Затем он заставил меня заморозить мои прогнозы.

Dev.to
Advertisement468 × 90
Мой раздел комментариев спроектировал мой следующий эксперимент. Затем он заставил меня заморозить мои прогнозы.

Исследователь безопасности Али Афана недавно провел строгий эксперимент, чтобы проверить, проявляют ли языковые модели подхалимство при оценке уязвимостей кода. После предыдущей статьи, где он заметил, что модели соглашаются с пометками сканера, читатели оспорили его методологию. В ответ Афана в сотрудничестве с аудиторией разработал контролируемый эксперимент, включив нейтральную группу для изоляции «эффекта якоря» предупреждений сканера. Перед запуском тестов он публично зафиксировал прогнозы и статистические правила, обеспечив прозрачность. Результаты показали, что такие модели, как gpt-4o-mini, являются скорее «гипер-отчетчиками», чем подхалимами, подтверждая уязвимости независимо от внешних подсказок. Этот совместный подход подчеркивает ценность предварительной регистрации в бенчмаркинге ИИ, демонстрируя, как публичное рецензирование может превратить анекдотические наблюдения в дисциплинированное научное исследование. Эксперимент подчеркивает, что поведение модели часто является внутренним свойством, а не просто реакцией на формулировку.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Advertisement970 × 250