Я протестировал 36 ИИ-моделей на наличие фейковых пакетов и не нашел ни одного

Разработчик Аариш Мансур выпустил инструмент для бенчмаркинга, предназначенный для оценки того, как часто ИИ-модели выдумывают несуществующие программные пакеты. Бенчмарк под названием «hallucinated-packages» анализирует код, сгенерированный LLM, сверяя импортированные библиотеки с актуальными реестрами PyPI и npm. В ходе первоначального тестирования 36 моделей, включая различные версии Claude, Gemini и GPT, автор зафиксировал 0% уровень галлюцинаций в именах пакетов, что говорит о высокой надежности моделей при идентификации существующих библиотек. Однако последующий пилотный проект (версия 7) ввел более строгие проверки, включая поиск несуществующих функций внутри реальных пакетов. Эта итерация показала, что, хотя модели часто избегают фейковых пакетов, они нередко выдумывают вызовы функций в легитимных библиотеках. Автор подчеркивает, что простых проверок по реестру недостаточно для комплексного бенчмаркинга, и призывает сообщество использовать эти инструменты для дальнейшего тестирования надежности моделей в реальных сценариях разработки.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Могут ли «суперразум» и необязательный пакт о безопасности решить имиджевые проблемы ИИ?
В недавнем выпуске подкаста Equity обсуждались попытки администрации Трампа провести ребрендинг искусственного интеллекта. Поскольку отрасль сталкивае…
Разработчик создал ИИ-«надзирателя» для разрешения споров между соседями по общежитию
Чтобы решить проблему постоянных конфликтов из-за бронирования корта для бадминтона, разработчик Ачинтья Сингх создал «Hostel Nexus» — систему разреше…
Разработчик создал ИИ-детектор мошенничества для семьи на базе открытой модели Gemma
Разработчик создал инструмент с открытым исходным кодом «Chithi», предназначенный для защиты родственников, не владеющих английским языком, от финансо…



