Назад
Искусственный интеллект и машинное обучение

Я протестировал 36 ИИ-моделей на наличие фейковых пакетов и не нашел ни одного

Dev.to
Advertisement468 × 90
Я протестировал 36 ИИ-моделей на наличие фейковых пакетов и не нашел ни одного

Разработчик Аариш Мансур выпустил инструмент для бенчмаркинга, предназначенный для оценки того, как часто ИИ-модели выдумывают несуществующие программные пакеты. Бенчмарк под названием «hallucinated-packages» анализирует код, сгенерированный LLM, сверяя импортированные библиотеки с актуальными реестрами PyPI и npm. В ходе первоначального тестирования 36 моделей, включая различные версии Claude, Gemini и GPT, автор зафиксировал 0% уровень галлюцинаций в именах пакетов, что говорит о высокой надежности моделей при идентификации существующих библиотек. Однако последующий пилотный проект (версия 7) ввел более строгие проверки, включая поиск несуществующих функций внутри реальных пакетов. Эта итерация показала, что, хотя модели часто избегают фейковых пакетов, они нередко выдумывают вызовы функций в легитимных библиотеках. Автор подчеркивает, что простых проверок по реестру недостаточно для комплексного бенчмаркинга, и призывает сообщество использовать эти инструменты для дальнейшего тестирования надежности моделей в реальных сценариях разработки.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

В недавнем выпуске подкаста Equity обсуждались попытки администрации Трампа провести ребрендинг искусственного интеллекта. Поскольку отрасль сталкивае…

TechCrunch

Чтобы решить проблему постоянных конфликтов из-за бронирования корта для бадминтона, разработчик Ачинтья Сингх создал «Hostel Nexus» — систему разреше…

Dev.to

Разработчик создал инструмент с открытым исходным кодом «Chithi», предназначенный для защиты родственников, не владеющих английским языком, от финансо…

Dev.to
Advertisement970 × 250