Назад
Искусственный интеллект и машинное обучение

Real-SWE: Тестирование моделей ИИ на закрытых корпоративных кодовых базах

Hacker News (YC)
Advertisement468 × 90

Разработчики Real-SWE представили новый инструмент для оценки производительности моделей ИИ на закрытых, реальных корпоративных кодовых базах. В отличие от существующих бенчмарков, которые часто полагаются на публичные репозитории или синтетические задачи, Real-SWE фокусируется на сложностях, присущих крупномасштабным проприетарным программным средам. Тестируя модели на реальном корпоративном коде, платформа стремится обеспечить более точную оценку того, как ИИ-ассистенты справляются с задачами в профессиональных процессах разработки ПО. Инициатива устраняет критический пробел в текущей системе оценки ИИ, где модели часто сталкиваются с трудностями из-за нюансов, зависимостей и ограничений безопасности, характерных для корпоративной среды. Этот инструмент предлагает разработчикам и компаниям прозрачный способ измерения практической пользы ИИ-агентов для написания кода перед их внедрением в рабочие процессы, что способствует развитию более надежных и контекстно-зависимых инструментов для программирования.

This is a summary. Read the full article at the original source:

Hacker News (YC)
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Генеральный директор OpenAI Сэм Альтман официально опроверг слухи о возможном первичном публичном размещении акций (IPO) компании в 2026 году. В недав…

The Verge

Автор статьи представил расширение для Google Chrome, которое позволяет ИИ-агентам взаимодействовать с браузером напрямую через accessibility-дерево.…

Habr
Advertisement970 × 250