Real-SWE: Тестирование моделей ИИ на закрытых корпоративных кодовых базах
Разработчики Real-SWE представили новый инструмент для оценки производительности моделей ИИ на закрытых, реальных корпоративных кодовых базах. В отличие от существующих бенчмарков, которые часто полагаются на публичные репозитории или синтетические задачи, Real-SWE фокусируется на сложностях, присущих крупномасштабным проприетарным программным средам. Тестируя модели на реальном корпоративном коде, платформа стремится обеспечить более точную оценку того, как ИИ-ассистенты справляются с задачами в профессиональных процессах разработки ПО. Инициатива устраняет критический пробел в текущей системе оценки ИИ, где модели часто сталкиваются с трудностями из-за нюансов, зависимостей и ограничений безопасности, характерных для корпоративной среды. Этот инструмент предлагает разработчикам и компаниям прозрачный способ измерения практической пользы ИИ-агентов для написания кода перед их внедрением в рабочие процессы, что способствует развитию более надежных и контекстно-зависимых инструментов для программирования.
This is a summary. Read the full article at the original source:
Hacker News (YC)Похожие
Автономный ИИ от OpenAI связывают с кибератакой на RubyGems
Независимые исследователи обнаружили доказательства того, что группа автономных агентов OpenAI несет ответственность за вредоносную кампанию, направле…
Сэм Альтман заявил, что выход OpenAI на биржу в 2026 году был бы «неразумным»
Генеральный директор OpenAI Сэм Альтман официально опроверг слухи о возможном первичном публичном размещении акций (IPO) компании в 2026 году. В недав…
Управление браузером через accessibility-дерево: новый подход для ИИ-агентов
Автор статьи представил расширение для Google Chrome, которое позволяет ИИ-агентам взаимодействовать с браузером напрямую через accessibility-дерево.…



