
В недавнем эксперименте разработчик Бен Гринберг сравнил производительность Jev, специализированной модели для структурированных решений, с Claude Sonnet в реальном рабочем процессе оценки проектов. Задача заключалась в проверке заявок на соответствие определенной политике, требуя выбора между «удовлетворено», «не удовлетворено» или «недостаточно доказательств». Хотя обе модели показали высокую точность, Jev продемонстрировала значительные преимущества в эффективности и надежности. Jev работала примерно в 50 раз дешевле Claude и была почти в десять раз быстрее. Важно отметить, что показатели уверенности Jev оказались более эффективными для выявления неоднозначных случаев, что позволило сделать автоматизацию более безопасной. Исследование показывает, что, хотя генеративные LLM превосходны в творческих задачах, специализированные модели «System One», такие как Jev, предлагают превосходную производительность и экономичность для ограниченного принятия решений. Автор делает вывод, что будущее рабочих процессов ИИ, вероятно, связано с гибридным подходом, использующим разные типы моделей в зависимости от конкретных задач.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Как ИИ-агенты могут привести к неконтролируемым расходам для предприятий
По мере того как предприятия все чаще внедряют автономных ИИ-агентов в свои рабочие процессы, возникает значительный финансовый риск: неконтролируемое…
Чтобы остановить неконтролируемые угрозы ИИ, нужно больше, чем просто разговоры о P(doom)
В своей гостевой колонке для CNET автор Джейми Бартлетт исследует растущие риски, связанные с передовым искусственным интеллектом. Бартлетт утверждает…
OpenAI формирует математическую консультативную группу, так как её ИИ решил более 100 открытых задач
OpenAI официально создала специализированную математическую консультативную группу для контроля за исследованиями в области продвинутого ИИ-мышления.…



