TypeSafe Jev сыграл в шахматы — и оказался рядом с моделями рассуждения

Разработчик Максим Саплин интегрировал модель Jev от TypeSafe в свою таблицу лидеров LLM Chess, чтобы протестировать её производительность в сравнении с традиционными чат-ботами. В отличие от стандартных моделей, генерирующих свободный текст, Jev — это модель типа «System One», предназначенная для структурированных задач классификации, где она выбирает из заданного набора вариантов. Рассматривая шахматные ходы как задачу классификации, Саплин успешно позволил Jev играть полноценные партии. Результаты оказались впечатляющими: Jev достиг рейтинга Elo, сопоставимого с моделями среднего уровня рассуждения, будучи при этом значительно быстрее и дешевле (стоимость игры составила всего $0.0015). Хотя Jev испытывает трудности с генеративными задачами, его эффективность в принятии решений делает его мощным инструментом для структурированных агентных систем. Эксперимент доказывает, что специализированные модели могут конкурировать с более крупными системами, предлагая высокую производительность для автоматизированных процессов принятия решений.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Как ИИ-агенты могут привести к неконтролируемым расходам для предприятий
По мере того как предприятия все чаще внедряют автономных ИИ-агентов в свои рабочие процессы, возникает значительный финансовый риск: неконтролируемое…
Чтобы остановить неконтролируемые угрозы ИИ, нужно больше, чем просто разговоры о P(doom)
В своей гостевой колонке для CNET автор Джейми Бартлетт исследует растущие риски, связанные с передовым искусственным интеллектом. Бартлетт утверждает…
OpenAI формирует математическую консультативную группу, так как её ИИ решил более 100 открытых задач
OpenAI официально создала специализированную математическую консультативную группу для контроля за исследованиями в области продвинутого ИИ-мышления.…



