Тест-драйв GigaChat 3.5: оценка возможностей модели в бизнес-задачах

Модель GigaChat 3.5, выпущенная в июле и ставшая доступной с открытыми весами в сентябре, стала объектом масштабного тестирования. Авторы статьи провели сравнительный анализ производительности этой модели в реальных бизнес-кейсах, используя собственный бенчмарк для оценки работы ИИ-агентов. В ходе исследования возможности GigaChat 3.5 сопоставлялись с актуальными российскими и китайскими аналогами. Целью тестирования было определить пригодность модели для решения прикладных задач в корпоративной среде. Результаты «забегов» ИИ-агентов позволяют оценить конкурентоспособность отечественной разработки на фоне глобальных трендов в области больших языковых моделей. Подробные данные о производительности, точности и эффективности выполнения специфических задач представлены в полном тексте исследования, доступном по ссылке.
This is a summary. Read the full article at the original source:
HabrПохожие
700 рукописей, 48 часов, три отзыва. Верификатор победил.
OpenAI недавно опубликовала обширный репозиторий, содержащий более 700 математических доказательств, сгенерированных внутренней моделью ИИ, пообещав с…
Co-op Legal Services столкнулась с критикой из-за внедрения ИИ-слежки за сотрудниками
Компания Co-op Legal Services внедрила систему мониторинга на базе искусственного интеллекта, которая записывает и оценивает все телефонные разговоры…
Беженцы в Кении сталкиваются с падением доходов и нестабильностью из-за автоматизации начальных задач ИИ
Беженцы в лагере Какума в Кении, долгое время зависевшие от цифровой микроработы, такой как аннотирование данных и транскрипция, столкнулись с серьезн…



