Мы провели аудит 110 инструментов для отслеживания использования ИИ. Вот где кроются ошибки в расчетах.

Недавний аудит 110 инструментов с открытым исходным кодом для отслеживания использования ИИ выявил серьезные неточности в том, как измеряется и тарифицируется потребление ИИ. Исследование обнаружило 45 подтвержденных ошибок в пяти повторяющихся категориях, включая устаревшие таблицы цен, неверные коэффициенты кэширования и некорректную агрегацию потоков, приводящую к двойному учету. Исследователи выяснили, что некоторые инструменты ошибочно принимают отсутствующие данные за ноль, что фактически приводит к несанкционированным скидкам, в то время как другие страдают от ошибок границ временных окон. Аудит привел к 23 исправлениям в исходном коде и выявил отсутствие прозрачности у коммерческих поставщиков, у которых отсутствуют стандартизированные процессы оспаривания ошибок в счетах. Чтобы решить эти проблемы, исследователи выпустили набор инструментов AgentMeasure, позволяющий пользователям самостоятельно проверять данные об использовании ИИ. Результаты подчеркивают необходимость повышения подотчетности в моделях оплаты по факту использования.
This is a summary. Read the full article at the original source:
Dev.toПохожие
В статье анализируется эволюция guard-моделей для больших языковых моделей (LLM). Автор отмечает, что долгое время SOTA-решениями оставались сами LLM,…
Новые модели Anthropic и OpenAI делают ставку на эффективность и снижение затрат
Компании Anthropic и OpenAI представили новые итерации моделей ИИ, направленные на оптимизацию производительности при значительном снижении эксплуатац…
Краш-тест клона корпоративной системы, написанного ИИ за 48 часов
В данной статье автор проводит эксперимент, проверяя громкое заявление о том, что нейросети способны полностью заменить программистов и клонировать сл…



