Я опросил 123 человека в Индии, чтобы протестировать передовые модели ИИ

Новое исследование оценило, как передовые модели ИИ справляются со сложными институциональными дилеммами в Индии. Опросив 123 студентов, исследователь создал набор данных из 24 реальных споров в сферах образования, здравоохранения, правосудия и финансов. Были протестированы модели Gemini, Claude, Qwen и DeepSeek, с акцентом на устойчивость к неоднозначности и демографический паритет. Результаты выявили «парадокс предвзятости рассуждений»: модели с расширенными функциями мышления часто генерировали обоснования, приводящие к изменению решений в зависимости от демографических данных. Хотя некоторые модели показали стабильность в финансовых сценариях, другие испытывали трудности с задачами в области правосудия. Исследование подчеркивает, что демографический паритет остается нерешенной проблемой. Автор представил подробную таблицу лидеров на Kaggle, призывая к дальнейшему изучению влияния региональных языковых смещений и правовых прецедентов на производительность моделей.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Frontend-разработчик создал персонализированный командный центр на базе ИИ для оптимизации ежедневной продуктивности и управления личными целями. Испо…
AI-чат-боты могут вызвать глобальный «крах знаний», снижая разнообразие информации
Новое исследование Копенгагенского университета предполагает, что AI-чат-боты могут сужать человеческие знания, предоставляя менее разнообразную инфор…
Jev и Laya за пределами хайпа: что делают модели принятия решений, чего не делают LLM
Разработчик Тьяго Вилас Боас исследует практические ограничения использования больших языковых моделей (LLM) для каждой задачи в агентных рабочих проц…



