-1000% занятости: как я нашёл дыры в собственном опубликованном датасете
Автор статьи делится опытом обнаружения критических ошибок в опубликованном открытом датасете о загруженности парковок. После того как в данных было зафиксировано аномальное значение занятости в -1000%, началось расследование, которое выявило серьезные проблемы с качеством данных. В процессе автор столкнулся с тем, что стандартные методы пересчета оказались неэффективными, а поиск отсутствующего знаменателя потребовал нестандартного подхода. Статья подробно описывает, почему автоматизированные проверки, работавшие на протяжении полутора лет, не смогли вовремя обнаружить аномалию. Этот кейс служит важным напоминанием о необходимости тщательной валидации данных перед их публикацией и о том, что даже проверенные системы могут скрывать скрытые дефекты. Автор анализирует свои ошибки и предлагает уроки, которые помогут другим разработчикам и аналитикам избежать подобных ситуаций при работе с большими массивами данных.
This is a summary. Read the full article at the original source:
HabrПохожие
Статья на Habr посвящена методологии проведения switchback-экспериментов, которые критически важны для оценки изменений в системах с общими ресурсами,…
Я создал self-hosted AI-аналитика данных: 4 агента, изолированное выполнение кода и выбор LLM
Разработчик Laban представил Insight Orchestra — платформу для анализа данных с открытым исходным кодом, которую можно развернуть на собственных серве…
В статье на Habr автор подробно разбирает фундаментальную проблему статистического вывода — влияние правила остановки эксперимента на значение p-value…



