Назад
Данные и аналитика

-1000% занятости: как я нашёл дыры в собственном опубликованном датасете

Habr
Advertisement468 × 90
-1000% занятости: как я нашёл дыры в собственном опубликованном датасете

Автор статьи делится опытом обнаружения критических ошибок в опубликованном открытом датасете о загруженности парковок. После того как в данных было зафиксировано аномальное значение занятости в -1000%, началось расследование, которое выявило серьезные проблемы с качеством данных. В процессе автор столкнулся с тем, что стандартные методы пересчета оказались неэффективными, а поиск отсутствующего знаменателя потребовал нестандартного подхода. Статья подробно описывает, почему автоматизированные проверки, работавшие на протяжении полутора лет, не смогли вовремя обнаружить аномалию. Этот кейс служит важным напоминанием о необходимости тщательной валидации данных перед их публикацией и о том, что даже проверенные системы могут скрывать скрытые дефекты. Автор анализирует свои ошибки и предлагает уроки, которые помогут другим разработчикам и аналитикам избежать подобных ситуаций при работе с большими массивами данных.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Данные и аналитика

Похожие

Advertisement970 × 250