Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

В статье рассматривается классическая проблема машинного обучения на временных рядах: утечка данных, при которой модель неявно получает информацию из будущего. Авторы столкнулись с ситуацией, когда алгоритм предсказания показывал отличные результаты на исторических данных, но проваливался в реальности. Причиной стал некорректный ресемплинг 4-часовых свечей, из-за чего модель «заглядывала» в будущее на 3,5 часа. В материале подробно разбирается анатомия этой ошибки, математический подход к проведению позиционного теста для её обнаружения, а также предлагаются методы защиты от подобных инцидентов. Авторы делятся сниппетом кода, который помогает предотвратить утечки данных при обработке временных рядов, подчеркивая важность тщательной проверки пайплайнов подготовки данных для обеспечения надежности ML-моделей в продакшене.
This is a summary. Read the full article at the original source:
HabrПохожие
Долговременная память для ИИ-ассистента: как превратить переписку в Telegram в структурированную базу знаний
Автор статьи делится опытом создания системы долговременной памяти для персонального ИИ-ассистента, который анализирует переписку в Telegram. Основная…
Universal Music Group в партнерстве с ElevenLabs запускает музыкальную платформу на базе ИИ
Universal Music Group (UMG) объявила о заключении многолетнего стратегического партнерства с ElevenLabs для разработки новой платформы на базе искусст…
Нейросети для бизнес-аналитика: разбор ТЗ, оценка проекта и план-график за 15 минут
В статье рассматривается практическое применение нейросетей в работе бизнес-аналитика на примере платформы BotHub. Автор демонстрирует, как использова…


