Назад
Искусственный интеллект и машинное обучение

Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

Habr
Advertisement468 × 90
Утечка на 3.5 часа вперёд: как модель обманывала саму себя полтора месяца — и как мы это поймали

В статье рассматривается классическая проблема машинного обучения на временных рядах: утечка данных, при которой модель неявно получает информацию из будущего. Авторы столкнулись с ситуацией, когда алгоритм предсказания показывал отличные результаты на исторических данных, но проваливался в реальности. Причиной стал некорректный ресемплинг 4-часовых свечей, из-за чего модель «заглядывала» в будущее на 3,5 часа. В материале подробно разбирается анатомия этой ошибки, математический подход к проведению позиционного теста для её обнаружения, а также предлагаются методы защиты от подобных инцидентов. Авторы делятся сниппетом кода, который помогает предотвратить утечки данных при обработке временных рядов, подчеркивая важность тщательной проверки пайплайнов подготовки данных для обеспечения надежности ML-моделей в продакшене.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Автор статьи делится опытом создания системы долговременной памяти для персонального ИИ-ассистента, который анализирует переписку в Telegram. Основная…

Habr

Universal Music Group (UMG) объявила о заключении многолетнего стратегического партнерства с ElevenLabs для разработки новой платформы на базе искусст…

The Verge

В статье рассматривается практическое применение нейросетей в работе бизнес-аналитика на примере платформы BotHub. Автор демонстрирует, как использова…

Habr
Advertisement970 × 250