Назад
Искусственный интеллект и машинное обучение

Можно ли научить маленькую LLM учиться без роста весов? Продолжение: почему повторное обучение упёрлось в потолок

Habr
Advertisement468 × 90
Можно ли научить маленькую LLM учиться без роста весов? Продолжение: почему повторное обучение упёрлось в потолок

Автор статьи продолжает серию экспериментов с небольшими языковыми моделями, направленных на создание архитектуры LANN-4. Основная идея заключается в обучении компактных нейросетей, которые могут «учиться всю жизнь» без увеличения количества параметров, используя внешнюю память и регулярное дообучение. В ходе исследования автор столкнулся с проблемой: повторное дообучение одной и той же модели на новых данных дает эффект только в первом цикле, после чего прогресс останавливается. Накопительного эффекта от многократных итераций обучения достичь не удалось. Автор делится результатами своих неудач и успехов, подчеркивая, что текущие модели являются лишь инструментами для проверки гипотез. Сейчас исследователь ищет экспертную помощь сообщества, чтобы выявить потенциальные логические ошибки в архитектуре до проведения масштабных вычислительных тестов. Статья призывает читателей к дискуссии о том, как преодолеть «потолок» обучения малых LLM.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Стремительное расширение инфраструктуры ИИ вызвало значительное сопротивление на местах, что привело к мораториям на строительство новых дата-центров…

TechCrunch
Advertisement970 × 250