Можно ли научить маленькую LLM учиться без роста весов? Продолжение: почему повторное обучение упёрлось в потолок
Автор статьи продолжает серию экспериментов с небольшими языковыми моделями, направленных на создание архитектуры LANN-4. Основная идея заключается в обучении компактных нейросетей, которые могут «учиться всю жизнь» без увеличения количества параметров, используя внешнюю память и регулярное дообучение. В ходе исследования автор столкнулся с проблемой: повторное дообучение одной и той же модели на новых данных дает эффект только в первом цикле, после чего прогресс останавливается. Накопительного эффекта от многократных итераций обучения достичь не удалось. Автор делится результатами своих неудач и успехов, подчеркивая, что текущие модели являются лишь инструментами для проверки гипотез. Сейчас исследователь ищет экспертную помощь сообщества, чтобы выявить потенциальные логические ошибки в архитектуре до проведения масштабных вычислительных тестов. Статья призывает читателей к дискуссии о том, как преодолеть «потолок» обучения малых LLM.
This is a summary. Read the full article at the original source:
HabrПохожие
По мере того как ИИ становится обыденным инструментом, ценность человеческого вклада смещается от простого производства контента к экспертному суждени…
В статье рассматривается переход от использования больших языковых моделей (LLM) для генерации текста к их применению для задач принятия решений, что…
Может ли индустрия ИИ убедить противников дата-центров, отказавшись от NDA?
Стремительное расширение инфраструктуры ИИ вызвало значительное сопротивление на местах, что привело к мораториям на строительство новых дата-центров…



