Dust: Предварительное обучение трансформеров без обратного распространения ошибки
Исследователи из QLabs представили «Dust», новый подход к предварительному обучению моделей Transformer, который исключает необходимость в традиционном обратном распространении ошибки (backpropagation). Используя алгоритм локального обучения, Dust стремится устранить узкие места в памяти и вычислениях, обычно связанные с обучением крупномасштабных нейронных сетей. Метод фокусируется на локальном обновлении весов внутри слоев, что может значительно сократить объем памяти, требуемый для обучения, потенциально позволяя более эффективно масштабировать модели ИИ. Это исследование бросает вызов стандартной зависимости от глобального градиентного спуска, предполагая, что правила локального обучения могут обеспечить сопоставимую производительность, предлагая при этом лучшее использование аппаратных ресурсов. Команда опубликовала свои результаты, чтобы стимулировать дальнейшее изучение альтернативных парадигм обучения, выходящих за рамки ограничений обратного распространения ошибки, что может проложить путь к более устойчивым и быстрым циклам разработки ИИ. Это достижение знаменует собой значительный сдвиг в подходе к фундаментальным механизмам обучения глубоких нейронных архитектур.
This is a summary. Read the full article at the original source:
Hacker News (YC)Похожие
Google может расширить функцию Gemini «Call for Me» на личные контакты
Google планирует расширить возможности своей функции «Call for Me» на базе искусственного интеллекта, которая в настоящее время помогает пользователям…
ChatGPT добавляет подписи реальных карикатуристов к поддельным карикатурам New Yorker
Недавнее расследование показало, что ChatGPT от OpenAI генерирует изображения карикатур в стиле The New Yorker, ошибочно включая в них подписи реальны…
Meta Muse, как сообщается, собирает досье на всех ваших близких
Новый ИИ-помощник Muse от Meta набрал более 5 миллионов загрузок за три недели. Однако отчет Wired и исследователя Карана Джоши вызвал опасения по пов…


