Memory-efficient LLM training
18:35
О чём пойдёт речь?
Вы хотите обучить мощную языковую модель, но доступная память на GPU строго ограничена, а стандартные оптимизаторы вроде AdamW тратят гигабайты на состояния и градиенты. Как же быть в условиях ограниченных ресурсов? Это классическая проблема для LLM — тренировка требует огромных вычислительных мощностей, но существует множество инновационных подходов, чтобы обойти эти ограничения.
Мы разберём ключевые идеи из свежих статей — GaLore, FRUGAL, Fira, LDAdam, Apollo, AdaMem, Lomo и AdaLomo, — где предлагаются решения вроде low-rank проекций градиентов, разделения обновлений на state-full и state-free компоненты, адаптивных learning rate с минимальным overhead и даже слияния вычисления градиентов с обновлением параметров.
На семинаре обсудим:
— Какие подходы и идеи существуют для тренировки больших моделей в условиях ограниченных ресурсов;
— Как эти идеи эволюционировали со временем — от GaLore до FRUGAL;
— Тонкости сравнения и особенности экспериментальных сетапов — от pre-training на C4 до fine-tuning на GLUE и SuperGLUE.