Gradient Localization Improves Lifelong Pretraining of Language Models
- Conference on Empirical Methods in Natural Language Processing
- 2024-11-07
- 4
@inproceedings{fernandez2024gradient,
title = {Gradient Localization Improves Lifelong Pretraining of Language Models},
author = {Jared Fernandez and Yonatan Bisk and Emma Strubell},
year = {2024},
booktitle = {Conference on Empirical Methods in Natural Language Processing},
eprint = {2411.04448},
archivePrefix = {arXiv},
doi = {10.18653/v1/2024.findings-emnlp.949},
url = {https://arxiv.org/abs/2411.04448},
}