← All publications

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

Preprint 2026 Training

Abstract

Shows that mid-training language models on their own self-generated data improves downstream reinforcement learning, yielding stronger reasoning than RL alone.

LLMsTraining