Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
Abstract
Shows that mid-training language models on their own self-generated data improves downstream reinforcement learning, yielding stronger reasoning than RL alone.