[001]
Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
Preprint arXiv
TL;DR Mid-training on self-generated data boosts downstream RL and reasoning.
Shows that mid-training language models on their own self-generated data improves downstream reinforcement learning, yielding stronger reasoning than RL alone.