Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
Preprint arXiv
TL;DR Mid-training on self-generated data boosts downstream RL and reasoning.
03 / Research output
Peer-reviewed papers, workshop contributions and preprints. 10 total — expand Abstract or BibTeX on any entry.
2026
Preprint arXiv
TL;DR Mid-training on self-generated data boosts downstream RL and reasoning.
✓ ICLR 2026 Conference
TL;DR Makes inference-time sampling produce genuinely diverse solutions — +21.6% pass@50.
2025
✓ NeurIPS 2025 Workshop (Reliable ML from Unreliable Data) Workshop
TL;DR Stronger reasoning makes LLMs easier to jailbreak — via custom ciphers (ACE/LACE).
Preprint arXiv
TL;DR Uses multi-agent shopper simulation as a reward to optimize e-commerce query rewriting.