rl-post-training-builds-compositional-reasoning-strategies-f151dd3b·1 events·first seen Aliases: RL Post-Training Builds Compositional Reasoning Strategies
A new arXiv paper investigates whether RL post-training creates genuinely new compositional reasoning strategies or merely amplifies latent base-model skills. Using a controlled rewrite-grammar environment with auditable traces, the authors show that RL solves problems the pretrained model rarely solves even with large sampling budgets, and that it does so by reorganizing primitive competencies into sequential and parallel compositional procedures. The key differentiator from rejection fine-tuning is selectivity: RL concentrates exploration into valid, reusable structures rather than producing high-volume but shortcut-laden rewrites.