Policy Frameworks for Transparent Chain-of-Thought Reasoning in Large Language Models
Paper • 2503.14521 • Published
None defined yet.
ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning
ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement