Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMs | Read Paper on Bytez