
01 · RL POST-TRAINING
CritPT-RL
一套完整的 RL post-training 流程。
面向 scientific coding tasks,覆盖数据生成、reward 设计、GRPO 训练、checkpoint evaluation 和 official-style evaluation。
A complete RL post-training pipeline.
Built for scientific coding tasks, covering data generation, reward design, GRPO training, checkpoint evaluation, and official-style evaluation.


