Job description
工作内容/职位描述: 1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练;2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率;3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。 任职要求: 1. 扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具;2. 深入了解 Megatron、DeepSpeed、SGLang、vLLM 等主流训推引擎;3. 具备扎实的 RL 算法基础(PPO/DPO/GRPO等)与实际大规模训练经验;4. 加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR;或在 RL 稳定性、环境工程等方向发表过顶会论文。 立即申请 推荐给朋友 返回工作内容/职位描述:
1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练;2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率;3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。