牛大妈在社招职位搜索智能体-强化学习infra与数据工程师-CodeBuddy 有 3 条结果

招聘城市:上海
…快速定位训练过程中的工程问题(性能、稳定性、资源瓶颈);
7.良好的跨团队沟通能力,能准确理解算法需求并转化为工程方案;
8.自驱力强,乐于跟进前沿技术,具备快速学习落地能力。
加分项:
1.有大规模 RL 训练平台(支持千级 GPU 集群、亿级样本回放)搭建经验;
2.熟悉智能强化学习(Agentic RL)训练的基础设施优化方案;
3.有 GPU 显存 / 算力优化、网络传输优化(如 NCCL 调优)的实际案例;
4.开源项目贡献者(RL 框架、分布式训练工具等相关项目);
5.具备实际业务场景的 RL 基础设施落地经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将技术团队一同沉淀优质代码…
招聘城市:深圳
…Debug 能力;
2.训练框架经验: 深入理解大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或 PyTorch FSDP 等主流框架的实际源码级开发定制经验;
3.RL RL Infra 储备: 熟悉大模型后训练对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,可以理解并解决 RL过程中的工程痛点;
4.综合素质: 具备极强的技术好奇心自驱力,面对业界无先例的技术难题,能独立思考并推动解决。
岗位介绍:
渴望为世界带来新意的人,早已对描绘未来的“热词”不陌生——人工智能、机器学习数据科学等等。腾讯始终在业界前沿不断探索,积极布局,并为优秀的你提供无限广阔的舞台。我们坚信科技的不断革新,最终能带来…
招聘城市:上海
…优化数据并行、模型并行、专家并行及异构计算体系,解决通信、显存、调度和训推性能瓶颈,提升 GPU 利用率系统吞吐
3. 负责 LLM RL、Agentic RL Infra 的设计研发,支撑 PPO、GRPO 等算法及大规模、多智能、长链路 Agent 训练
4. 建设高性能 RL 训推系统,优化异步训推、Partial Rollout、分布式 Replay Buffer、样本流转、模型同步资源调度
5. 跟进并落地强化学习、分布式训练和大模型推理领域的前沿技术,包括 VERL、rLLM、Agent Lightning、Ray、Megatron-LM 等,持续提升训练平台的性能、稳定性和技术领先性
任职要求:
1.计算机科学、软件工程、人工智能等相关专业,3年以上工程化开发经验(含1年以上 RL 或深度学习基础设施相关经验)
2.熟练…