牛大妈在校招职位搜索强化学习算法工程师 有 1000+ 条结果

招聘城市:北京,上海
…工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
4、跟踪 ICML/NeurIPS/ICLR/CVPR 等顶会中 RL+生成模型的前沿动态,将论文成果快速转化为内部技术原型并验证。
工作要求:
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3…
招聘城市:广州
…有限公司
强化学习算法工程
薪资:10K-15K/月
工作地点:广州市
学历:本科及以上
发布时间:2025年12月4日
职位描述
岗位职责:
1、负责将动作捕捉数据,通过运动重定向技术适配到特定的人形机器人模型上。包括开发算法解决因骨骼结构、关节自由度差异导致的运动映射问题,并利用接触面积等信息优化重定向效果,确保动作自然且物理可行;
2、负责开发强化学习算法训练机器人的运动控制策略,重点优化动态平衡、地形适应及能耗效率,并通过模仿学习等技术利用动捕数据加速训练过程;
3、负责搭建高保真仿真环境(如Isaac Gym, MuJoCo),并解决Sim-to-Real差距问题;
4、了解跟踪强化学习在腿足式机器人领域的前沿技术,推动…
招聘城市:杭州
职位描述:
我们正在构建一个创新的数据分析诊断模型,旨在通过强化学习(RL)与大语言模型(LLM)技术的结合,为商家提供智能化的店铺运营支持。该模型将帮助商家提高运营效率和服务质量,实现数据驱动的决策优化。
培养方向:
1、参与系统的需求分析、架构设计与开发工作,确保算法模型的高效落地与业务目标的达成。
2、结合大语言模型(LLM)与强化学习(RL)技术,设计并实现智能化的文本生成模型,助力商家运营效率和服务质量的全面提升。
3、持续关注并研究强化学习领域的前沿技术动态,探索新方法与新思路,推动技术创新在实际业务中的落地应用。
任职要求:
1、计算机科学、数学、统计学、自动化等相关专业优先。
2、熟悉Post…
招聘城市:广州
强化学习算法工程 60万元/年
2026-07-06 17:28:14发布
职位要求:
职位性质:全职
工作城市:广东省广州市天河区
招聘人数:10
学历要求:博士
职位类别:其他专业技术人员
需求专业:机械设计制造类,自动化类,电子信息类,计算机类,通信类
职位描述:
岗位职责
1.跟踪国内外具身智能相关的最新研究进展,能够快速理解并复现相关研究;
2.完成数据集的收集与整理,设计和改进模型架构独立完成模型优化和参数整定,并训练模型;
3.与团队配合在云或端完成算法的部署,并与实际机器人交互实现自主化作业能力。
4.跟进前沿技术(VLA,VLM,Hover,HumanPlus2D&3D?Diffusionpolicy,World?Model),推动技术落地;
5.与软硬件团队协作,完成
招聘城市:深圳,其它
强化学习算法工程(AgentReinforcementLearningEngineer)
学历:本科,硕士,博士,外国留学生
需求人数:10
需求专业:数学与应用数学(华罗庚数学班),工科试验班类(中外合作办学,中法未来科技试验班),理科试验班类
|||需求专业:理科试验班类,工科试验班类(中外合作办学,中法未来科技试验班),数学与应用数学(华罗庚数学班)
工作地点:广东省深圳市
职位描述:理想经验:
?有强化学习/Agent/决策系统经验
?能将现实问题抽象为状态、动作、奖励
?熟悉PyTorch/Python
?有系统工程意识
?对真实商业系统有好奇心
加分项:
?多智能体系统
?运筹优化/博弈
?供应链/定价/资源调度经验
?LLMAgent框架
你将面对的典型问题:
?一个渠道价格策略在不同区域表现完全不同,Agent如何通过强化学习自动…
招聘城市:北京
…sim2real迁移;
6.参与前沿研究,发表顶会论文,推动强化学习在自动驾驶与具身智能领域的技术进步。
职位要求:
1.硕士及以上学历,机器学习强化学习、计算机科学、自动化等相关专业;
2.扎实的强化学习理论基础,熟悉主流RL算法(PPO、SAC、TD3、IQL等)及其应用;
3.熟练掌握Python、C++编程语言,熟悉PyTorch等深度学习框架,有分布式训练经验;
4.对大规模强化学习、策略优化、模仿学习等有深入理解和实践经验;
5.具有优秀的分析和解决问题能力,自驱性强,能够独立推进研究项目。
【具备以下条件优先】
1.在NeurIPS/ICLR/ICML/ICRA/CoRL/RSS等顶级会议发表论文者优先;
2.有自动驾驶、机器人、游戏AI等领域的强化学习应用经验者优先;…
招聘城市:北京
大模型算法工程强化方向)
更新时间:2026-03-06
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
1.负责LLM强化学习链路整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果;
2.强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向;
3.开展大语言模型在搜索、推荐、广告等业务场景中的应用并实现业务目标。
岗位基本要求
1.计算机科学、自动化、数学、统计学或相关领域专业的硕士或博士;
2.扎实的算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情;
3.能够基于实际业务问题优化算法,有RL算法优化…
招聘城市:北京,上海
智能驾驶端到端算法工程强化学习方向)
招聘人数:20人
单位名称:南京地平线信息技术有限公司
薪资待遇:面议
工作地点:北京市,上海市
发布日期:2026-04-08
基本要求
工作类型:全职
学历要求:硕士研究生及以上
专业要求:电子科学与技术,计算机科学与技术,电子科学与技术,信息与通信工程,计算机科学与技术
岗位职责
RL 算法设计与创新:深入研究 PPO、GRPO 等主流 RL 算法在驾驶场景中的适配与改进。在端到端智驾模型的基座上,探索 Model-based RL、离线强化学习(Offline RL)、层级强化学习等前沿范式,针对驾驶的长时序、稀疏奖励、多智能体特性提出系统性解法。
奖励函数工程:设计覆盖安全性、舒适性、效率、交通规则遵守…
招聘城市:深圳,其它
强化学习应用工程
18K-25K/月 深圳市 本科及以上 模拟面试
职位诱惑:弹性工作 带薪年假 节日礼物 扁平管理
发布时间:2026年8月14日
职位描述
岗位职责:
负责机器人强化学习模型的训练、调参与优化,提高策略稳定性与运动表现。
在仿真环境中进行大量实验,调整奖励函数、观测空间、训练参数等关键因素,持续迭代策略效果。
将训练得到的策略模型部署到真实机器人系统中,完成策略验证与调试。
分析仿真与真实机器人运行表现,定位问题并推动策略优化与 sim-to-real 适配。
整理训练流程、实验数据与部署经验,形成规范化训练与应用流程。
岗位要求:
熟练使用 Python,c++,能够阅读和理解强化学习或机器人控制相关代码。
了解强化
招聘城市:其它
深圳市华创智企科技有限公司上海分公司
招聘信息
AI强化学习工程
2026-06-30 15:54:30
职位描述
AI强化学习工程
具身整机及灵巧手方向
(可考虑实习生)
1.必须精通主流的DRL算法,如PPO、SAC、TD3等,并理解DQN等经典算法。对于灵巧手操作,还需要深入掌握解决高维动作空间和稀疏奖励问题的模仿学习(Imitation Learning) 方法。
2.精通C++和Python,必须熟练使用PyTorch或TensorFlow等深度学习框架。
3.精通ROS/ROS2,Isaac Gym/Isaac Lab,MuJoCo、Gazebo、PyBullet工具。
4.具备将仿真中训练的策略成功迁移到真实机器人上的实战经验,并能应对传感器噪声、通信延迟、系统标定等现实挑战。
工作经验:
1.有四足、轮足或人形机器…
招聘城市:北京
算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情;
3.能够基于实际业务问题优化算法,有RL算法优化和项目实践经验优先;
4.熟悉Python、Java等至少一种编程语言,具有良好的编程能力和扎实的数学理论基础;
5.熟悉Tensorflow、PyTorch等深度学习框架并有实际项目经验;
6.关注行业前沿进展,对技术开发及应用有热情,有自己的想法并乐于挑战自我;
7.良好的沟通能力和跨团队协作能力,能够梳理繁杂的工作并建立有效机制,推动上下游配合完成目标;
8.在ICML、NeurIPS、KDD、SIGIR、WWW、ICLR等顶级会议或期刊上发表过论文者优先;
9.获得过国际或国内顶级赛事奖项者优先;
10.有大语言模型算法
招聘城市:深圳,其它
…机器人现场部署,需协助解决算法在实际场景中的适配问题。?
任职要求:
1.熟悉 learning-based control 领域前沿进展,全日制本科及以上学历,计算机、自动化、机器人、人工智能等相关专业。?
2.了解多自由度欠驱动机器人动力学(如四足机器人、机械臂),具备相关设备运动控制认知者优先。?
3.熟练使用 C++、Python 等编程语言,精通 pytorch/tensorflow 等主流深度学习框架,了解 ROS(Robot Operating System)框架及机器人软件开发流程。?
4.熟悉主流机器人仿真软件,如 NVIDIA Isaac Sim, mujoco, raisim, gazebo, pybullet, vrep 等,能独立搭建四足机器人、机械臂等设备的仿真环境。?
5.深入理解常用深度强化学习算法(PPO、SAC、DQN、DDPG、A3C 等),并具备算法改进与工程化落地能力…
招聘城市:北京
强化学习算法工程(具身智能)12
发布日期:2026-03-30
截止日期:2026-04-08
智能产业研究院|招1人
所需专业:机器学习/人工智能方向
资质要求:职称资质符合学校相关岗位系列要求
学习经历及工作经历满足以下条件之一 :
1.学位要求本科 并且 工作年限要求不限
核心职责及次要职责:
1.主导具身智能任务的RL+IL混合训练框架设计。2.研发分布式训练与大规模并行环境采样方案。3.推动Sim2Real迁移与策略泛化能力提升。4.协助指导团队进行代码优化与复现。
其他要求:
1.精通PyTorch分布式训练与RL框架(Ray RLlib等)。2.熟悉经典与前沿RL算法原理。3.有多机器人RL项目经验优先。4.在顶会(NeurIPS、ICLR)发表…
招聘城市:北京,上海
…率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能…
招聘城市:上海
强化学习与控制算法专家
招聘人数:1人
单位名称:中科智云科技有限公司
薪资待遇:面议
工作地点:上海市
发布日期:2026-03-13
基本要求
工作类型:全职
学历要求:硕士研究生及以上
专业要求:计算机系统结构,计算机软件与理论,计算机应用技术,机械制造及其自动化,电力系统及其自动化,计算机技术,人工智能
岗位职责
1、世界模型动力学训练:在冻结的感知隐空间内,训练基于时序差分(TD-Learning)或预测控制的动态网络(Dynamics Model),实现未来状态的高速推演。
2、Reward Engineering (奖励工程):将工业现场的安全底线、防摇摆、轨迹精准度等“硬规则”数学化,设计合理的多维代价/奖励函数。
3、并行推演规划:基于 MPPI 或 CEM 等算法,在潜空间内实现大规模…

小红书 【2026校招】图像增强算法工程

全职 北京,上海
招聘城市:北京,上海
…负责视频/图片前处理修复增强算法的研究与落地,包括但不限于超分、降噪、去模糊、人像修复等;
2、负责在视频/图片画质还原领域探索diffusion生成式模型的应用与落地;
3、负责视频/图片画质分析和质量评估算法的研究和落地,包括但不限于噪声估计检测、低质检测(编码artifact/模糊/过锐)、色彩/曝光/对比度/清晰度评价、美学/构图评价等;
4、负责视频/图片场景分类和分析,用于改善视频编码效率和传输效率,包括但不限于ROI检测、场景分类、复杂度分析等。
任职要求:
1、本科及以上学历,计算机、通信工程、软件工程、数学或相关专业优先;
2、在图像、视频传统算法,深度学习、机器学习等人工智能领域有丰富经验, 具备扎实的图像处理算法基础,…
招聘城市:深圳,其它
算法工程-搜广推大模型方向
2026-08-06 14:48:04
职位描述
工作职责
1.负责海外电商产品生成式模型及基础模型的研发与优化,探索 LLM 在搜索、推荐、广告等场景中的应用。
2.参与统一排序模型、Semantic ID、多模态表示学习等核心算法研发,提升模型的泛化能力和业务效果。
3.参与智能 Agent、AutoResearch、训练流程自动化等 AI 研发工具建设,提升算法研发效率。
4.跟踪前沿技术,并推动算法创新与业务落地。
任职要求
1.2027届应届毕业生,本科及以上学历,机器学习、统计相关专业、模式识别相关专业优先;
2.扎实掌握机器学习、深度学习基础知识,熟悉 Transformer、Representation Learning、Multi-task Learning、Contrastive Learning 等算法者优先。
3.熟悉 PyTorch、TensorFlow 等至少一种深度学习
招聘城市:北京
算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情;
3.能够基于实际业务问题优化算法,有RL算法优化和项目实践经验优先;
4.熟悉Python、Java等至少一种编程语言,具有良好的编程能力和扎实的数学理论基础;
5.熟悉Tensorflow、PyTorch等深度学习框架并有实际项目经验;
6.关注行业前沿进展,对技术开发及应用有热情,有自己的想法并乐于挑战自我;
7.良好的沟通能力和跨团队协作能力,能够梳理繁杂的工作并建立有效机制,推动上下游配合完成目标;
8.在ICML、NeurIPS、KDD、SIGIR、WWW、ICLR等顶级会议或期刊上发表过论文者优先;
9.获得过国际或国内顶级赛事奖项者优先;
10.有大语言模型算法
招聘城市:上海
上海傅利叶智能科技股份有限公司
具身强化学习工程
薪资:25K-45K/月
工作地点:上海 上海市
学历:硕士及以上
职位诱惑:健康体检 餐补 房补 扁平管理 节日礼物
发布时间:2025年10月22日
职位描述
岗位职责:
岗位职责:1、设计并实现面向视觉 - 语言 - 动作 (VLA) 模型的强化学习算法。2、开发高效的机器人强化学习训练与推理框架,包含多环境并行渲染、分布式采样,人机交互接管等关键组件。3、优化从仿真到真实世界的迁移性能,提升策略在物理机器人上的可靠性和鲁棒性。
岗位要求:
任职要求:学历背景:计算机 / 自动化 / 机器人学 / 机器学习等相关专业硕士及以上学历。专业技能:1、深入理解强化学习基础理论 (PPO, GRPO 等) 及实践…
招聘城市:深圳,其它
深圳市集贤科技有限公司
机器学习算法工程
12K-18K/月 深圳市 硕士及以上 模拟面试
职位诱惑:年底双薪 绩效奖金 弹性工作 带薪年假 岗位晋升
薪酬福利:六险一金
发布时间:2025年11月12日
职位描述
岗位职责:
岗位职责:
一、核心算法开发与优化
1.模型设计与训练针对业务场景(如陪护机器人的人脸识别、语音交互)设计深度学习模型(CNN/RNN/Transformer),完成数据标注、特征工程及模型训练。
使用 TensorFlow/PyTorch 框架优化模型结构(轻量化设计),平衡精度与计算资源(如适配 RK3588S NPU 的 INT8 量化)。
2.嵌入式算法移植将训练模型部署到边缘设备(如:BK7258/RK3588S),使用 TensorFlow Lite、ONNX Runtime 或厂商工具链(如 RKNN)实现端侧推理。
针对硬件特性优化…