牛大妈在校招职位搜索B-UP强化学习训练算法工程师校招 有 488 条结果

招聘城市:北京,上海
…工作职责:
1、参与强化学习核心算法的设计、实现与优化,探索 RL 在扩散模型去噪过程中的应用,包括但不限于 PPO、DPO、GRPO、DAPO、ReFL等内容;
2、参与强化学习训练框架建设,搭建并且持续优化 Agentic RL 链路;
3、参与奖励模型和偏好数据集的构建与迭代,设计针对多模态生成质量(美学、一致性、指令遵循)的细粒度评价信号;
4、跟踪 ICML/NeurIPS/ICLR/CVPR 等顶会中 RL+生成模型的前沿动态,将论文成果快速转化为内部技术原型并验证。
工作要求:
1、本科及以上学历,计算机、人工智能、数学、自动化等相关专业(硕士/博士优先);
2、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
3…
招聘城市:广州
…有限公司
强化学习算法工程
薪资:10K-15K/月
工作地点:广州市
学历:本科及以上
发布时间:2025年12月4日
职位描述
岗位职责:
1、负责将动作捕捉数据,通过运动重定向技术适配到特定的人形机器人模型上。包括开发算法解决因骨骼结构、关节自由度差异导致的运动映射问题,并利用接触面积等信息优化重定向效果,确保动作自然且物理可行;
2、负责开发强化学习算法训练机器人的运动控制策略,重点优化动态平衡、地形适应及能耗效率,并通过模仿学习等技术利用动捕数据加速训练过程;
3、负责搭建高保真仿真环境(如Isaac Gym, MuJoCo),并解决Sim-to-Real差距问题;
4、了解跟踪强化学习在腿足式机器人领域的前沿技术,推动…
招聘城市:广州
强化学习算法工程 60万元/年
2026-07-06 17:28:14发布
职位要求:
职位性质:全职
工作城市:广东省广州市天河区
聘人数:10
学历要求:博士
职位类别:其他专业技术人员
需求专业:机械设计制造类,自动化类,电子信息类,计算机类,通信类
职位描述:
岗位职责
1.跟踪国内外具身智能相关的最新研究进展,能够快速理解并复现相关研究;
2.完成数据集的收集与整理,设计和改进模型架构独立完成模型优化和参数整定,并训练模型;
3.与团队配合在云或端完成算法的部署,并与实际机器人交互实现自主化作业能力。
4.跟进前沿技术(VLA,VLM,Hover,HumanPlus2D&3D?Diffusionpolicy,World?Model),推动技术落地;
5.与软硬件团队协作,完成
招聘城市:深圳,其它
…我们正在聘AI智能体强化学习工程,加入echOSAgent核心团队。
你将直接参与构建在真实产业环境中运行的智能体系统,让Agent:
?与复杂业务环境持续交互?学习定价、库存、调度等决策策略
?具备长程规划能力?基于真实反馈持续自我进化
?根据企业偏好动态调整行为这是强化学习+大模型+多智能体协同在真实商业系统中的落地,而不是模拟世界里的benchmark。
?
工作重点(Focus):
?为产业级AIAgent构建环境交互系统(业务状态/行为空间/奖励建模)
?将强化学习引入真实场景,如渠道定价优化、库存分配、履约调度
?构建Agent长程规划与复杂任务拆解能力
?实现偏好学习与反馈优化(企业目标、风险约束、利润权衡)
?设计仿真环境与离线评估体系,用于训练与回放真实业务策略…
招聘城市:杭州
…结合大语言模型(LLM)与强化学习(RL)技术,设计并实现智能化的文本生成模型,助力商家运营效率和服务质量的全面提升。
3、持续关注并研究强化学习领域的前沿技术动态,探索新方法与新思路,推动技术创新在实际业务中的落地应用。
任职要求:
1、计算机科学、数学、统计学、自动化等相关专业优先。
2、熟悉Post-Training流程及其在各大公司中的不同应用方式(如Qwen K1.5, DeepSeek-R1等)。
3、深入了解RL领域,包括但不限于RM、PPO、DPO、ORPO、GRPO、MBRL、DDPG、DDQN等算法
4、精通LLM&NLP领域,涵盖LLM训练(CPT、SFT)、文本分类、信息抽取、搜索算法等。
5、具备扎实的机器学习、深度学习与自然语言处理理论基础,熟悉主流预训练模型如BERT…
招聘城市:上海
…/ 自研 MPP 引擎
-协调与元数据:自研 catalog、调度系统、元数据中心
-AI × Data 融合平台 :智能数据治理、自动AI查询优化、向量化湖仓、特征平台、AI Agent for Data
-AI赋能的全流程开发体系
-AI辅助的自动化大数据运维体系
-AI整合的内部答疑工具
2、为什么这个岗位特别
未来 5-10 年最重要的基础设施工程,一定既懂大数据底层,又懂 AI 怎么用、AI 怎么改造数据系统。这就是我们要找的人。
3、你将得到什么
-业务规模:万节点集群、上亿日活用户/EB 级数据处理能力
-AI 融合:参与 LLM × 数据湖、向量索引、AI Agent 数据系统的前沿探索
-真实问题:所有教科书没讲清楚的 corner case,都会在这里遇到…
招聘城市:上海
…vLLM 等主流框架,完成训练 / 推理场景参数调优,实现计算与通信重叠,提升端到端任务性能
6、集群基准测试:使用行业标准压测工具完成集群算力、吞吐、时延基准测试,定位性能瓶颈并落地优化方案
工作要求:
1、计算机、网络工程、电子信息、高性能计算、人工智能等相关专业;
2、熟悉 Linux 操作系统,掌握基础 Linux 命令,了解 Shell/Python 任意一种脚本语言,具备基础脚本编写能力;
3、了解计算机网络基础原理,熟悉 TCP/IP、二层 / 三层网络架构,有 RDMA、InfiniBand、RoCE 网络认知者优先;
4、了解 GPU、CUDA 基本概念,接触过分布式计算、高性能集群、AI 训练环境者优先;
5、具备良好的问题排查思路、逻辑分析能力,学习能力强,能接受集群 7×24 应急值守(轮班),责任心强…
招聘城市:深圳,其它
深圳市集贤科技有限公司
机器学习算法工程
12K-18K/月 深圳市 硕士及以上 模拟面试
职位诱惑:年底双薪 绩效奖金 弹性工作 带薪年假 岗位晋升
薪酬福利:六险一金
发布时间:2025年11月12日
职位描述
岗位职责:
岗位职责:
一、核心算法开发与优化
1.模型设计与训练针对业务场景(如陪护机器人的人脸识别、语音交互)设计深度学习模型(CNN/RNN/Transformer),完成数据标注、特征工程及模型训练
使用 TensorFlow/PyTorch 框架优化模型结构(轻量化设计),平衡精度与计算资源(如适配 RK3588S NPU 的 INT8 量化)。
2.嵌入式算法移植将训练模型部署到边缘设备(如:BK7258/RK3588S),使用 TensorFlow Lite、ONNX Runtime 或厂商工具链(如 RKNN)实现端侧推理。
针对硬件特性优化…
招聘城市:上海
…agentic RL(长程智能体强化学习)方向:搭建复杂交互环境与任务流、多步骤推理轨迹(Trajectory)收集、Reward设计与策略网络优化
5.编写实验脚本、构建评测工具,支持模型上线前的质量验证
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1. 深度学习基础扎实,熟悉当前主流LLM架构
2. 熟悉常见大模型训练框架(Megatron/DeepSpeed/Verl)
3. 有LLM相关项目经验:CPT、SFT、RL 任意方向即可
4. 有阅读论文与复现能力,能快速上手实验
5. 良好的自我学习能力和独立思考能力
加分项:
1. 有相关领域顶会论文,或拥有影响力工作
2. 有自己的LLM项目
3. 有机器翻译(MT)经验
4. 有 Agent RL相关的训练经验,或…
招聘城市:北京
大模型算法工程强化方向)
更新时间:2026-03-06
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
1.负责LLM强化学习链路整体优化,包括数据探索与增强、奖励模型优化、RL策略迭代及效果评估等,持续提升算法的效率与效果;
2.强化学习技术前瞻探索,包括但不限于离线强化学习、环境模型学习、约束强化学习等方向;
3.开展大语言模型在搜索、推荐、广告等业务场景中的应用并实现业务目标。
岗位基本要求
1.计算机科学、自动化、数学、统计学或相关领域专业的硕士或博士;
2.扎实的算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情;
3.能够基于实际业务问题优化算法,有RL算法优化…
招聘城市:上海
…视频生成基座模型研发迭代,参与模型训练、调参、性能优化等核心环节。配合完成模型训练数据的构建和生成,确保训练数据的准确性和有效性。
3、沉淀技术文档,投稿领域的顶会顶刊
工作要求:
1、掌握生成式模型技术(扩散模型,自回归模型等)
2、了解视频生成基座模型的基本研发流程,了解针对视频生成的数据清洗链路和构建。
3、在计算机视觉一个或多个领域的研究和实践经验,包括但不限于以下方向:
a)图片/视频生成扩散模型;
b)视觉自监督学习/表示学习/生成理解统一;
c)大规模视频生成训练经验、SFT或RLHF经验;
d)视频生成的数据清洗和构建。
4、具备扎实的算法功底与落地工程能力,实操动手能力突出者…
招聘城市:深圳,其它
学习算法研发经验;?
机械臂 / 机器手抓取、操作任务的强化学习应用经验;?
机器人导航建图场景中强化学习算法的设计与实现经验;?
机器人现场部署经验(如算法在实际场景中的调试、适配、问题排查)。
2.有人工智能 / 机器人方向顶会顶刊论文发表(如 RSS、ICRA、IROS、CoRL、RAL 等)或相关专利申请经历。?
3.有大规模强化学习训练框架(如 Ray RLlib)使用经验,或具备算法性能优化(如模型轻量化、推理加速)实战经验。?
4.曾主导或核心参与过四足机器人、机械臂等设备的强化学习算法落地项目,且有实际场景验证成果。
简历投递地址:shengbo.zhang@
注:简历投递格式为:毕业时间-专业-姓名
单位简介
联系方式
联系电话: 公司传真:
公司主页: 聘…
招聘城市:上海
…分级机制,复盘高频故障,输出预防方案,降低节点故障率。
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1、计算机、网络工程、电子信息、高性能计算、人工智能等相关专业;
2、熟悉 Linux 操作系统,掌握基础 Linux 命令,了解 Shell/Python 任意一种脚本语言,具备基础脚本编写能力;
3、了解计算机网络基础原理,熟悉 TCP/IP、二层 / 三层网络架构,有 RDMA、InfiniBand、RoCE 网络认知者优先;
4、了解 GPU、CUDA 基本概念,接触过分布式计算、高性能集群、AI 训练环境者优先;
5、具备良好的问题排查思路、逻辑分析能力,学习能力强,能接受集群 7×24 应急值守(轮班),责任心强、善于沟通协作。
加分项:了解服务器硬件结构、BMC/IPMI 带外管理,有服务…
招聘城市:北京
…理想汽车有限公司
聘信息
强化学习算法研究员
2026-02-1409:58:40
职位描述
职位描述:
1.负责面向自动驾驶与具身智能的强化学习算法研究与开发,包括Model-based/FreeRL、Online/OfflineRL等;
2.构建大规模分布式强化学习训练系统,推动RL算法在真实场景的规模化应用;
3.研究数据合成与评测技术,建立数据引擎与评测基准,实现realsimreal快速迭代闭环;
4.探索模仿学习、逆强化学习、ScalableOversight等技术,提升策略学习效率与泛化能力;
5.与世界模型团队协作,利用学习式仿真环境进行策略训练与验证,推动sim2real迁移;
6.参与前沿研究,发表顶会论文,推动强化学习在自动驾驶与具身智能领域的技术进步。
职位要求:
1.硕士及以上学历,机器学习强化学习
招聘城市:北京
算法基础,熟悉强化学习、自然语言处理和机器学习技术,对技术开发及应用有热情;
3.能够基于实际业务问题优化算法,有RL算法优化和项目实践经验优先;
4.熟悉Python、Java等至少一种编程语言,具有良好的编程能力和扎实的数学理论基础;
5.熟悉Tensorflow、PyTorch等深度学习框架并有实际项目经验;
6.关注行业前沿进展,对技术开发及应用有热情,有自己的想法并乐于挑战自我;
7.良好的沟通能力和跨团队协作能力,能够梳理繁杂的工作并建立有效机制,推动上下游配合完成目标;
8.在ICML、NeurIPS、KDD、SIGIR、WWW、ICLR等顶级会议或期刊上发表过论文者优先;
9.获得过国际或国内顶级赛事奖项者优先;
10.有大语言模型算法
招聘城市:北京
算法工程(机器学习&大模型算法
10000元以上
jo***.cn[点击查看]
工作地域:北京市 职位类别:工程技术人员 学历要求:硕士研究生在学 聘人数:15人
发布时间:2026-03-13
* 专业要求:
计算机、数学、人工智能等相关专业学历
* 职位描述:
岗位职责:
①使用机器学习、深度学习和大模型相关技术,开发和优化工业算法模型;
②参与多模态大模型相关的训练、对齐、任务调优等研发工作,训练垂类大模型(LLama3,千问, Gemma);
③参与基于大模型的训练开发与调优工作,包括但不限于基础模型的调研、指令微调、训练数据清洗、模式质量评估等;
④针对细分业务场景的数据处理、模型微调、prompt工程等,以适应场景并达成业务目标;
⑤研究和探索…
招聘城市:上海

2.参与Agentic RL强化学习训练流程:数据构建、reward shaping、训练调优;
3.参与多语种机器翻译(MT)方向:语料处理、模型微调、评测;
4.参与Long horizon agentic RL 方向:轨迹构建,环境构建、优势与奖励设计。
工作要求:
1.2027届应届毕业生,计算机科学、人工智能、计算机视觉等相关专业本科及以上学历,具备扎实的机器学习、深度学习理论基础,熟悉现代LLM架构。
2.熟悉常见大模型训练框架(Megatron/Verl/slime等)
3.有LLM相关项目经验:pretrain、CPT、SFT、RL、non parametric 任意方向即可
4.有阅读论文与复现能力,能快速上手实验
5.良好的自我学习能力和独立思考能力
加分项:
1.有相关领域顶会论文,或开源项目
2.有coding agent harness或模型训练经验
3.ACM/OI…
招聘城市:上海
…人数 薪资
(ASP Intern)LLM-大模型强化学习算法工程 前端|后端|系统集成|软件开发 实习 本科 5 20000以上
发布时间 2026-08-20 16:50:27
职位有效期 2026-11-29 23:59:59
专业 人工智能;信息安全;光电信息工程;数学;数理统计;新一代电子信息技术(含量子技术等);测试专用专业;计算金融交叉试验班;通信工程
工作地址 上海市市辖区松江区
职位要求 岗位要求计算机、人工智能、机器学习、数学等相关专业本科高年级、硕士或博士在读。熟悉机器学习和深度学习基础,了解大模型训练、微调或 post-training 基本流程。对强化学习有基础理解,熟悉 PPO、GRPO、reward modeling、policy optimization、credit assignment 等概念者优先。熟练使用 Python,熟悉 PyTorch;具备良好的工程实现和实验分析能力…
招聘城市:北京
校园聘简章
福利:"带薪年假","定期体检","上市公司","技能培训","岗位晋升"
职位名称:算法工程
学历:本科,硕士,博士
需求人数:20
需求专业:金融科技(北航计算机科学与技术专业联培),计算机技术,计算机类,计算机科学与技术
工作地点:北京市朝阳区
职位描述:一、职位描述1,负责Boss直聘算法平台的建设,整合海量多维数据,开发优化个性化算法模型,优化客户分发策略提升转化率2,参与智能风控、派单、客户质量标记、客户智能跟进等多个业务场景的算法体系搭建3,构建销售话术推荐体系,提升跟进效能4,针对特定业务场景,开发和实践领域自适应微调方法,提升模型在垂直领域的表现二、任职要求1,优秀的coding能力、扎实的算法
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1. 参与B站搜索增长相关的各种专项,通过用户行为分析,挖掘出可行的增长策略,并能推进策略落地
2. 负责部分增长相关的数据监控、策略分析
工作要求:
1. 熟练使用SQL、Excel、Python等数据处理工具
2. 本科及以上学历,应用数学、统计学等数理背景优先;27年及之后毕业优先
3. 沟通能力强,有好奇心,积极主动,熟悉并热爱B站生态
4. 能实习6个月及以上,有数据/策略分析经验者优先
投递简历