招聘城市:北京
Agent强化学习算法
更新时间:2025-10-20
工作地点:北京市
事业群:核心本地商业-基础研发平台
工作经验:不限
部门介绍
基础研发平台是美团的核心技术平台,立足于 零售+科技 的战略定位,通过打造人工智能、大数据、云计算、安全等核心技术能力,以及研发效能平台、企业应用平台等公共服务,为业务提供稳定安全、扩展易用、技术领先的平台技术和产品服务。
在这里,我们会参与到最前沿的技术研发和探索;能够接触超规模集群、海量数据,挑战高复杂业务场景,有机会与业界一流的工程师一起并肩前行。
在这里,我们有超强的技术氛围,持续向社区贡献业界实践,加速行业技术发展;我们有完善的互联网学习生态圈,重视底层逻辑和方法…
招聘城市:北京,深圳
…创造行业价值。
岗位职责:
1.参与Agentic强化学习算法研究,改进奖励函数设计和强化训练效率
2.参与研发computer use agent (CUA) 项目研发
3.参与研发数字GUI模型和物理Embodied模型统一的强化学习算法
4.参与自研Agent模型的研发和技术成果沉淀
任职要求:
1.对深度学习、图像处理、自然语言处理等领域有较深入的研究和实践经验。
2.有相关技术工作或者开源项目
3.良好的自驱力和写作能力,优秀的科研写作能力
岗位亮点:
美团多模态大模型的核心研发团队 M17-MM(MultiModal),团队负责美团自研多模态大模型的建设工作,有机会接触到前沿的多模态大模型算法方案和工程框架,技术氛围浓厚,团队重视前沿技术创新。
招聘城市:深圳,其它
…强化学习算法工程师(AgentReinforcementLearningEngineer)
学历:本科,硕士,博士,外国留学生
需求人数:10
需求专业:数学与应用数学(华罗庚数学班),工科试验班类(中外合作办学,中法未来科技试验班),理科试验班类
|||需求专业:理科试验班类,工科试验班类(中外合作办学,中法未来科技试验班),数学与应用数学(华罗庚数学班)
工作地点:广东省深圳市
职位描述:理想经验:
?有强化学习/Agent/决策系统经验
?能将现实问题抽象为状态、动作、奖励
?熟悉PyTorch/Python
?有系统工程意识
?对真实商业系统有好奇心
加分项:
?多智能体系统
?运筹优化/博弈
?供应链/定价/资源调度经验
?LLMAgent框架
你将面对的典型问题:
?一个渠道价格策略在不同区域表现完全不同,Agent如何通过强化学习自动…
招聘城市:北京
…入口。
【你将参与】
方向一:个性化自进化与主动探索算法机制
1.探索与利用权衡: 负责设计前沿的主动探索训练目标与触发机制,引入不确定性感知等机制,使 Agent 能够根据当前交互状态、上下文历史自主判断自适应进化方向。
2.高价值信息捕获: 在极低用户打扰的约束下,设计高效的主动追问与澄清策略,精准、主动地获取用户深层高价值偏好信息。
方向二:多轮交互奖励建模与 RL 策略优化
1.长期价值奖励建模: 负责构建面向长期交互与用户留存的奖励模型体系,将用户显式反馈(追问、点击)与隐式行为(停留、改写)转化为高置信度的显式/隐式奖励信号。
2.强化学习策略对齐: 运用先进的强化学习算法(如 PPO…
招聘城市:北京,上海
…底座;Cognition — 组织认知:理解上下文、识别模式、辅助决策;Agent — 智能行动:自主规划、多步执行、自我进化。
核心职责:
1、 多模态 RAG 架构设计面向文本、图像、表格、视频的统一检索增强生成框架,攻克跨模态知识索引与融合的核心挑战,让企业知识库中的每一种信息形态都能被精准理解和召回。
2、Agent 强化学习与自主规划探索基于 RL 的工具调用与任务规划能力,实现多轮多步骤复杂办公任务的自主执行,构建具备长期记忆与自我进化能力的下一代办公 Agent。
3、大模型可信度与幻觉抑制研究幻觉检测与抑制技术,构建事实一致性评估体系与证据链追溯机制,确保企业级知识问答输出的每一个字都经得起验证。
任职要求:
【岗位要求】
1. 2027…
招聘城市:北京,上海
岗位职责:
1. 负责美团核心本地商业下全流量场景的广告算法策略研究,利用 LLM与RLHF 优化智能出价策略,将传统人工规则迁移为模型自动决策;
2. 参与海量数据下的广告召回技术研发,探索基于RAG的大模型辅助召回策略,提升长尾广告与泛化搜索的召回效率;
3. 参与大规模CTR/CVR预估模型研发,结合大模型特征提取与多模态理解,构建更精准的用户意图与广告匹配能力;
4. 探索 O2O广告模式与机制策略,利用AI Agent框架实现广告自动化策略生成与效果归因分析;
5. 基于强化学习和自动控制算法进行智能出价研究,利用AI自动诊断与优化出价决策链路,持续迭代广告ROI;
6. 研究广告程序化创意,利用AIGC(多模态大模型…
招聘城市:北京,上海
…大模型辅助特征工程与用户理解等前沿方向。
任职要求:
1. 本科及以上学历;
2. 扎实的编程能力和数据结构基础,较强的业务问题分析和解决能力;
3. 熟悉常用的机器学习、深度学习或强化学习算法;
4. 了解大语言模型的基本原理,对LLM在搜索推荐领域的应用有初步了解或实践经验;
5. 自驱主动,沟通良好,有团队协作精神。
具备以下经验者优先:
1. 发表过创新性顶会论文;
2. 在Kaggle等平台上取得靠前名次;
3. 有LLM4Rec相关研究或实践经验;
4. 熟悉RAG、Agent等大模型应用范式,有在搜索推荐场景落地的经验。
【岗位亮点】
1. 亿级DAU、海量用户数据、复杂多业务场景;
2. 大模型与搜索推荐深度融合,可…
招聘城市:北京,上海
岗位职责:
方向一:面向Agent RL的LLM分布式后训练系统
1.多模态与超长上下文训练优化:针对万级以上超长序列(Long Context)及多模态输入,研究高效的上下文并行(CP/SP)、序列并行策略及分布式通信拓扑,优化内存足迹,支撑长文本与复杂多模态后训练。
2.计算资源弹性调度与容错容灾:研究超大规模集群下的弹性训练技术(Elastic Training),实现节点动态加入/退出、无感故障自动恢复(Fault Tolerance)与训练超参数自动寻优,提升集群算力有效利用率(MFU)。
3.Agent RL算法基础设施:构建面向Agent强化学习的高效Rollout引擎、多模型(Policy/Value/Reward/Reference)多阶段流水线编排及动态负载均衡机制;设计并建设支持高并发、低延迟的工具…
招聘城市:北京,杭州
…优秀的分析、解决问题能力,对新技术充满好奇,敢于挑战高难度,善于提出解决方案并快速验证;
3、熟练掌握 TensorFlow/PyTorch 等深度学习框架中的至少一种,具备优秀的编程能力,熟悉 Python 等编程语言,具有扎实的数据结构和算法功底;
4、有推荐系统、搜索广告、CTR/CVR 预估、用户行为建模等广告算法相关经验者优先;
5、有游戏、网服工具、短剧小说垂类行业投放经验者优先;
6、具备以下 AI 相关经验者优先:熟悉 GPT/LLaMA 等主流大模型原理,有 RAG、Agent、SFT/RLHF、Prompt Engineering 等实践经验;或熟悉多模态大模型、生成式 AI 技术,有图像/文案生成项目经验;或熟悉强化学习算法,有序列决策、智能出价应用经验;
7、具备优秀的研究和创新能力,在…
招聘城市:杭州
…运营严格遵循国家金融信息安全相关规定,确保系统与服务的安全稳定。
校招介绍:
同花顺是国内领先的互联网金融上市公司,在人工智能领域深耕十余年,依托强大的数据与算力,成功部署数百个大模型,覆盖核心金融场景,并积极拓展前沿领域,与顶尖高校合作推动技术发展。现面向2025年12月以后毕业的硕博在校生开展算法实习招聘。
一、招聘职位
AIGC算法、数字人算法、多模态算法、具身智能算法、语音算法、大模型算法、量化研究员、Agent算法、强化学习算法、NLP算法。
二、岗位福利
1. 与顶尖算法团队并肩作战,投身亿级用户场景中的大模型实战。
2. 1v1导师与资深导师团全程引领,深度参与大模型从0到1…
招聘城市:北京
…特种高分子单体等分子的自动化合成路径开发与工艺智能优化。
●材料制备方向:主要负责复合材料、能源材料、光电功能材料等的配方设计、自动化制备与成型加工研究。
岗位 2 :人工智能算法与平台支撑岗( 1 名): 支撑中心承担的材料等攻关项目,配合完成智能化/自动化工作流构建、垂直模型研等研发。
●机器学习方向:重点关注强化学习、贝叶斯优化、主动学习等算法以及生成模型等,用于分子、配方与合成路径的逆向设计与优化。
●大模型方向:专注于科学领域大模型的微调、提示工程、检索增强生成(RAG)及智能体(Agent)构建,开发智能科研助手与决策系统。
二、任职要求
●思想政治素质好、学风正派、治学严谨、身心健康,具备良好的…
招聘城市:北京,上海,杭州
…全面且高质量的评估。
这些问题在行业内具有广泛的共性,极具研究价值。通过合作研究探寻解决方案,有望推动大模型编程领域迈向新的高度。
任职要求:
1、不限年级,本科及以上在读,人工智能/计算机/软件工程等相关专业优先;
2、具备优秀的代码能力、数据结构和基础算法功底,熟练掌握C/C++、Python等一个或多个编程语言;
3、熟悉大模型相关的算法和技术,有自然语言处理、大模型训练、强化学习算法经验者优先;
4、在软件工程或者人工智能领域有出色的科研经历,在NeurlPS/ICRL/ICML/ISSTA/ACL/EMNLP等国际顶级期刊会议上发表论文者优先;
5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
招聘城市:武汉,北京
…学习基础;
4) 对大型语言模型技术有强烈的求知欲和一定的知识储备;
5) 具备优秀的逻辑分析能力、团队合作精神和沟通能力,能够清晰地表达技术观点,并与跨职能团队高效协作,共同解决问题;
加分项
1) 在校期间有相关的项目、实习或竞赛经验(如NLP、推荐系统、CV等);
2) 对PromptEngineering有深入理解,或有LoRA/QLoRA等微调方法的实践经验;
3) 熟悉RLHF(如DPO)等对齐优化技术;
4) 在顶级会议或期刊上发表过相关论文;
核心算法实习生(27-28届,武汉或北京均可)
实习内容:
1)参与大模型应用、训练相关工作;
2)大模型专项能力提升,包括Instruct、Reasoning、agent等;
职位要求
1)自然语言处理/多模态/深度学习/强化学习…
招聘城市:北京,上海,杭州
…全面且高质量的评估。
这些问题在行业内具有广泛的共性,极具研究价值。通过合作研究探寻解决方案,有望推动大模型编程领域迈向新的高度。
任职要求:
1、不限年级,本科及以上在读,人工智能/计算机/软件工程等相关专业优先;
2、具备优秀的代码能力、数据结构和基础算法功底,熟练掌握C/C++、Python等一个或多个编程语言;
3、熟悉大模型相关的算法和技术,有自然语言处理、大模型训练、强化学习算法经验者优先;
4、在软件工程或者人工智能领域有出色的科研经历,在NeurlPS/ICRL/ICML/ISSTA/ACL/EMNLP等国际顶级期刊会议上发表论文者优先;
5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。
招聘城市:北京
…师 工程 大模型强化训练 博士/硕士
48 项目经理(含专项项目聘) 工程 项目全生命周期管理 博士/硕士
49 行政主管 支撑 管理学、财务经验优先 硕士
50 算法安全评估算法工程师(专项项目聘) 工程 算法安全评估试验场核心算法、大模型或推荐算法 硕士
51 数据分析工程师(专项项目聘) 工程 海量关键数据接入、治理与分析算法 硕士
52 云原生系统研发工程师(专项项目聘) 工程 服务治理 硕士
53 实时数据平台研发工程师(专项项目聘) 工程 大数据处理 硕士
54 智能体研发工程师(专项项目聘) 工程 智能体研发与优化 硕士
55 网络数据采集工程师(专项项目聘) 工程 网络爬虫、Selenium、Appium、Playwright 硕士
56 社会计算方向副研究员 研究 社交网络分析、图机器学习…
招聘城市:北京
…师 工程 大模型强化训练 博士/硕士
48 项目经理 (含专项项目聘) 工程 项目全生命周期管理 博士/硕士
49 行政主管 支撑 管理学、财务经验优先 硕士
50 算法安全评估算法工程师 (专项项目聘) 工程 算法安全评估试验场核心算法、大模型或推荐算法 硕士
51 数据分析工程师 (专项项目聘) 工程 海量关键数据接入、治理与分析算法 硕士
52 云原生系统研发工程师 (专项项目聘) 工程 服务治理 硕士
53 实时数据平台研发工程师 (专项项目聘) 工程 大数据处理 硕士
54 智能体研发工程师 (专项项目聘) 工程 智能体研发与优化 硕士
55 网络数据采集工程师 (专项项目聘) 工程 网络爬虫、Selenium、Appium、Playwright 硕士
56 社会计算方向 副研究员 研究 社交网络分析、图机器学习…
招聘城市:北京
…加分。
量化交易算法研究员20K-30K 14薪
【岗位职责】 1. 股票多因子量化策略分析,alpha因子挖掘; 2. 期货CTA及相关量化交易策略研究; 3. ETF、期权及其他衍生品量化策略研究。 【任职要求】 1、本科及以上学历,至少1~3年量化交易经验 2、掌握至少一种数据分析语言包括但不限于Python/C等,熟悉 Linux 等操作系统; 3、熟练 SQL语言,熟练使用MYSQL、PostgreSQL等关系型数据库; 4、计算机、数学、金融相关专业优先,对机器学习有基础者优先; 5、具有金融相关行业从业经验,或者对金融行业有一定了解。
量化交易算法实习生 400-800/天
【岗位职责】 1. 股票和期货CTA策略研发; 2. Alpha因子挖掘; 3. 机器学习预测模型研发;4量化金融Agent设计。…
招聘城市:北京
…SpringAI、RAG、Agent、KAG等主流大模型应用框架;4. 对技术有热情,对工作有担当,具备良好逻辑思维能力、沟通能力、团队合作精神,能承受工作压力;5. 有实际大模型问答、Agent开发/实习项目经验者优先。
|||职位描述:岗位职责:1、基于数据采集平台进行数据采集流程配置;2、对采集到的数据及清洗结果进行分析,提出数据可用性建议。任职要求:1、硕士及以上学历,数学、统计学、计算机等相关专业;2、掌握统计学基础理论、分析方法及常用分析工具;3、具有一定的python编程基础,了解正则、XPATH表达式。
|||职位描述:岗位职责:1、负责人工智能、机器学习相关项目的应用实现;2、负责机器学习算法的实施,以及模型设计与训练;3、人工…
招聘城市:北京
…精通强化学习核心算法(Policy Gradient、PPO、DPO、GRPO等),理解Reward Modeling和RLHF/RLAIF对齐技术原理,有LLM对齐相关项目实践经验优先;
3. 熟悉PyTorch,有大规模分布式训练经验(DeepSpeed/Megatron-LM/FSDP),能独立完成从数据处理到模型训练部署的全流程;
4. 有以下经验者优先:大语言模型推理优化(vLLM/TensorRT-LLM)、Agent/工具调用场景RL训练、搜索推荐系统强化学习应用;
5. 在ICML、NeurIPS、ICLR等顶级会议发表RL/LLM方向论文者优先;
6. 良好的逻辑思维和沟通能力,自驱力强,乐于挑战开放性技术问题。
岗位亮点:
1. 前沿技术深水区:直接参与千亿参数大模型的RL训练,每天面对业界最前沿的Scaling RL挑战;
2. 端到端闭环落地:从算法研究到亿…
招聘城市:上海
…性,完成算法落地与线上迭代闭环。
核心业务方向:
负责 B 站内容理解业务,聚焦视频多模态内容理解、评论 / 弹幕语义理解、用户内容画像等场景;结合业务需求,基于大模型后训练技术解决真实业务问题,推动模型能力落地迭代。
1. 大模型监督微调与迭代
基于业务真实数据与线上反馈,设计、实现 LLM / 多模态模型 SFT 微调方案;面向分类、信息抽取、内容理解、开放式生成等任务,持续提升模型效果与泛化能力。
2. 强化学习对齐算法落地
参与强化学习后训练全流程,包括 GRPO、DAPO、GSPO 等算法实践;根据业务场景设计偏好数据、打分器 / 奖励函数,优化采样策略、优势估计、KL 约束,提升模型对齐效果与训练稳定性。
3. Agent 应用
搭建Agent能力解决复杂内容理解任务,在…