牛大妈在校招职位搜索北斗Agent算法研究员强化学习自进化方向 有 13 条结果

招聘城市:北京
Agent 能够根据当前交互状态、上下文历史自主判断适应进化方向
2.高价值信息捕获: 在极低用户打扰的约束下,设计高效的主动追问与澄清策略,精准、主动地获取用户深层高价值偏好信息。
方向二:多轮交互奖励建模与 RL 策略优化
1.长期价值奖励建模: 负责构建面向长期交互与用户留存的奖励模型体系,将用户显式反馈(追问、点击)与隐式行为(停留、改写)转化为高置信度的显式/隐式奖励信号。
2.强化学习策略对齐: 运用先进的强化学习算法(如 PPO、GRPO、在线/交互式 RL),优化模型在多轮对话与 AI 搜索场景下的样本效率与收敛性。基于严谨的理论框架(如收敛性保证、遗憾界分析),指导算法的原则性设计…
招聘城市:北京
Agent、Reasoning等;熟练使用Python及PyTorch等主流框架。
5.驱力强,能在开放性问题中主动推进,在不完美条件下快速验证假设,动手能力和执行能力强。
加分项:
1.有AutoML、Neural Architecture Search、AI驱动科研工具(如AI Scientist、AIDE、MLR-Bench类)的研究或工程经验。
2.熟悉ClaudeCode、OpenClaw等开源Harness的设计与实现,或有Agent评估框架搭建经验。
3.具有跨学科视野,能将运筹优化、强化学习等方法引入AutoResearch体系。
4.在NeurIPS、ICML、ICLR、KDD等顶会发表过论文(含在投),或有被广泛使用的开源项目。
5.对 AI Agent、Agentic RL、AI for Optimization、AI for Science、智能化算法研发系统等前沿方向有持续关注和独立思考,愿意探索 AI 改变算法研究
招聘城市:北京
…目标是构建能够理解复杂业务需求、驱动范围智能调整的Agent系统,实现“技术驱动业务范式”的升级转变,最终促进平台供给繁荣与用户的供需匹配优化。
【建议研究方向
1.多模态感知与表征建模:集成地理信息(GIS)、用户热力、图像、自然语言等多模态数据,进行联合表征学习与建模,攻克跨模态语义对齐难题,为空间智能理解与决策提供统一的感知基础。
2.强化学习增强的多模态生成与优化:探索强化学习在多模态大模型中的应用,研究基于RL的多模态内容(如图像、GIS、文本描述)生成、跨模态偏好对齐及模型适应优化,以持续提升系统对复杂业务场景的理解与推理能力。
3.基于后训练的多模态内容理解与审核:探索多模态…
招聘城市:北京
…反馈信号,驱动Agent在复杂履约场景中实现可度量的效果提升
3.探索Multi-Agent协作框架,研究Agent在千万级并发场景下的可靠性、安全性与成本效率
方向二:LLM后训练算法研究
1.负责面向特定业务场景的指令精调(SFT)、偏好对齐(RLHF/DPO/GRPO等)全链路研究与工程落地
2.研究ScalableOversight、持续学习、AI和环境反馈的强化学习(RLXF)等前沿方向。同时探索奖励模型与反馈机制、可泛化的细粒度过程监督和奖励建模等,提升模型在复杂推理与工具调用任务上的能力上限
3.主导训练数据的质量工程,包括数据清洗、合成数据构建及标注流程设计
4.垂域模型定制化构建,领域认知智能突破,探索小样本场景演进架构设计…
招聘城市:北京
…等核心算法研发,持续优化Agent的自主决策能力、交互自然度及业务转化率;
3. LLM后训练与Agent微调:聚焦大模型的指令微调(SFT)、人类反馈强化学习(RLHF/RLVR)等后训练技术,结合Agent场景定制偏好对齐策略,基于Agentic RL提升模型在复杂多轮对话与多步推理任务中的表现;
4. Agent效果评估与规模化落地:构建面向Agent系统的自动化评测体系,与工程、产品团队紧密协作,将Agent研究成果快速转化为线上直播场景的产品能力,驱动数字人直播从"被动展示"到"主动智能运营"的规模化升级。
任职要求:
【任职资格】
基本要求:
1. 2027届硕士及以上毕业生,计算机科学、人工智能、机器学习、NLP等相关专业;
2. 扎实的深度学习理论基础…
招聘城市:北京,上海,深圳
…虚拟人交互、多模态理解等领域持续沉淀行业领先的技术成果。
研究方向包括但不限于:
1、基于多模态预训练和后训练相关技术创新,提升多模态大模型在OCR、文档图表解析、Visual Grounding、细粒度感知、视觉问答等核心视觉理解任务上的能力上限;
2、索多模态强化学习方案创新设计,实现视觉感知、多模态理解等场景下的高性能可信输出和幻觉抑制;
3、增强模型的视觉推理能力(Visual CoT、PRM等)、工具调用与Agent能力、长上下文视觉理解能力和GUI能力,提升模型在视觉感知、理解、规划决策的长程复杂任务上的综合表现。
任职要求:
1、具备视觉多模态大模型的预训练或后训练研究经历;
2、熟悉PyTorch,有充分的动手…
招聘城市:北京,上海
…库中的每一种信息形态都能被精准理解和召回。
2、Agent 强化学习与自主规划探索基于 RL 的工具调用与任务规划能力,实现多轮多步骤复杂办公任务的自主执行,构建具备长期记忆与自我进化能力的下一代办公 Agent
3、大模型可信度与幻觉抑制研究幻觉检测与抑制技术,构建事实一致性评估体系与证据链追溯机制,确保企业级知识问答输出的每一个字都经得起验证。
任职要求:
【岗位要求】
1. 2027届硕士及以上学历,计算机、人工智能、数学等相关专业。
2. 扎实的深度学习理论基础,精通PyTorch等主流框架,具备独立复现和改进前沿模型的能力。
3. 在NLP/多模态/强化学习至少一个方向有深入研究经验。
4. 具有出色的分析…
招聘城市:北京
…项目。
2.参与过大规模多模态模型训练,或对分布式训练、推理优化、量化、蒸馏、投机解码、多模态Serving优化等有动手经验。
3.具有跨学科视野,能够将运筹优化、时空建模、视觉感知、因果推理、强化学习等方法引入多模态Agent与后训练体系。
【为什么是我们】
1.真实战场:千万级日订单、百万级骑手,提供业界罕见的Agent大规模真实落地环境,不止是玩具Demo。
2.资源保障:充足的GPU集群资源,支持千卡规模的后训练实验,让想法落地不被算力卡脖子。
3.成果导向:团队鼓励发表顶会论文,内部有完善的学术合作通道。
4.高密度氛围:团队论文产出稳定,曾获美团技术突破奖、啃下硬骨头奖等荣誉,与多所顶尖高校保持长期联合研究
招聘城市:北京,上海
…Research,也有直接的落地场景。
研究方向
1. 探索模型通过 RL Scaling 等方式使用成套工具解决复杂问题的行动和规划能力,包括 Human in the Loop 多轮交互下 Agent 基础建模的新方案、以及与复杂环境的交互学习能力。
2. 探索模型在 Non-Rule Based Outcome 场景下利用复杂信息进行有效 Reasoning 推理的范式,包括 Proactive Agent 的建模方案 。
3. 探索研究更多内在奖励的机制,从而激发模型主动学习和自我更新的能力。
4. 探索构建长期记忆机制,为下一代高效的推理模型、长序列推理及建模提供基础。
任职要求:
1. 博士在读优先,计算机、人工智能、自动化、数学、物理等相关专业。
2.在强化学习、语言模型、机器学习等一个或多个领域有较深入的研究者。
3…
招聘城市:北京
研究方向
1. 知识迁移与新一代时空基础模型:利用 LLM 的预训练知识与元学习(Meta-learning)能力,设计适配时序与图数据的新一代时空表征架构。探索从“任务特定模型”向“时空通用基础模型”的转变,提升系统在复杂多变环境下的泛化精度,重点优化长尾小场景的建模精度
2. 多商家选择视角的用户需求因果建模:研究如何将LLM的全局规划能力与因果推断(Causal Inference)深度融合。在多商家选择竞争下,利用LLM 辅助识别用户对时间的真实需求,构建反事实推理模型,实现有限资源下的用户需求与履约供给的最优匹配决策。
3. 基于 LLM-Agent 的系统级序贯规划:将配送时间决策建模为动态流水线中的时延分配(Deadline Assignment)问题。研究
招聘城市:北京
…混合并行、多机通信优化及资源调度等方向
5.熟悉自动驾驶算法体系,理解感知、预测、规划、端到端模型或世界模型等方向的核心技术架构与工程挑战;
6.具备优秀的跨团队协作与技术领导能力,能够主导复杂项目推进,并影响多团队技术方向与工程实践。
加分项:
1.有开源项目贡献、顶会论文或行业影响力成果;
2.有 AI Agent、自动化研发平台或 AI Native Workflow 建设经验。
【为什么是我们】
1.深度参与下一代自动驾驶基础模型(Foundation Model)与 AI Native 自动驾驶体系建设,探索多模态大模型、世界模型(World Model)、强化学习与生成式 AI 在真实复杂场景中的产业化落地;
2.面向千万级数据规模与超大规模算力集群,建设业界领先…
招聘城市:北京
北斗】自动驾驶算法系统研究
更新时间:2026-06-11
工作地点:北京市
事业群:软硬件服务-无人车业务部
岗位职责
【愿景】
美团是中国领先的生活服务科技平台,拥有覆盖数千万商户与数亿用户的真实履约网络。美团无人车是国内率先实现城市道路无人配送规模化运营的团队,累计完成超百万订单的真实配送里程。我们正在推动无人车感知系统从模块化架构向端到端智能架构的代际跃迁——让无人车从"按规则行驶"进化为"像人一样看懂世界、自主决策"。
【岗位职责】
1.负责下一代自动驾驶 AI Infra 与基础模型体系建设,探索并落地多模态大模型、生成式模型、强化学习、世界模型(World Model)、视觉语言模型(VLM)等前沿…
招聘城市:北京,上海
…快速学习新领域的能力
能够将业务需求转化为Agent系统设计方案,具备系统架构思维
4. 领域热情
对AI Coding、代码生成或LLM+RL结合方向有强烈探索欲
Agent技术、智能体自主决策有浓厚兴趣,关注业界最新进展
5. 开源精神
热爱技术分享,有开源项目或技术博客者优先
Agent相关开源项目贡献者优先
【岗位吸引力】
1.前沿技术攻坚:主导基于 Post-training、强化学习的代码生成与优化技术研发,构建工业级 AI 编程解决方案,突破开发效率极限。
2.复杂场景落地:攻克真实业务场景中的代码生成、质量提升与性能调优等挑战,推动 LLM+RL 在代码理解领域的创新落地,建立可量化的开发效能体系。
3.跨领域创新:与顶尖的 AI 研究