牛大妈在校招职位搜索Ace顶尖实习生Agentic+RL技术研究 有 4 条结果

招聘城市:北京,上海,杭州

研究重点包括:如何构建trajectory-level reward、如何在工具调用与多步推理中进行credit assignment,以及如何在高成本环境下进行高效的offline/online混合训练。平台提供真实任务环境与多样化Agent执行数据,使研究从离线benchmark走向真实交互场景。该方向有望推动RL从模型对齐走向复杂任务能力学习,形成新一代Agent优化范式。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、扎实的编程能力和算法功底,熟练掌握Python/C++/Java等至少一种编程语言;
3、扎实的机器学习/深度学习理论基础,有大规模推荐系统、计算广告、搜索引擎等核心算法项目经验;
3、有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目…
招聘城市:北京,上海,杭州
…采样数据与高频梯度更新的能力,传统的单机或小规模集群已难以满足算力与吞吐的指数级增长。
本课题旨在研究并构建一套高扩展、低延迟的大规模RL训练框架,核心内容涵盖分布式采样引擎的优化、异构算力资源的高效调度、以及计算与通信的深度并行化策略。然而,该领域面临着严峻的技术挑战:
一是如何在保持高吞吐采样(High Throughput)的同时,解决分布式环境下数据回传的通信瓶颈(Communication Bottleneck);
二是针对RL特有的数据非平稳性,如何保障在大规模异步训练下的算法收敛稳定性与超参数鲁棒性;三是涉及CPU仿真环境与GPU神经网络训练之间的精细负载均衡,以最大化集群利用率并…
招聘城市:北京,上海,杭州,深圳

本课题聚焦全模态Agent(GUI操作、代码生成、网页导航)在长程交互任务领域的算法研究。旨在解决Agent执行跨越数百至数千步的复杂任务时,传统强化学习仅依赖终态奖励信号,导致信用分配路径过长、梯度信号衰减,策略优化难以收敛的问题。研究方向包括:设计层次化时间抽象信用分配机制,缓解长程任务中flat policy的优化不稳定问题;设计验证跨模态可验证奖励机制,抑制Reward hacking对训练过程的干扰,实现全模态长程Agentic RL 稳定收敛。该研究成果将在WebArena、SWE-bench等主流评测基准上验证方法的有效性,应用于公司内社区生态Agent基座、AI跨模态深度搜索等业务场景,并集成至自研开源的强化学习引擎Relax,增强业界影响力…
招聘城市:北京,上海,杭州
…负载持续增长等问题,缺乏有效的自我监控与恢复能力。研究将围绕复杂真实多样的 RL 训练环境合成、特定场景下长程稀疏奖励下关键决策步骤的信用归因,以及主动规划与长程目标对齐等核心问题展开。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟练掌握至少一门编程语言,包括但不限于Python等;
3、有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目经验者优先;
4、在TPAMI/CVPR/NeurIPS/ICCV/ICML/ICLR等顶级期刊会议上发表相关论文者优先;
5、良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,推进技术进步。