招聘城市:北京,上海
…到端软件工程自动化,大模型 Coding 能力的突破正在重塑整个软件开发范式。我们正在构建下一代具有强大代码生成与自主 Agent 能力的基座模型,打造可在真实工程环境中独立运作的 AI 开发者。
岗位职责
1、负责基座大模型在代码生成、代码理解、代码 debug 等方向的能力研究与提升,提升模型在Coding任务中的 Planning、长上下文理解等核心能力。
2、探索模型在 repo 级代码理解、跨文件修改、自主 debug 等复杂任务上的能力边界。
3、参与 Post-training(SFT / RL/ PRM)等 Alignment 方法在 Coding 场景的研究与落地。
任职要求:
1、熟悉NLP、LLM、MLsys、Optimization、OR、Control、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验…
招聘城市:北京,上海
…大模型架构优化探索,算法工程协同设计,涉及到训练和推理的各类算法和工程策略探索落地。参与美团基座大模型项目,包含但不限于:
1、大模型高效架构设计探索(高效attention,moe架构等)。
2、预训练 / 后训练算法工程策略。
3、投机推理算法工程策略。
4、模型轻量化策略(剪枝,量化,稀疏,蒸馏,结构搜索等) 。
5、Agentic coding系统优化策略。
任职要求:
1、熟悉一些常用的深度学习框架和大规模训推框架(比如megatron,verl,vllm,sglang等等),在大模型上有训练和推理算法工程优化实际经验的优先;
2、熟悉机器学习和深度学习理论,具备扎实的编程能力,熟悉常见的主流大模型架构;
3、有大模型或机器学习相关顶会论文发表,特别是模型架构…
招聘城市:北京,上海
岗位职责:
简介:从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于:
1、探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向。
2、探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成。
3、探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代…
招聘城市:北京,上海,深圳
…设计,实现视觉感知与多模态理解场景下的高性能可信输出与幻觉抑制。
3、视觉推理能力增强研究(Visual CoT、PRM 等),提升模型在复杂视觉任务上的推理深度。
4、工具调用与 Agent 能力构建,探索多模态模型在规划决策场景中的综合表现。
5、长上下文视觉理解与 GUI 能力研究,提升模型在长程复杂任务上的综合能力。
6、其他你坚信路线正确的多模态大模型前沿方向。
任职要求:
1、具备视觉多模态大模型的预训练或后训练研究经历;
2、熟悉PyTorch,有充分的动手实践经验。
加分项:
1、社区影响力:在多模态大模型领域有影响力的开源项目中做出过核心贡献;
2、学术影响力:发表过高水平论文(如ICLR、CVPR…
招聘城市:北京,上海
…下一代大模型训练范式,从模型结构、训练策略、数据策略、算力利用率等角度切入,打造具有更强能力和更高潜力的基座模型
1、设计更高效的模型结构,提高给定数据量、计算量、硬件资源、输出序列长度等约束下的模型能力,如长序列能力、记忆能力等。
2、探索更科学和前沿的训练策略,对影响training dynamic的关键变量(如学习率、batchsize、初始化等)形成更科学的认知,探索diffusion LLM,test-time scaling等技术。
3、研究模型结构和数据的耦合关系,优化分阶段训练范式。
4、结合MLsys解决大规模训练中遇到的卡点问题,实现算法和工程联合设计。
任职要求:
1、熟悉NLP、LLM、MLsys、Optimization、OR、Control、RL等相关领域,对其中一个或多个方向…
招聘城市:北京,上海
岗位职责:
简介:Reasoning(推理)是大模型理解和处理信息的核心能力,是通用智能水平逼近的重要观测维度。本课题聚焦于探究生成式模型的高级推理发生机制,提升大模型在复杂任务上的推理表现。
研究内容包括但不限于:
1、复杂任务推理应用效果优化,诸如逻辑推理、数学推理、代码推理、跨模态推理、多模型决策等。
2、RL scaling,通过大规模强化学习持续提升模型推理能力。
3、Test time scaling,通过增加inference时消耗的算力持续提升模型推理能力。
任职要求:
1、熟悉NLP、LLM、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验;
2、熟悉Python、C++等至少一门编程语言,熟悉LINUX环境;
3、熟悉 Megatron、DeepSpeed 等开源训练…
招聘城市:北京,上海,深圳
…方向:
1、多模态大模型基座:探索并不断突破多模态基座模型的能力上限。具体地,负责大模型相关技术前沿探索,包括但不限于融合模型架构探索、原生训练范式探索、高效训推框架探索等,不断提升模型的理解能力、生成质量、多样性、可控性等。负责不同规模、不同结构的多模态模型的数据准备和优化,构建多模态数据处理流程等。
2、视频多模态能力提升:负责解决多模态视频大模型领域的前沿技术难题,如视频后训练、长视频时序理解、音视频等,探索短视频、长视频、视频流等不同形态的视频多模态方案,探究图像、视频统一的多模态解决方案。
3、视觉基座表征能力提升:面向不同的多模态架构和训练范式,从视觉基座…
招聘城市:北京,上海
…合成数据生产、高质量 Prompt Engineering 等。优化模型复杂指令遵循、逻辑推理、创作写作、代码生成以及工具调用等能力,提升模型综合能力和用户体验。
2、人类偏好对齐:包括奖励模型、人类偏好对齐等前沿强化算法的探索和实践,提升模型在包括创意写作、对话风格以及模型内生安全对齐等人类偏好上的可控性,生成更符合人类价值观、逻辑习惯和审美偏好的内容。
3、跟踪并实现最新的后训练技术(如数据领域自动化配比、后训练机制设计和优化等)。
任职要求:
1、硕士及以上学历,计算机、人工智能、数学等相关专业,博士优先;
2、熟悉NLP、LLM、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实践经验;
3、有较强的…
招聘城市:北京,上海
岗位职责:
简介:多模态训练pretrain和posttrain的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、超长序列的高效pretrain训练方案。
2、基于投机采样的方式加速多模态RL的训练效率。
3、针对compute use场景的大规模agentic RL 高效训练方案探索。
任职要求:
1、精通 C++/Python,熟悉 CUDA 编程、NCCL 通信库或 RDMA 网络优化;
2、具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心;
3、至少深入研读过 Megatron-LM, vLLM, Sglang, VERL 其中之一的源码,并有过定制化修改或性能调优经历。
加分项目:
1、有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文);
2、熟悉…
招聘城市:北京,上海
岗位职责:
简介:负责大规模强化学习系统设计、分布式调优、调度优化、算法 co-design等,包括不限于 RLHF、RLVR、Agentic RL等范式。和算法共同提升模型各类专项能力,应用生产力等等
你可能从事以下方向:
1、RL训练系统架构
①设计和实现支持 PPO及各类变种算法的高效训练框架。
②Data/Env Scaling,优化并发调度效率 。
2、在线采样 & Rollout 优化
①优化RL场景(longcot、长尾分布、多轮交互)推理引擎效率,包括不限于量化、MTP、并行切分等等。
②训推混部署、全流程异步训练,提升 GPU 利用率。
3、 训推一致性
①训推引擎天然为了各自最大化效率存在精度差异,研究如何不断降低两者diff,包括不限于 Routing Replay、确定性计算等等。
4、训练稳定性
①攻克…
招聘城市:北京,上海
岗位职责:
简介:打造 world class,production ready 的大模型推理引擎,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、异构硬件高性能推理算子研究与开发。
2、Model System Co -design,充分利用硬件特性。
3、Scale up & scale out 分布式推理系统设计,高效可靠的推理调度体系。
4、投机推理算法研究与落地。
5、模型/KVCache 量化算法研究与算子开发。
任职要求:
1、具有扎实的编程功底,熟悉 C++/CUDA 编程最佳;
2、深入理解 Transformer/MoE/Attention 等 LLM 概念;
3、熟悉 RDMA,PD 分离等技术;
4、有一手的开源推理引擎使用/开发/调优经验最佳。
招聘城市:北京,上海
岗位职责:
简介:参与面向大模型训练/推理的高性能计算与系统优化工作,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、面向GPU/NPU 等多硬件平台的算子开发与极致性能优化(CUDA/Cutlass/TileLang)。
2、跟踪前沿模型算法并完成高性能工程落地,深入框架层开展算子融合、内存/通信优化、流水编排等系统级性能调优。
3、探索基于大模型的高性能 Kernel 自动合成技术,参考 LLM-driven Kernel Generation 范式,研究高效 GPU/NPU Kernel 的端到端自动生成与迭代优化方法。
4、基于DSL(如 Triton、TVM TIR、Halide 等)的编译优化与自动调优技术研究。
5、多硬件后端(NVIDIA/国产芯片)的统一算子库建设与迁移适配。
任职要求:
1、GPU编程:写过…
招聘城市:北京,上海
…这是工程复杂度最高、也最能锻炼系统能力的地方。
你可能会做以下方向研究:
1、超大规模分布式训练
①设计和优化ND并行(EP/CP/DP/TP/PP)+ MoE并行混合策略,支撑万亿参数模型训练。
②深入 Megatron-LM 内核,针对美团模型架构做定制化设计、改造,性能优化。
③解决流水线气泡、显存碎片、梯度累积等大规模训练特有的工程难题,细粒度控制平衡计算通行的精度和效率。
2、计算 & 算子优化
①基于 CUDA / Triton 开发高性能训练算子(FlashAttention变体、FusedMLP、RMSNorm等)。
②推进 8bit、4bit 混合精度训练落地,在精度与速度之间找到最优平衡。
③通过 profiling 定位热点,把MFU(模型算力利用率)推向理论上限。
3、通信链路优化
①深挖 NCCL / RDMA / InfiniBand…
招聘城市:北京,上海
岗位职责:
简介:大模型的能力上限,很大程度取决于训练系统的天花板。我们在做的事:让千亿参数的模型在万卡集群上跑得更快、更稳、更省——把每一张GPU的算力榨干,把每一次训练崩溃的损失降到最低,把工程师等待结果的时间从“几天”压到“几小时”。
1、分布式训练框架优化
①深入源码,针对美团训练场景做定制化改造。
②设计和实现更高效的张量并行、流水线并行、数据并行混合策略。
③探索 MoE(混合专家) 模型的并行训练方案,解决专家负载均衡、通信爆炸等硬问题。
2、计算效率优化
①基于 CUDA / Triton 编写和优化高性能算子(FlashAttention、FusedMLP等)。
②分析训练 profiling 数据,定位计算/通信/内存的瓶颈…
招聘城市:北京,上海
…模型、音视频联合生成等,思考在模态统一、任务统一和多种模态联合生成过程带来新的能力跃迁并进行度量,分析模态和任务间的相互关联,指引模型架构、训练策略等选型。
3、多模交互方向:包括通用世界模型、音视频交互等,研究动态多轮交互中的一致性、真实性和长程记忆等关键能力的自动化度量,指引基座模型的迭代。
任职要求:
1、硕士及以上学历,计算机或相关专业,博士优先。;
2、在 ML / NLP / RL / CV / Speech 等相关方向有扎实的研究基础,在 ACL / EMNLP / NAACL / NeurIPS / ICML / ICLR / CVPR / ICCV / ICASSP 等顶级会议发表论文者优先;
3、优秀的代码和算法功底,具备工匠精神,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
4、在大模型…
招聘城市:北京,上海
…研发基于模型的高效数据质量评估、去重与清洗算法,提高数据质量、多样性和覆盖度。
2、深入探究数据分布与模型能力的因果关系,建立“训练数据-模型效果”归因机制,探索并突破基座模型的能力上限。
3、探索自动化数据筛选机制、动态配比(Data Mixture)与多阶段训练范式,探索不同类型数据对模型能力的Scaling Law。
4、构建科学、多维度的基座模型能力和潜力评估,驱动预训练数据策略的优化,形成高效的数据迭代闭环。
任职要求:
1、硕士及以上学历,计算机、人工智能、数学、NLP等相关专业,博士优先;
2、在大模型领域有研究基础,或参与过有影响力的开源项目,在ICLR/NeurIPS/ICML/ACL等顶会发表论文者优先;
3、对大模型有浓厚…
招聘城市:北京,上海,深圳
…与世界模型方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、高效率、低损失、高压缩比的图像视频 VAE 和 tokenizer 研究。
2、统一生成模型的架构、训练与推理探索(稀疏架构、大尺寸 MoE、自回归生成等)。
3、功能模型研究,包括参考生成、长视频生成、流式实时视频生成、音视频生成等。
4、隐式世界模型、WorldActionModel 及 Action-conditioned WorldModel 的方法研究。
5、世界模型在具身智能、实时交互等场景中的应用探索。
6、其他你坚信路线正确的视觉生成与世界模型前沿方向。
任职要求:
1、熟悉扩散模型、VAE等相关研究进展;
2、熟悉PyTorch,有充分的动手实践经验。
加分项:
1、有图像/视频生成、Video-based世界模型相关研究和实习经历…
招聘城市:北京,上海
岗位职责:
简介:原生多模态旨在以统一的范式处理文本、视觉、语音等各个模态的数据,从而更加自然地进行模态融合,以及通过scaling友好的训练范式,解锁模型智能的新维度。
研究课题包括但不限于:
1、探索early fusion阶段,引入图文交错/audio等多模态序列数据自监督预训练带来的scaling价值。
2、原生全模态预训练的training dynamic探究,模态之间的关系建模。
3、通过SFT / RL等手段,借助多模态token解锁模型新的智能维度,提升模型解决Robot/Gaming等物理世界问题的能力。
任职要求:
岗位要求:
1、熟悉NLP、LLM、MLLM、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验;
2、熟悉Python、C++等至少一门编程语言,熟悉…
招聘城市:北京,上海
…职责:
随着大语言模型从通用问答走向复杂任务执行,Agent能力正成为模型演进的关键方向。传统大模型虽具备海量知识,但面对复杂任务的自主规划、工具调用及长期记忆管理时,往往难以应对。本课题旨在探索Midtrain这一关键阶段,推动通用基座模型向原生Agentic Foundation Model演进,为构建下一代自主智能体提供坚实的底座支持。
1. 大规模高质量数据体系与合成数据建设
数据体系构建:建设 Trillion 级别的大规模跨模态数据处理与合成链路。负责从训练数据获取到配比建模的全流程优化
合成方法演进:探索大规模合成数据 (Synthetic Data) 与自蒸馏 (Self-distillation) 技术,制定合成数据应用策略
理论探索:研究Data Scaling Laws,解决数据扩展中的模型坍塌(Model Collapse…
招聘城市:北京,上海
…方向覆盖数据计算与商业分析、精准营销与广告投放、个人助理与智能服务三大场景,致力于用 AI Agent 重构人与数据、人与服务的交互方式。
【技术方向】
1、DataAgent 核心基建:攻坚复杂长周期任务的调度架构,解决大规模数据流转下的上下文治理、长期记忆与状态流控难题。
2、BA 场景工具链:构建高扩展性数据处理 Skill 体系与安全高效的代码执行沙盒,支持 Agent 智能调度高并发数据流处理工具。
3、精准营销 Agent:基于海量用户行为数据的宏观统计与微观推理,探索精细化需求理解与大小模型协同的高效系统设计。
4、Skill 体系与模型优化:探索 Skill 的表示、调度与自进化机制;推进 Agentic RL、自适应推理等模型训练与…