…同时处理极度稀疏的异构静态 Field 特征与用户动态的历史行为特征 Sequence 。尽管业界正试图将非序列多域特征与用户兴趣序列融合,但统一架构面临着一个未被充分探讨的障碍:我们称之为序列坍塌传播效应 (Sequential Collapse Propagation, SCP) 。由于非序列特征往往信息稀疏且容易陷入低维子空间,它们在统一框架模块中会污染并压垮序列特征的维度 。TokenFormer 的提出则是为解决这类问题。图1-1 TokenFormer 在判别力与维度鲁棒性上的消融对比如图1-1的实验分析所示:左图:由互信息(MI)衡量的表征判别力(Discriminability)。右图:由奇异值谱与有效秩衡量的维度鲁棒性(Dimensional Robustness)。与纯序列的 Transformer(绿色曲线)相比,使用标准…
牛大妈在校招职位搜索Rails框架 有 1000+ 条结果
招聘城市:北京
岗位职责:
工作职责:
1.社区运营:负责 RelaxRL 开源引擎的社区日常维护,包括 GitHub、技术论坛等渠道的内容发布与互动,提升开源社区活跃度与影响力
2.活动策划:策划并落地线上/线下开源运营活动,包括技术沙龙、开源贡献活动、Hackathon 等,覆盖活动全流程的组织与执行
3.内容生产:协助算法一同撰写引擎技术介绍、使用教程、活动推文等对外内容,协同技术团队进行内容审校与传播
4.数据监控:跟踪各渠道传播数据与社区增长指标,分析活动效果,持续优化运营策略
5.竞品调研:持续关注国内外主流开源推理引擎(如 vLLM、TensorRT-LLM 等)的社区运营动态,为 RelaxRL 的对外推广提供参考与建议
任职要求:
任职资格:
1.有活动策划或组织经验,能够独立…
岗位职责:
工作职责:
1.社区运营:负责 RelaxRL 开源引擎的社区日常维护,包括 GitHub、技术论坛等渠道的内容发布与互动,提升开源社区活跃度与影响力
2.活动策划:策划并落地线上/线下开源运营活动,包括技术沙龙、开源贡献活动、Hackathon 等,覆盖活动全流程的组织与执行
3.内容生产:协助算法一同撰写引擎技术介绍、使用教程、活动推文等对外内容,协同技术团队进行内容审校与传播
4.数据监控:跟踪各渠道传播数据与社区增长指标,分析活动效果,持续优化运营策略
5.竞品调研:持续关注国内外主流开源推理引擎(如 vLLM、TensorRT-LLM 等)的社区运营动态,为 RelaxRL 的对外推广提供参考与建议
任职要求:
任职资格:
1.有活动策划或组织经验,能够独立…
招聘城市:北京,上海
…节点通信效率,充分释放硬件潜力。
【为什么是我们】
1.直面大模型时代最核心的工程挑战——用极致的系统优化,打破推理成本与性能的边界。
2.从大规模集群的分布式调度,到底层算子的硬件性能榨取;从长上下文场景的显存革命,到模型-系统协同设计的未来架构。每一行代码,都将直接影响千亿级Token的推理效率,改善数亿用户的线上服务体验。
任职要求:
1.理论基础,深入理解Transformer架构核心机制(Attention/MoE/Memory等),熟悉大模型训练流程及推理流程。
2.工程能力,熟悉主流推理框架(SGLang/vLLM)源码,对PD分离、模型量化 、投机推理、调度重叠、前缀缓存 等关键技术有实战落地经验。精通C++/CUDA/AscendC,具备复杂算子(如FlashAttention、量化GEMM等)的开发与…
…节点通信效率,充分释放硬件潜力。
【为什么是我们】
1.直面大模型时代最核心的工程挑战——用极致的系统优化,打破推理成本与性能的边界。
2.从大规模集群的分布式调度,到底层算子的硬件性能榨取;从长上下文场景的显存革命,到模型-系统协同设计的未来架构。每一行代码,都将直接影响千亿级Token的推理效率,改善数亿用户的线上服务体验。
任职要求:
1.理论基础,深入理解Transformer架构核心机制(Attention/MoE/Memory等),熟悉大模型训练流程及推理流程。
2.工程能力,熟悉主流推理框架(SGLang/vLLM)源码,对PD分离、模型量化 、投机推理、调度重叠、前缀缓存 等关键技术有实战落地经验。精通C++/CUDA/AscendC,具备复杂算子(如FlashAttention、量化GEMM等)的开发与…
小红书(xiaohongshu) 大模型训练基础架构实习生
兼职 北京,上海
招聘城市:北京,上海
…前沿场景上规模落地。
1、参与开发支持下一代多模态生成式搜广推超大规模(百亿-万亿级)模型的GPU千卡互联分布式训练框架。
2、与公司算法同学深度合作,为重点项目进行算法与训练框架的联合优化。
3、支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2. 熟悉C/C++/CUDA,具备扎实的系统底层能力(内存、并发、网络)。
3. 有大规模分布式系统开发和优化经验;有大模型分布式训练经验者优先。
4. 接触过Megatron/DeepSpeed/veRL/OpenRLHF/LLaMA-Factory/MLIR/TVM/Triton/TileLang等分布式异构计算框架中的一个。
5. 熟悉常见深度…
…前沿场景上规模落地。
1、参与开发支持下一代多模态生成式搜广推超大规模(百亿-万亿级)模型的GPU千卡互联分布式训练框架。
2、与公司算法同学深度合作,为重点项目进行算法与训练框架的联合优化。
3、支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2. 熟悉C/C++/CUDA,具备扎实的系统底层能力(内存、并发、网络)。
3. 有大规模分布式系统开发和优化经验;有大模型分布式训练经验者优先。
4. 接触过Megatron/DeepSpeed/veRL/OpenRLHF/LLaMA-Factory/MLIR/TVM/Triton/TileLang等分布式异构计算框架中的一个。
5. 熟悉常见深度…
招聘城市:上海
…场景的 GPU 资源调度体系,支持多租户资源共享、弹性扩缩容、任务优先级管理及异构算力调度,提高集群整体
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1、技术底色: 计算机相关专业,具有较强的系统编程能力,精通 Python 和 C/C++。
2、计算底层: 熟悉 NVIDIA GPU 架构 (Hopper/Ampere/Blackwall),理解显存层次结构、流处理器(SM)工作原理。
3、框架经验: 熟悉 PyTorch 等深度学习框架,具有训练或推理性能优化经验者优先;阅读过 Megatron、DeepSpeed、vLLM、TensorRT-LLM 等开源项目源码者优先。
4、并行与分布式计算: 理解并行计算与分布式系统基本原理,了解数据并行(DP)、张量并行(TP)、流水线并行(PP)等常见大模型训练技术,有…
…场景的 GPU 资源调度体系,支持多租户资源共享、弹性扩缩容、任务优先级管理及异构算力调度,提高集群整体
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1、技术底色: 计算机相关专业,具有较强的系统编程能力,精通 Python 和 C/C++。
2、计算底层: 熟悉 NVIDIA GPU 架构 (Hopper/Ampere/Blackwall),理解显存层次结构、流处理器(SM)工作原理。
3、框架经验: 熟悉 PyTorch 等深度学习框架,具有训练或推理性能优化经验者优先;阅读过 Megatron、DeepSpeed、vLLM、TensorRT-LLM 等开源项目源码者优先。
4、并行与分布式计算: 理解并行计算与分布式系统基本原理,了解数据并行(DP)、张量并行(TP)、流水线并行(PP)等常见大模型训练技术,有…
美团(meituan) 【北斗】大规模沙盒系统架构师
全职 北京,上海
招聘城市:北京,上海
岗位职责:
【愿景】
美团龙猫基座大模型,不只聪明,更懂生活。从语言理解到全模态感知,从架构创新到极致推理,从海量预训练到亿级真实订单 —— 我们造的不仅是实验室里的“优等生”,更是活在大街小巷、三餐四季里的AI。 而我们想做的远不止于此 —— 让模型自己提出假设、训练自己、不断进化; 让一群智能体像团队一样分工协作、攻克复杂问题; 让 AI 走出屏幕,理解物理世界、走进真实场景。 这是我们正在冲刺的方向,也是你可以参与定义的未来。 加入我们,一起把智能带进真实物理世界,亲手打造下一代 AGI!
【团队介绍】
基座大模型AI Infra团队,以支撑前沿基础模型持续演进为目标,面向大模型研发与…
岗位职责:
【愿景】
美团龙猫基座大模型,不只聪明,更懂生活。从语言理解到全模态感知,从架构创新到极致推理,从海量预训练到亿级真实订单 —— 我们造的不仅是实验室里的“优等生”,更是活在大街小巷、三餐四季里的AI。 而我们想做的远不止于此 —— 让模型自己提出假设、训练自己、不断进化; 让一群智能体像团队一样分工协作、攻克复杂问题; 让 AI 走出屏幕,理解物理世界、走进真实场景。 这是我们正在冲刺的方向,也是你可以参与定义的未来。 加入我们,一起把智能带进真实物理世界,亲手打造下一代 AGI!
【团队介绍】
基座大模型AI Infra团队,以支撑前沿基础模型持续演进为目标,面向大模型研发与…
小红书 Java开发实习生-引擎架构
兼职 北京,上海
招聘城市:北京,上海
…推荐业务,满足产品、算法对于核心引擎或者基础平台的功能需求
2、抽象通用的业务开发框架与组件,提升业务支持效率,将现有技术逐步平台化和产品化
3、参与搜索引擎、推荐引擎、模型预测、向量检索等基础系统、平台的设计、研发及调优工作,提升效率降低成本
4. 对搜推&cvnlp类模型推理服务进行性能优化,并支持业务的大模型相关探索
任职要求:
1、熟悉Java语言,了解JVM原理,了解面向对象编程细想,了解集合、IO、多线程、网络编程等知识;
2、熟悉常用设计模式,能在编码中灵活使用多种设计模式,了解数据结构及常用算法;
3、熟悉Spring等主流开发框架,能在编码时灵活使用Spring功能特性;
4、熟悉MySQLl基本原理,了解SQL基本调…
…推荐业务,满足产品、算法对于核心引擎或者基础平台的功能需求
2、抽象通用的业务开发框架与组件,提升业务支持效率,将现有技术逐步平台化和产品化
3、参与搜索引擎、推荐引擎、模型预测、向量检索等基础系统、平台的设计、研发及调优工作,提升效率降低成本
4. 对搜推&cvnlp类模型推理服务进行性能优化,并支持业务的大模型相关探索
任职要求:
1、熟悉Java语言,了解JVM原理,了解面向对象编程细想,了解集合、IO、多线程、网络编程等知识;
2、熟悉常用设计模式,能在编码中灵活使用多种设计模式,了解数据结构及常用算法;
3、熟悉Spring等主流开发框架,能在编码时灵活使用Spring功能特性;
4、熟悉MySQLl基本原理,了解SQL基本调…
美团(meituan) 【基座大模型北斗实习】大模型架构研究
兼职 北京,上海
招聘城市:北京,上海
…训练和推理的各类算法和工程策略探索落地。参与美团基座大模型项目,包含但不限于:
1、大模型高效架构设计探索(高效attention,moe架构等)。
2、预训练 / 后训练算法工程策略。
3、投机推理算法工程策略。
4、模型轻量化策略(剪枝,量化,稀疏,蒸馏,结构搜索等) 。
5、Agentic coding系统优化策略。
任职要求:
1、熟悉一些常用的深度学习框架和大规模训推框架(比如megatron,verl,vllm,sglang等等),在大模型上有训练和推理算法工程优化实际经验的优先;
2、熟悉机器学习和深度学习理论,具备扎实的编程能力,熟悉常见的主流大模型架构;
3、有大模型或机器学习相关顶会论文发表,特别是模型架构优化,训推策略相关的算法或工程论文优先。
…训练和推理的各类算法和工程策略探索落地。参与美团基座大模型项目,包含但不限于:
1、大模型高效架构设计探索(高效attention,moe架构等)。
2、预训练 / 后训练算法工程策略。
3、投机推理算法工程策略。
4、模型轻量化策略(剪枝,量化,稀疏,蒸馏,结构搜索等) 。
5、Agentic coding系统优化策略。
任职要求:
1、熟悉一些常用的深度学习框架和大规模训推框架(比如megatron,verl,vllm,sglang等等),在大模型上有训练和推理算法工程优化实际经验的优先;
2、熟悉机器学习和深度学习理论,具备扎实的编程能力,熟悉常见的主流大模型架构;
3、有大模型或机器学习相关顶会论文发表,特别是模型架构优化,训推策略相关的算法或工程论文优先。
招聘城市:北京,上海
…2.协同算法团队深度参与大模型项目,Codesign设计并训练行业领先的大模型。
3.从数据规模、集群体量、算法和业务复杂度多个维度提供了技术挑战和锻炼发展的机会,个人成长速度快。
4.追求卓越和鼓励创新的团队氛围。
任职要求:
1.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C++或Python。
2.学习能力强,对机器学习系统优化有技术热情,富有极客精神。
3.熟悉PyTorch框架和TVM/MLIR等编译优化技术的优先。
4.熟悉GPU、NPU硬件架构,熟练使用CUDA,NCCL,RDMA编程的优先。
5.熟悉机器学习、深度学习算法,希望从事工程架构方向的优先。
6.有分布式系统、高性能计算实际项目经验的优先。
7.有开源项目贡献代码…
…2.协同算法团队深度参与大模型项目,Codesign设计并训练行业领先的大模型。
3.从数据规模、集群体量、算法和业务复杂度多个维度提供了技术挑战和锻炼发展的机会,个人成长速度快。
4.追求卓越和鼓励创新的团队氛围。
任职要求:
1.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C++或Python。
2.学习能力强,对机器学习系统优化有技术热情,富有极客精神。
3.熟悉PyTorch框架和TVM/MLIR等编译优化技术的优先。
4.熟悉GPU、NPU硬件架构,熟练使用CUDA,NCCL,RDMA编程的优先。
5.熟悉机器学习、深度学习算法,希望从事工程架构方向的优先。
6.有分布式系统、高性能计算实际项目经验的优先。
7.有开源项目贡献代码…
小红书 大模型分布式训练引擎研发工程师(实习)
兼职 北京,上海
招聘城市:北京,上海
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
小红书(xiaohongshu) 大模型分布式训练引擎研发实习生
兼职 北京,上海,杭州
招聘城市:北京,上海,杭州
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1. 分布式训练底座 (Training Infra)
架构设计: 负责维护和优化基于 Megatron-LM, DeepSpeed, Ray 或 FSDP 的大规模分布式训练框架。
通信优化: 深入优化 H/NCCL 通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。
稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 深度定制或调优 vLLM, TensorRT-LLM, Triton Inference Server 等推理框架。
算子开发: 针对 Transformer 结构编写高性能 CUDA/Triton kernels(如 FlashAttention, PagedAttention 的底层实现或改进)。
资源调度: 优化 K8s 集群下的 GPU 资源调度,实现动态扩缩…
岗位介绍:
职位描述
工作职责:
1. 分布式训练底座 (Training Infra)
架构设计: 负责维护和优化基于 Megatron-LM, DeepSpeed, Ray 或 FSDP 的大规模分布式训练框架。
通信优化: 深入优化 H/NCCL 通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。
稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 深度定制或调优 vLLM, TensorRT-LLM, Triton Inference Server 等推理框架。
算子开发: 针对 Transformer 结构编写高性能 CUDA/Triton kernels(如 FlashAttention, PagedAttention 的底层实现或改进)。
资源调度: 优化 K8s 集群下的 GPU 资源调度,实现动态扩缩…
深圳虾皮信息科技有限公司 Ai训练推理框架工程师
全职 深圳,其它
招聘城市:深圳,其它
…具有良好的团队合作精神,能够与跨部门的团队紧密合作,共同推动项目的成功;5、具备较强的自我驱动力和学习能力,并乐于不断尝试、追求业务突破。加分项:1、熟悉常见的CV、NLP模型,如ViT、GPT等;2、熟悉AI领域常见分布式训练技术的原理和实现,包括但不限于:数据并行、流水线并行和张量并行等,并具有相应的项目经验;3、熟悉一种或多种深度学习框架,如Pytorch、Tensorflow、PaddlePaddle、Deepspeed、Megatron等,能够熟练使用并解决使用中遇到的问题;4、熟悉GPU硬件结构和CUDA计算的原理,有CUDA相关算子开发、调试经验,对NCCL,cuDNN等有一定了解;5、熟悉AI模型训练、微调、评估算法和流程,具有相关项目经验。"
投递说明:
网申/内推…
…具有良好的团队合作精神,能够与跨部门的团队紧密合作,共同推动项目的成功;5、具备较强的自我驱动力和学习能力,并乐于不断尝试、追求业务突破。加分项:1、熟悉常见的CV、NLP模型,如ViT、GPT等;2、熟悉AI领域常见分布式训练技术的原理和实现,包括但不限于:数据并行、流水线并行和张量并行等,并具有相应的项目经验;3、熟悉一种或多种深度学习框架,如Pytorch、Tensorflow、PaddlePaddle、Deepspeed、Megatron等,能够熟练使用并解决使用中遇到的问题;4、熟悉GPU硬件结构和CUDA计算的原理,有CUDA相关算子开发、调试经验,对NCCL,cuDNN等有一定了解;5、熟悉AI模型训练、微调、评估算法和流程,具有相关项目经验。"
投递说明:
网申/内推…
小红书 大模型推理引擎研发工程师(实习)
兼职 北京
招聘城市:北京
…语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等)的…
…语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等)的…
美团(meituan) 【北斗】大模型训推引擎工程师(后训练/推理方向)
全职 北京,上海
招聘城市:北京,上海
…构建面向Agent强化学习的高效Rollout引擎、多模型(Policy/Value/Reward/Reference)多阶段流水线编排及动态负载均衡机制;设计并建设支持高并发、低延迟的工具调用(Tool-use)虚拟环境/沙箱模拟器交互系统。
4.训推一致性协同设计(Co-design):打通训练与推理底层架构,研究在后训练阶段(如在线RL、Iterative DPO)如何实现训练框架与高性能推理引擎的深度融合,降低在线反馈延迟,实现训推一体化高效演进。
方向二:大模型高效推理与加速技术
1.面向Agent场景的动态推理架构:针对Agent多轮对话、工具调用等复杂交互带来的极致动态性,研究智能KV Cache管理优化策略(如动态复用、分级存储、长短时记忆重组),解决长序列及高并发下的显存瓶颈。…
…构建面向Agent强化学习的高效Rollout引擎、多模型(Policy/Value/Reward/Reference)多阶段流水线编排及动态负载均衡机制;设计并建设支持高并发、低延迟的工具调用(Tool-use)虚拟环境/沙箱模拟器交互系统。
4.训推一致性协同设计(Co-design):打通训练与推理底层架构,研究在后训练阶段(如在线RL、Iterative DPO)如何实现训练框架与高性能推理引擎的深度融合,降低在线反馈延迟,实现训推一体化高效演进。
方向二:大模型高效推理与加速技术
1.面向Agent场景的动态推理架构:针对Agent多轮对话、工具调用等复杂交互带来的极致动态性,研究智能KV Cache管理优化策略(如动态复用、分级存储、长短时记忆重组),解决长序列及高并发下的显存瓶颈。…
招聘城市:北京
…模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等…
…模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等…
招聘城市:北京
…模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等…
…模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等…
美团(meituan) 【Longcat实习】大模型训练AI工程师
兼职 北京,上海
招聘城市:北京,上海
…评估新硬件的技术价值,输出选型建议和规模化落地方案
4.方向四:高性能内核
• 定制开发高性能计算内核,深入发掘GPU/NPU等不同硬件架构的优化空间
• 推进算子开发范式的迭代,探索自动化算子生成(如LLM辅助生成高性能kernel)
任职要求:
1.计算机、电子工程、数学等相关专业硕士及以上学历
2.有一定大模型训练/推理/分布式系统相关开发经验
3.熟悉PyTorch/Megatron-LM/DeepSpeed等主流框架中至少一个的内部实现
4.熟悉至少一种分布式并行策略(DP/TP/PP/SP/EP)的原理和实现细节,或有高性能算子开发经验
5.扎实的C++/Python/CUDA编程能力,有性能优化经验
6.有实际参与过10B+参数规模模型训练的项目经验优先
…评估新硬件的技术价值,输出选型建议和规模化落地方案
4.方向四:高性能内核
• 定制开发高性能计算内核,深入发掘GPU/NPU等不同硬件架构的优化空间
• 推进算子开发范式的迭代,探索自动化算子生成(如LLM辅助生成高性能kernel)
任职要求:
1.计算机、电子工程、数学等相关专业硕士及以上学历
2.有一定大模型训练/推理/分布式系统相关开发经验
3.熟悉PyTorch/Megatron-LM/DeepSpeed等主流框架中至少一个的内部实现
4.熟悉至少一种分布式并行策略(DP/TP/PP/SP/EP)的原理和实现细节,或有高性能算子开发经验
5.扎实的C++/Python/CUDA编程能力,有性能优化经验
6.有实际参与过10B+参数规模模型训练的项目经验优先
美团(meituan) 【基座大模型北斗实习】大模型后训练研究
兼职 北京,上海
招聘城市:北京,上海
岗位职责:
简介:负责大规模强化学习系统设计、分布式调优、调度优化、算法 co-design等,包括不限于 RLHF、RLVR、Agentic RL等范式。和算法共同提升模型各类专项能力,应用生产力等等
你可能从事以下方向:
1、RL训练系统架构
①设计和实现支持 PPO及各类变种算法的高效训练框架。
②Data/Env Scaling,优化并发调度效率 。
2、在线采样 & Rollout 优化
①优化RL场景(longcot、长尾分布、多轮交互)推理引擎效率,包括不限于量化、MTP、并行切分等等。
②训推混部署、全流程异步训练,提升 GPU 利用率。
3、 训推一致性
①训推引擎天然为了各自最大化效率存在精度差异,研究如何不断降低两者diff,包括不限于 Routing Replay、确定性计算等等。
4、训练稳定性
①攻克…
岗位职责:
简介:负责大规模强化学习系统设计、分布式调优、调度优化、算法 co-design等,包括不限于 RLHF、RLVR、Agentic RL等范式。和算法共同提升模型各类专项能力,应用生产力等等
你可能从事以下方向:
1、RL训练系统架构
①设计和实现支持 PPO及各类变种算法的高效训练框架。
②Data/Env Scaling,优化并发调度效率 。
2、在线采样 & Rollout 优化
①优化RL场景(longcot、长尾分布、多轮交互)推理引擎效率,包括不限于量化、MTP、并行切分等等。
②训推混部署、全流程异步训练,提升 GPU 利用率。
3、 训推一致性
①训推引擎天然为了各自最大化效率存在精度差异,研究如何不断降低两者diff,包括不限于 Routing Replay、确定性计算等等。
4、训练稳定性
①攻克…
招聘城市:北京,上海
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…