牛大妈在社招职位搜索训推加速工程师-北京 有 23 条结果

招聘城市:上海
岗位职责:
1.GPU机型性能评估: 主导不同GPU芯片(含国产芯片及英伟达等国外AI芯片)的性能对比与适配评估,深入理解芯片架构并搭建配套的基准评估工具链;
2.框架开发与优化:基于云平台和业界常见框架,开发加速方案,满足公有云客户对性能的极致需求;
3.支持主流GPU和异构AI芯片,优化大模型推理性能,打造极致性能成本优势;
4.应用优化:参与重点项目POC和现网问题保障,分析性能瓶颈,快速定位和解决重点问题;
5.前沿技术探索:跟踪学术动态,将最新研究成果转化为框架功能,提升产品竞争力。
岗位要求:
1.熟悉主流的大模型推理框架及其加速技术,如vLLM、SGlang、TensorRT-LLM等,熟练分析单机及分布式…
招聘城市:深圳
…4.参与分离、partial rollout、agent场景开发和优化。
岗位要求:
1.熟悉PyTorch、Megatron等框架,掌握3D并行、ZeRO机制、Flash-Attn等的原理、使用场景、优劣势以及可优化方向;
2.熟悉使用主流推理框架,如vLLM、SGLang,掌握kvcache、量化、投机采样、算子优化等推理优化方法;
3.熟悉常见RL训练算法,如DPO、GRPO、PPO等,理解不同算法的差别和使用场景;
4.熟悉Ray框架,有Ray框架优化经验者优先;
5.熟练掌握CUDA性能优化手段,有算子编写优化项目经验者优先;
6.对大模型、强化学习前沿技术比较敏锐者优先;
7.有实际大模型RL训练,性能和效果优化经验的优先;
8.良好的沟通能力、解决问题能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳…
招聘城市:深圳
…插件及CRD的开发,推动大规模技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下的调度需求;
3.具备OpenMP/MPI/RDMA高性能计算开发经验,熟悉并行计算原理及优化技巧,能够提升大规模训练任务的执行效率;
4.熟悉主流AI框架(Pytorch/TensorFlow等)及训练加速技术(算子优化/显存管理),能够针对AI任务进行深度优化。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳…
招聘城市:深圳
…算法工程,推动深度学习相关算法的落地,打造高吞吐、低延时的推理系统;
2.优化大模型推理性能,提升吞吐并控制成本;
3.优化大模型推理框架,提升框架易用性和可调试性。
岗位要求:
1.熟练掌握 C/C++、Python语言,有计算机体系结构背景或软件开发背景,熟悉系统性能调优的方式;
2.具备基础的GPU编程能力,包括但不限于Cuda、OpenCL,熟悉至少一种GPU加速库,如cublas、cudnn、cutlass等;
3.具备Tensorrt/FasterTransformer/Tensorrt-llm/vllm/sglang等推理引擎的使用和性能优化经验;
4.熟悉各类深度学习网络和算子底层实现细节,具备模型调试、调优实操经验优先;
5.熟悉CPU/GPU异构加速瓶颈分析方法,有服务器端 AI 芯片、GPU加速经验…
招聘城市:北京
…大规模技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动技术与平台能力的升级和创新。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下的调度需求;
3.具备OpenMP/MPI/RDMA高性能计算开发经验,熟悉并行计算原理及优化技巧,能够提升大规模训练任务的执行效率;
4.熟悉主流AI框架(Pytorch/TensorFlow等)及训练加速技术(算子优化/显存管理),能够针对AI任务进行深度优化。
岗位介绍:
在腾讯,后台开发工程不仅是…
招聘城市:北京
…大规模技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动技术与平台能力的升级和创新。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下的调度需求;
3.具备OpenMP/MPI/RDMA高性能计算开发经验,熟悉并行计算原理及优化技巧,能够提升大规模训练任务的执行效率;
4.熟悉主流AI框架(Pytorch/TensorFlow等)及训练加速技术(算子优化/显存管理),能够针对AI任务进行深度优化。
岗位介绍:
在腾讯,后台开发工程不仅是…
招聘城市:深圳
…点,优化数据流转全链路吞吐量,支撑超大规模模型高效训练;
3.基于 Kubernetes、Docker 等云原生技术栈,主导高可用调度框架的架构设计与核心模块开发,深度适配分布式训练框架(如 Megatron-LM、DeepSpeed)需求,实现任务智能编排、自动化容灾与混合部署能力;深入 K8s 调度器源码级优化、CSI 插件定制开发及 CRD 扩展设计,推动大规模一体化技术落地;
4.牵头探索混合云资源池化、虚拟化技术(如 KVM / 容器虚拟化)、ARM 异构计算等前沿方向的技术验证与方案落地,制定技术演进路线图,持续推动计算资源调度平台的能力升级与技术创新;
5.沉淀大规模集群调度最佳实践与技术方法论,主导跨团队技术协作(如框架、硬件、网络团队),解决…
招聘城市:深圳
…熟悉深度学习模型从训练到推理的全链路转化逻辑,具备大模型一体化问题定位(如精度漂移、性能衰减)与优化经验者优先;
5.精通 CPU/GPU 异构计算架构下数据传输瓶颈(PCIe 带宽、内存墙、缓存利用率)分析方法;具备服务器端 AI 芯片(如 NVIDIA H100/A100、昇腾 910)推理性能调优经验,熟悉硬件特性与软件适配策略者优先;
6.精通分布式推理核心技术(张量并行、流水线并行、ZeRO 优化、动态负载均衡),熟悉分布式通信框架(NCCL、MPI)底层原理;主导过千亿级以上参数大模型分布式推理系统部署、性能调优与稳定性保障,具备超大模型推理成本优化实践经验者优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决…
招聘城市:北京
…研核心业务支持:参与腾讯内部核心业务相关框架的交付与迭代。
岗位要求:
1.熟悉主流的大模型推理框架及其加速技术,如vLLM、SGlang、TensorRT-LLM等,熟练分析单机及分布式情况下的性能热点和优化手段;
2.熟悉主流的训练框架和分布式框架,包括Megatron-LM、DeepSpeed、verL、LLama-factory等,熟悉常见的分布式并行策略,了解显存、通信与计算相关性能瓶颈和优化手段;
3.熟悉自动驾驶相关算法者优先,例如BEVformer、MapTRV2、SparseDrive、FlashOCC、Pointpillars等,熟练分析自驾场景的性能瓶颈和优化方案;
4.熟悉CUDA编程、高性能计算优化(如算子融合、通信优化)者优先;
5.熟悉NCCL、MPI等集合通信算法者优先;
6.工程经验上具备大型项目架构设计能力,能独立解决性能…
招聘城市:上海
…搜索相关策略迭代与优化,包含但不限于query理解、planning、RAG及推理增强优化、相关性、知识库建立及LLM生成策略 等核心模块
2. 基于开源LLM的多领域CPT、SFT、RL
工作要求:
【任职要求】
1. 熟悉自然语言处理,大模型,知识图谱等多个算法领域有扎实的理论基础和丰富的研发经验
2. 熟练使用一种LLM训练推理框架如verl、ms-swift、llama-factory、vLLM、SGLang等, 并熟悉相关的主要技术原理
3. 熟悉 spark 、 hadoop 、 hive、faiss 等大数据处理技术, 了解分布式训练、模型压缩和推理加速相关技术
4. 有搜索算法经验/AI应用优化经验/有知名竞赛获奖经历/主导过有影响力的开源项目/有顶会一作发表论文经验者优先考虑
投递简历

小红书 GPU调度研发工程

全职 北京
招聘城市:北京
…小红书内的众多生产场景遍地开花,大模型的训练和部署已成为许多算法工程的日常。在多团队、多业务频繁使用的大规模GPU集群上,如何能够通过高效的GPU调度策略,使大家不仅能丝滑地完成训练及部署任务,同时也能充分激发大规模GPU集群的效能,是行业公认的关键挑战。在这里,你可以聚焦LLM场景,接触到超大规模GPU集群,并使用真实负载数据进行深入分析及技术探索。欢迎加入我们,一起探索领先技术改变世界!
工作职责:
1、负责万卡规模GPU集群效能分析及优化,通过调度策略优化、在离线混部、集群调度、GPU虚拟化、故障快速恢复、存储&网络加速等手段,提升大规模GPU集群的整体使用效率…

小红书(xiaohongshu) GPU调度研发工程/专家

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…在离线混部、集群调度、GPU虚拟化、故障快速恢复、存储&网络加速等手段,提升大规模GPU集群的整体使用效率。
2、负责构建面向大模型训练、微调、推理、部署全流程LLMOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路稳定高效地落地。
3、持续关注业界最新的GPU资源调度相关技术动态,探索建设业界领先的资源调度策略及方法,构建下一代大规模AI资源调度系统。
任职要求:
任职资格:
1、熟悉云原生生态及工具,如Kubernetes、Kubeflow、Volcano等,有GPU虚拟化、GPU集群调度、故障容错、高速存储/网络等经验优先;
2、了解大模型基本概念及生命周期,如预训练、微调、对齐、推理、部署等基本概念及流程,能够支撑大模型平台构建…
招聘城市:深圳
…全 GPU 链路以及基于 UV(User View)的高效样本训练模式等。
加入我们,你将主导这场技术变革,通过极致的算法和工程 Co-Design,大幅提升模型算法迭代效率,最终直接驱动公司营销业务核心 GMV 的增长。
1. 模型 Scaling Up:针对推荐大模型(超大参数量、超长序列特征等),设计并实现序列和非序列特征统一建模新范式。
2. 新一代架构演进:深度参与广告推荐系统核心 AI 基础设施(AI Infra)的设计与研发,推动从传统架构向基于原生 PyTorch 的新一代推荐训练/推理框架平滑升级。
3. 算法与工程 Co-Design:与底层 AI Infra 团队深度协同,深刻理解底层全 GPU 分布式训练(数据并行/模型并行/流水线并行)的特性,通过“算法适配算力”与“算力支撑算法…
招聘城市:深圳
…全 GPU 链路以及基于 UV(User View)的高效样本训练模式等。
加入我们,你将主导这场技术变革,通过极致的算法和工程 Co-Design,大幅提升模型算法迭代效率,最终直接驱动公司营销业务核心 GMV 的增长。
1. 模型 Scaling Up:针对推荐大模型(超大参数量、超长序列特征等),设计并实现序列和非序列特征统一建模新范式。
2. 新一代架构演进:深度参与广告推荐系统核心 AI 基础设施(AI Infra)的设计与研发,推动从传统架构向基于原生 PyTorch 的新一代推荐训练/推理框架平滑升级。
3. 算法与工程 Co-Design:与底层 AI Infra 团队深度协同,深刻理解底层全 GPU 分布式训练(数据并行/模型并行/流水线并行)的特性,通过“算法适配算力”与“算力支撑算法…

美团(meituan) LongCat - Codesign AI 架构

全职 北京,上海
招聘城市:北京,上海
…大模型高效架构设计探索(高效Attention,MoE架构等),预/后训练调优策略,投机推理策略,模型轻量化(剪枝,量化,稀疏,蒸馏,结构搜索等) ,Agentic优化策略和应用等等方向。
需要在上述方向做出创新性算法工程产出,并在公司业务场景中落地应用,创造业务价值。
任职要求:
计算机及其他相关专业,硕博优先。
熟悉一些常用的深度学习框架和大规模框架(比如megatron,verl,vllm,sglang等等),在大模型上有训练和推理算法工程优化的经验的优先。
熟悉机器学习和深度学习理论,具备扎实的编程能力,熟悉常见的主流大模型架构的优先。
有顶会论文发表,特别是模型架构优化相关的算法或工程论文优先。
具备良好的团队合作精神和沟通能力…
招聘城市:全国省会城
…5、良好的英文阅读、方案撰写、沟通能力和抗压能力。1岗位名称2:AI算法工程2岗位职责【AI大模型方向】1、跟踪并实现LLM、多模态、MoE等前沿算法,优化模型架构与训练方法,探索Agentic AI等新技术;2、负责大模型(预训练、微调、RLHF)及高性能推理系统的全链路研发,包括分布式框架优化(DeepSpeed/Megatron/vLLM/SGLang)、高性能算子库开发及KV Cache等内存架构创新;3、设计万卡级智算集群架构,优化异构算力调度、高性能网络(RDMA)及分布式存储,提升算力利用率和效率;4、负责智算基础网络技术的研究与实现,研发大规模智算网络拓扑的管控机制、性能调优算法、智能运维框架…
招聘城市:北京,上海,杭州
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数--压--评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、负责大模型平台的架构设计和核心功能研发,构建云原生架构,设计高可用、高性能的微服务体系;
2、负责构建面向大模型全流程的DevOps,与下游云原生平台深度融合,支撑大模型在公司内各业务…
招聘城市:北京,上海
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数--压--评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为…

小红书 大模型推理框架研发工程/专家

全职 北京,上海
招聘城市:北京,上海
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数--压--评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
工作职责:
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式…

小红书 大模型训练框架研发工程/专家

全职 上海,北京
招聘城市:上海,北京
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数--压--评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline;
2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态…