牛大妈在社招职位搜索AI Infra工程师 专家 有 93 条结果

小红书(xiaohongshu) AI Infra工程/专家

全职 北京,上海,深圳
招聘城市:北京,上海,深圳
…PPU/CPU千卡互联分布式训练和推理框架。
参与开发分布式并行/流水线/通信优化/ZeRO/FSDP工作,消除大规模分布式训练通讯/计算/内存瓶颈,极致优化模型训练和推理的性能。
参与开发Triton,TileLang计算图编译优化或者使用CUDA/cutlass编写高性能算子,将硬件性能压榨到极致,最大化发挥出GPU/NPU/PPU/CPU等异构硬件协同算力。
参与开发/调试用于异构计算全链路的AI编译器,探索基于IR编译优化的片内多部件并行流水线等前沿技术,构建业界影响力。
支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2…

小红书(xiaohongshu) 大模型 Infra 全栈研发工程/专家

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…蒸馏、剪枝等算法,支持各业务大幅降低推理成本。
4.异构计算与底层优化: 主导基于国产异构计算芯片(昇腾 NPU 等)及主流 GPU 的软硬协同优化,负责 AI 框架适配、模型移植、关键算子开发与性能优化,实现高吞吐与低延迟的推理系统。
5.探索 Agentic AI Infra 研发范式: 将 AI 工具深度融入 Infra 开发链路,熟练运用 AI 编程工具进行架构探索、复杂 Debug 与重构,大幅提升 AI Infra 全栈工程的迭代效率。
任职要求:
任职要求:
1.AI 工程范式:熟练使用 Claude Code、Cursor、Codex 等工具,具备成熟的 Agentic Engineering 实践技巧,能够基于 AI 工具进行复杂的系统级 Debug、代码重构及单测生成。
2.语言与系统基础:精通 C++ 与 Python,熟悉 Rust 或 Golang 开发,具备扎实的计算机…
招聘城市:深圳
…4.团队 gpu 资源管理与调度。
岗位要求:
1.计算机相关专业,本科及以上学历;
2.熟悉Pytorch等主流深度学习框架,熟悉 vllm/sglang 等主流推理框架,具备模型调优及线上部署实践经验;
3.熟悉并行计算,X86、ARM等计算体系结构;
4.拥有优秀的分析和解决问题能力,具备良好的团队协作能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。
招聘城市:北京
…的推理引擎,构建适合AI Search,智能 Agent相关领域大规落地应用中的推理基础架构;
2.紧跟 LLM Infra 领域的前沿技术演进突破,将合适成果落地于实际应用;
3.与搜索算法同学深度合作,联合优化,设计实现能够给大型搜索系统带来代际更迭的大模型。
岗位要求:
1.熟悉AI基础硬件设置,有真实的大规模推理系统的设计开发部署经验;
2.熟悉各种主流LLM/VLM的模型结构,具有 vllm/sglang/TRT-llm等推理引擎优化实践经验;
3.熟悉LLM 推理常用加速方法(算子融合、量化策略、动态批处理、分布式KV 缓存优化等);
4.有针对真实场景问题的LLM 模型结构和的设计优化经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态…
招聘城市:北京
…引擎,构建适合AI Search,智能 Agent相关领域大规落地应用中的推理基础架构;
3.紧跟 LLM Infra 领域的前沿技术演进突破,将合适成果落地于实际应用;
4.与搜索算法同学深度合作,联合优化,设计实现能够给大型搜索系统带来代际更迭的大模型。
岗位要求:
1.岗位要求:;
2.熟悉AI基础硬件设置,有真实的大规模推理系统的设计开发部署经验;
3.熟悉各种主流LLM/VLM的模型结构,具有 vllm/sglang/TRT-llm等推理引擎优化实践经验;
4.熟悉LLM 推理常用加速方法(算子融合、量化策略、动态批处理、分布式KV 缓存优化等);
5.有针对真实场景问题的LLM 模型结构和的设计优化经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是…
招聘城市:广州
…紧密合作,设计实现高性能的AI搜索大模型,加速最新的大模型技术在搜索场景的落地。
岗位要求:
1.具备较强的动手能力;熟悉 Python ,具备扎实的系统编程功底和优秀的复杂系统 Debug 能力;
2.深入理解大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或 PyTorch FSDP 等主流框架的开发和优化经验;
3.熟悉大模型后训练与对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,有实际开发部署并解决相关问题的经验;
4.熟悉最新的大模型结构,熟悉各种软硬件架构,能够结合具体的模型结构和软硬件架构做训练过程的深度优化。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态…
招聘城市:北京
…大模型分布式训练原理,具备 Megatron-LM、DeepSpeed 或 PyTorch FSDP 等主流框架的实际源码级开发与定制经验;
3.RL 与 RL Infra 储备: 熟悉大模型后训练与对齐技术(PPO、GRPO、DPO等),熟悉 Verl、ROLL,AReal 等强化学习/分布式计算框架,可以理解并解决 RL过程中的工程痛点;
4.综合素质: 具备极强的技术好奇心与自驱力,面对业界无先例的技术难题,能独立思考并推动解决。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考…
招聘城市:北京
…有Tensorrt/FasterTransformer/Tensorrt-llm/vllm/sglang等深度学习推理框架的实际使用经验;
4.熟悉各类深度学习网络和算子底层实现细节,训练和推理模型调试、调优有实操经验优先;
5.熟悉CPU/GPU异构加速瓶颈分析方法,有服务器端 AI 芯片、GPU加速经验优先;
6.熟悉分布式推理常用加速方法,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景…
招聘城市:上海
…如算子融合、通信优化)者优先;
6.熟悉NCCL、MPI等集合通信算法者优先;
7.工程经验上具备大型项目架构设计能力,能独立解决性能调优、多节点调试等复杂问题;
8.具备良好的沟通能力与团队协作精神,有强烈的技术热情者优先;
9.上述训练、推理至少要求熟悉一个场景;两者都熟悉者优化。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向…
招聘城市:上海
… 有良好的编程基础、系统设计优化能力;
2.熟悉GPU/AI DSA体系结构和原理,有Nvidia/AMD卡等开发优化经验;
3.熟悉主流训练框架和训练加速技术,包括但不限于Megatron等分布式训练框架,熟悉高性能网络通信,计算等优化方向;
4.熟悉主流推理框架和推理加速技术,包括但不限于TensorRT/vLLM/SGLang 等;
5.具备良好的技术热情和责任感,优秀的分析解决问题能力,良好的团队意识和沟通能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队…
招聘城市:深圳
… 有良好的编程基础、系统设计优化能力;
2.熟悉GPU/AI DSA体系结构和原理,有Nvidia/AMD等开发优化经验;
3.熟悉主流训练框架和训练加速技术,包括但不限于Megatron等分布式训练框架,熟悉高性能网络通信,计算等优化方向;
4.熟悉主流推理框架和推理加速技术,包括但不限于TensorRT/vLLM/SGLang 等;
5.具备良好的技术热情和责任感,优秀的分析解决问题能力,良好的团队意识和沟通能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展…
招聘城市:深圳
…3.通过优化 AI 部署的计算、网络、存储相关资源,提升训练及推理效率;
4.负责推理稳定性、亲和性调度、推理框架优化、GPU池化等相关工作,降低推理成本,提升推理效率。
岗位要求:
1.本科及以上学历,5年及以上相关工作经验;
2.熟悉Kubernetes生态,对Kubernetes源码有了解,具备 K8s Operator 相关开发经验优先;
3.熟悉 AI 训练、微调、推理等各个环节,熟悉主流大模型推理框架,如triton、vllm、lightllm、ollama、sglang等优先;
4.熟悉GPU、 CUDA 、 RDMA 、 NCCL 等相关技术优先,熟悉KubeFlow 、 Ray等相关框架者优先;
5.熟练掌握Golang语言开发,具备C/C++,Rust, Python, Java, Shell等其他一种或多种语言开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者…
招聘城市:深圳
…设计和实现serving体系和相应的一些稳定性建设,实现训练推理一站式平台。
岗位要求:
1.本科以及以上学历,计算机相关专业,3年及以上工程经验;
2.熟悉Linux 开发环境、熟悉C/C++编程语言,熟练掌握常用算法和数据结构;
3.AI Coding思路清晰;
4.有AI训练和推理平台核心模块的设计与研发经验优先;
5.有vLLM等主流推理框架的集成和调优经验优先。
加分项:
1.AI训练和推理平台核心模块的设计与研发经验;
2.vLLM等主流推理框架的集成和调优经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产…
招聘城市:上海
…Function Calling、MCP 协议,深入理解 Prompt 工程与上下文管理;4.熟悉向量数据库与检索召回,有 ToB Agent 产品交付经验者优先;5.211 / 985 院校全日制本科及以上学历,计算机、人工智能等相关专业;6.2 年以上 LLM 应用 / Agent 方向研发经验;7.35 周岁以下。11高级AI全栈研发工程(1人)岗位职责1.负责 GPU 智算平台与大模型应用产品的端到端研发,覆盖前端、后端、模型接入与数据链路;2.基于 MaaS / MLP 能力构建算力售卖、模型托管、Agent 应用等产品形态;3.负责核心服务的架构设计与性能优化,落地计量计费、配额、鉴权等平台基础能力;4.与产品、Infra、Agent 团队紧密协同,将底层算力与模型能力封装为…
招聘城市:上海
…搭建;
6.强问题排查能力,能快速定位训练过程中的工程问题(性能、稳定性、资源瓶颈);
7.良好的跨团队沟通能力,能准确理解算法需求并转化为工程方案;
8.自驱力强,乐于跟进前沿技术,具备快速学习与落地能力。
加分项:
1.有大规模 RL 训练平台(支持千级 GPU 集群、亿级样本回放)搭建经验;
2.熟悉智能体强化学习(Agentic RL)训练的基础设施优化方案;
3.有 GPU 显存 / 算力优化、网络传输优化(如 NCCL 调优)的实际案例;
4.开源项目贡献者(RL 框架、分布式训练工具等相关项目);
5.具备实际业务场景的 RL 基础设施落地经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将…
招聘城市:北京,上海
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为…

小红书 大模型推理框架研发工程/专家

全职 北京,上海
招聘城市:北京,上海
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
工作职责:
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式…

小红书 大模型训练框架研发工程/专家

全职 上海,北京
招聘城市:上海,北京
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline;
2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态…

小红书 大模型压缩算法研发工程/专家

全职 北京,上海
招聘城市:北京,上海
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、探索研发针对大语言模型、多模态大模型、StableDiffusion模型等模型的压缩技术,包括但不限于量化、蒸馏、剪枝、稀疏化等;
2、参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持…
招聘城市:广州
…和团队协作精神,积极主动,勇于接受挑战。
加分项:
1.在ICPC/CCPC等算法竞赛中取得过良好成绩;
2.熟悉一种以上的大模型训练或推理框架,如 Megatron,VeRL、VLLM、SGLang 等,在此之上做过深度的开发/优化;
3.对大模型算法有较好的理解,能做算法和工程 co-design 的设计。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨。