牛大妈在社招职位搜索大模型异构计算优化工程师 专家 有 82 条结果

招聘城市:北京,上海
…调度策略优化和关键算子(Kernel)的性能剖析与极致优化,持续提升系统的吞吐量、降低延迟;
4、生态合作与协同:作为技术接口人,与国产芯片原厂技术支持团队紧密合作,高效推进芯片驱动、基础软件栈的引入、问题排查与版本迭代,确保技术路线顺畅推进。
任职要求:
1、熟练掌握 C++/Python 编程,具备扎实的计算机体系结构、数据结构和算法基础,具备良好的编程习惯;
2、有至少一款非Nvidia GPU的异构计算芯片适配模型训练、推理框架的相关经验,包括但不限于AI框架适配、模型移植、性能优化或算子开发;
3、熟悉至少一种主流的机器学习框架(PyTorch/PaddlePaddle/TensorFlow等),对框架内部实现有一定了解;
4、具备大型深度学习模型(尤其是语言模型LLM或…

小红书(xiaohongshu) 模型 Infra 全栈研发工程/专家

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…基于 vLLM、SGLang 等建设万亿级 Token 并行推理与服务高可用架构。
3.模型加速算法落地: 探索并落地语言模型及多模态模型的低比特量化(W8A8/W4A8等)、投机采样、CoT压缩、蒸馏、剪枝等算法,支持各业务大幅降低推理成本。
4.异构计算与底层优化: 主导基于国产异构计算芯片(昇腾 NPU 等)及主流 GPU 的软硬协同优化,负责 AI 框架适配、模型移植、关键算子开发与性能优化,实现高吞吐与低延迟的推理系统。
5.探索 Agentic AI Infra 研发范式: 将 AI 工具深度融入 Infra 开发链路,熟练运用 AI 编程工具进行架构探索、复杂 Debug 与重构,大幅提升 AI Infra 全栈工程的迭代效率。
任职要求:
任职要求:
1.AI 工程范式:熟练使用 Claude Code、Cursor、Codex 等工具…

小红书(xiaohongshu) AI Infra工程/专家

全职 北京,上海,深圳
招聘城市:北京,上海,深圳
…将硬件性能压榨到极致,最大化发挥出GPU/NPU/PPU/CPU等异构硬件协同算力。
参与开发/调试用于异构计算全链路的AI编译器,探索基于IR编译优化的片内多部件并行流水线等前沿技术,构建业界影响力。
支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2. 精通C/C++/CUDA/Topscc/AscendC,具备扎实的系统底层能力(内存、并发、网络)。
3. 有大规模分布式系统开发和优化经验;有模型分布式训练经验者优先。
4. 精通MLIR/TVM/Triton/Torch Inductor/TileLang/Verbs/NCCL/NVSHMEM等分布式异构计算框架和相关工具链…

小红书 模型推理框架研发工程/专家

全职 北京,上海
招聘城市:北京,上海
…技术高效落地!
工作职责:
1、参与/负责研发面向语言模型(LLM)/多模态模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式架构优化异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
4、参与/负责构建推理框架的系统容错能力,包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设;
5、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
6、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力…
招聘城市:北京
…业务中LLM相关应用的技术支持,优化推理性能,降低业务成本;
4.积极跟进GPU等异构硬件的业内前沿技术,持续完善异构推理加速框架。
岗位要求:
1.熟悉Linux开发环境,良好的系统编程、数据结构、算法基础、熟悉C++语言开发;
2.熟悉常见的后台服务性能优化手段,具有服务内存,CPU等方面调优经历;
3.熟悉CUDA等异构硬件开发技术栈,有相关性能优化或TensorRT、tensorRT-LLM相关使用经验优先;
4.至少熟悉一种主流深度学习工具TensorFlow/Pytorch等,熟悉深度模型算法优先;
5.对追求极致高性能充满热情,具有优秀的分析问题和解决问题能力,良好的团队合作意识和沟通能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者…
招聘城市:深圳
…nvprof、perf 等性能分析工具进行瓶颈分析和优化
加分项:
1.有大规模分布式训练实践经验(上百张 GPU 或更大规模),了解常见分布式训练框架与通信库(如 NCCL、Horovod、DeepSpeed、Megatron-LM 等);
2.对深度学习模型结构与训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让…
招聘城市:上海
…nvprof、perf 等性能分析工具进行瓶颈分析和优化
加分项:
1.有大规模分布式训练实践经验(上百张 GPU 或更大规模),了解常见分布式训练框架与通信库(如 NCCL、Horovod、DeepSpeed、Megatron-LM 等);
2.对深度学习模型结构与训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让…
招聘城市:北京
…nvprof、perf 等性能分析工具进行瓶颈分析和优化
加分项:
1.有大规模分布式训练实践经验(上百张 GPU 或更大规模),了解常见分布式训练框架与通信库(如 NCCL、Horovod、DeepSpeed、Megatron-LM 等);
2.对深度学习模型结构与训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让…
招聘城市:杭州
…nvprof、perf 等性能分析工具进行瓶颈分析和优化
加分项:
1.有大规模分布式训练实践经验(上百张 GPU 或更大规模),了解常见分布式训练框架与通信库(如 NCCL、Horovod、DeepSpeed、Megatron-LM 等);
2.对深度学习模型结构与训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让…
招聘城市:北京,上海,杭州
…参与小红书模型平台 QuickSilver 的全栈研发工作,借助 AI 编程工具高质量完成从前端交互界面到后端业务逻辑的端到端功能交付,构建覆盖全链路的监控告警与可观测数据体系。
2.AI Workflow 工程链路建设: 参与模型数据管理、模型训练、模型压缩、推理部署等核心工具链的研发;协同算法与产品团队,优化云原生环境下的 AI 工作流范式,持续提升模型迭代效能。
3.分布式 GPU 调度与治理: 参与平台核心的 Quota 管理与资源调度模块开发,攻坚多机房、多集群、异构计算资源(GPU / NPU / PPU)下的多租户配额治理、弹性伸缩与碎片优化
4.AI 前沿技术预研与落地: 持续追踪 AI 基础设施与模型平台的前沿技术动态…
招聘城市:深圳
…具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你…
招聘城市:北京
…具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你…
招聘城市:上海
…具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你…
招聘城市:杭州
…具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你…
招聘城市:北京
…精通推理引擎底层优化技术;
5.熟悉和了解业界主流模型如DeepSeek、Qwen系列模型结构,常见切分方式,有针对性的分布式推理调优原理分析和实践经验优先;
6.熟悉和了解模型适配异构芯片的流程,具备适配经验,有端到端完成模型推理适配,精度/性能调优者优先;
7.熟悉和了解集合通信原理和常见互联形态,如NCCL、NVLink、RoCE等;
8.针对EP通算融合算子Dispatch/Combine 开发调优者优先;
9.针对关键算子,Attention MLA/GQA/, Sparse Attention DSA, Linear Attetnion等,GEMM/Group GEMM,有深入分析和最佳优化实践者优先;
10.熟悉和了解PD分离架构,有异构PD分离实践经验优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是…
招聘城市:深圳
…深度学习模型从训练到推理的全链路转化逻辑,具备模型训推一体化问题定位(如精度漂移、性能衰减)与优化经验者优先;
5.精通 CPU/GPU 异构计算架构下数据传输瓶颈(PCIe 带宽、内存墙、缓存利用率)分析方法;具备服务器端 AI 芯片(如 NVIDIA H100/A100、昇腾 910)推理性能调优经验,熟悉硬件特性与软件适配策略者优先;
6.精通分布式推理核心技术(张量并行、流水线并行、ZeRO 优化、动态负载均衡),熟悉分布式通信框架(NCCL、MPI)底层原理;主导过千亿级以上参数模型分布式推理系统部署、性能调优与稳定性保障,具备超大模型推理成本优化实践经验者优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家
招聘城市:深圳
…熟悉主流云计算厂商 AI 产品特点,有 AI 研发经验者优先;
6.熟悉业界流行的显卡虚拟化技术,对Nvidia/AMD/Intel等GPU技术有较深理解的优先;
7.对GPU,分布式计算,RDMA,MPI,GPU Direct 等技术有了解和使用经验优先;
8.精通C++、Python等开发语言,熟练掌握Linux软件开发技术;
9.有一定的管理能力,具备丰富的产品规划和设计经验,对人工智能技术及行业有前瞻性战略思考;
10.清晰的逻辑分析和表达能力,乐观积极,具有较强的责任心和执行力。
加分项:
1.在同等条件下,通过腾讯云认证或取得同等资格认证的候选人,我们会优先考虑。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家

腾讯(tencent) GPU推理加速工程

全职 北京
招聘城市:北京
模型异构推理架构升级与性能优化,支持Dense Scaling 持续提升;
2.负责营销业务中GPU算子,计算图编译优化等业务开发,支撑业务迭代升级;
3.积极跟进GPU等异构硬件的业内前沿技术,持续完善异构推理加速框架。
岗位要求:
1.熟悉Linux开发环境,良好的系统编程、数据结构、算法基础、熟悉C++语言开发;
2.熟悉GPU优化手段,熟悉CUDA等异构硬件开发技术栈,具有搜广推/LLM模型推理优化经历优先;
3.至少熟悉一种主流深度学习框架TensorFlow/Pytorch等,熟悉深度模型算法优先;
4.对追求极致高性能充满热情,具有优秀的分析问题和解决问题能力,良好的团队合作意识和沟通能力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家
招聘城市:深圳
…熟悉各组件和类库,常见AI模型
5.熟悉行业内人工智能平台、机器学习实现方案,熟悉主流云计算厂商 AI 产品特点,有 AI 研发经验者优先;
6.熟悉业界流行的显卡虚拟化技术,对Nvidia/AMD/Intel等GPU技术有较深理解的优先;
7.对GPU,分布式计算,RDMA,MPI,GPU Direct 等技术有了解和使用经验优先;
8.精通C++、Python等开发语言,熟练掌握Linux软件开发技术;
9.有一定的管理能力,具备丰富的产品规划和设计经验,对人工智能技术及行业有前瞻性战略思考;
10.清晰的逻辑分析和表达能力,乐观积极,具有较强的责任心和执行力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者…
招聘城市:深圳
…熟悉各组件和类库,常见AI模型
5.熟悉行业内人工智能平台、机器学习实现方案,熟悉主流云计算厂商 AI 产品特点,有 AI 研发经验者优先;
6.熟悉业界流行的显卡虚拟化技术,对Nvidia/AMD/Intel等GPU技术有较深理解的优先;
7.对GPU,分布式计算,RDMA,MPI,GPU Direct 等技术有了解和使用经验优先;
8.精通C++、Python等开发语言,熟练掌握Linux软件开发技术;
9.有一定的管理能力,具备丰富的产品规划和设计经验,对人工智能技术及行业有前瞻性战略思考;
10.清晰的逻辑分析和表达能力,乐观积极,具有较强的责任心和执行力。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者…