招聘城市:上海
…SASS, TVM)进行极致的算子级性能调优;
4.具备使用 CUDA/Triton 或国产 AI 芯片的底层编程语言(如 Ascend C)进行高性能算子(如 Attention, GEMM)开发与优化的丰富实战经验;
5.熟悉 MLIR, LLVM 等编译器技术,对 NVIDIA/AMD/昇腾/海光/天数 等主流 AI 芯片的底层内核优化有体系化的知识和实践;
6.有千亿参数大模型成功部署和极致性能优化的平台化建设经验;
7.在 MLSys, NeurIPS, ICML, ICLR 等顶级会议发表过 AI 系统或推理优化相关论文,或拥有相关核心技术专利。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同…
招聘城市:上海
…计算机、人工智能、软件工程等相关专业硕士及以上学历;
2.具备5年以上 AI 系统、高性能计算或底层系统开发经验;
3.具备大规模、生产级大语言模型(LLM)在线推理系统从零到一的架构设计与优化实战经验;
4.精通 C++/Python,具备深厚的系统编程功底,对并行计算、内存管理和性能调优有深入的系统性理解;
5.深入理解 Transformer 架构,具备 vLLM, TensorRT-LLM, LightLLM 等主流推理框架的内核级/源码级深度优化经验;对 KV Cache、低比特量化、连续批处理等核心技术有架构决策能力;
6.具备设计和主导实现高并发、超低延迟分布式服务系统的能力;熟悉 Docker/Kubernetes 等云原生部署运维技术。
岗位介绍:
在腾讯,后台开发工程师不仅是…
招聘城市:上海
…SASS, TVM)进行极致的算子级性能调优;
4.具备使用 CUDA/Triton 或国产 AI 芯片的底层编程语言(如 Ascend C)进行高性能算子(如 Attention, GEMM)开发与优化的丰富实战经验;
5.熟悉 MLIR, LLVM 等编译器技术,对 NVIDIA/AMD/昇腾/海光/天数 等主流 AI 芯片的底层内核优化有体系化的知识和实践;
6.有千亿参数大模型成功部署和极致性能优化的平台化建设经验;
7.在 MLSys, NeurIPS, ICML, ICLR 等顶级会议发表过 AI 系统或推理优化相关论文,或拥有相关核心技术专利。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同…
招聘城市:深圳
…SASS, TVM)进行极致的算子级性能调优;
4.具备使用 CUDA/Triton 或国产 AI 芯片的底层编程语言(如 Ascend C)进行高性能算子(如 Attention, GEMM)开发与优化的丰富实战经验;
5.熟悉 MLIR, LLVM 等编译器技术,对 NVIDIA/AMD/昇腾/海光/天数 等主流 AI 芯片的底层内核优化有体系化的知识和实践;
6.有千亿参数大模型成功部署和极致性能优化的平台化建设经验;
7.在 MLSys, NeurIPS, ICML, ICLR 等顶级会议发表过 AI 系统或推理优化相关论文,或拥有相关核心技术专利。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同…
招聘城市:西安
…手段。;
3.高性能计算基础扎实,深入理解并行计算原理,精通国产芯片的内存优化、通信优化等关键技术;
4.熟练掌握 C/C++、Python,具备算子级代码优化能力,能基于国产硬件特性设计高效算法,有自定义算子开发(如融合算子实现)经验者优先;
5.2年以上国产芯片高性能计算开发经验,至少深度参与过一款昇腾、寒武纪、海光或昆仑芯的 AI 项目优化,有大规模国产集群部署经验者优先。
加分项:
1.通过腾讯云从业资格证或同等资格认证的优先录取。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在…
招聘城市:深圳
…计算机相关专业本科及以上学历,2年以上高性能计算相关工作经验;
2.熟练掌握C++/Python等编程语言,有大规模并行计算或分布式系统开发经验;
3.深入理解计算机体系结构、并行计算原理,熟悉Nvidia GPU/NPU加速技术;
4.具备Linux系统下的高性能调优经验,熟悉常见性能分析工具和方法;
5.良好的团队协作能力和沟通能力,能够跨团队高效合作推动项目落地;
6.对技术有热情,具备较强的学习能力和创新意识。
加分项:
1.熟悉LLM推理场景下的高性能计算优化,有开源框架的优化经验(如vLLM,SGLang,MindIE等);
2.在高性能计算领域发表过相关论文或有开源项目贡献。
岗位介绍:
在腾讯,后台开发工程师不仅是…
招聘城市:深圳
…计算机相关专业本科及以上学历,2年以上高性能计算相关工作经验;
2.熟练掌握C++/Python等编程语言,有大规模并行计算或分布式系统开发经验;
3.深入理解计算机体系结构、并行计算原理,熟悉Nvidia GPU/NPU加速技术;
4.具备Linux系统下的高性能调优经验,熟悉常见性能分析工具和方法;
5.良好的团队协作能力和沟通能力,能够跨团队高效合作推动项目落地;
6.对技术有热情,具备较强的学习能力和创新意识。
加分项:
1.熟悉LLM推理场景下的高性能计算优化,有开源框架的优化经验(如vLLM,SGLang,MindIE等);
2.在高性能计算领域发表过相关论文或有开源项目贡献。
岗位介绍:
在腾讯,后台开发工程师不仅是…
招聘城市:深圳
岗位职责:
1.负责高性能计算集群的平台开发和建设工作,构建业界领先的集群算力调度能力、集群网络管理监控能力、集群故障发现和迁移自愈等能力;
2.负责主流 AI 框架的云平台适配和性能调优工作,针对业界大模型训练,将主流加速框架(如DeepSpeed、Megatron-LM)结合云平台底层技术特点和优势,打造具备差异化竞争力的 AI 加速平台产品能力;
3.负责主流 AI 模型训练和推理性能优化调优工作,提升 AI 推理业务快速部署能力,提供平台算法优化加速能力,能够灵活使用 Triton,TensorRT 等业界主流推理服务和组件,深度结合云原生产品技术架构优势,输出面向不同场景的性能加速最佳实践解决方案;
4.负责跟踪 AI行业技术发展趋势,并进行…
招聘城市:深圳
岗位职责:
1.负责高性能计算集群的平台开发和建设工作,构建业界领先的集群算力调度能力、集群网络管理监控能力、集群故障发现和迁移自愈等能力;
2.负责主流 AI 框架的云平台适配和性能调优工作,针对业界大模型训练,将主流加速框架(如DeepSpeed、Megatron-LM)结合云平台底层技术特点和优势,打造具备差异化竞争力的 AI 加速平台产品能力;
3.负责主流 AI 模型训练和推理性能优化调优工作,提升 AI 推理业务快速部署能力,提供平台算法优化加速能力,能够灵活使用 Triton,TensorRT 等业界主流推理服务和组件,深度结合云原生产品技术架构优势,输出面向不同场景的性能加速最佳实践解决方案;
4.负责跟踪 AI行业技术发展趋势,并进行…
招聘城市:深圳
岗位职责:
1.负责高性能计算集群的平台开发和建设工作,构建业界领先的集群算力调度能力、集群网络管理监控能力、集群故障发现和迁移自愈等能力;
2.负责主流 AI 框架的云平台适配和性能调优工作,针对业界大模型训练,将主流加速框架(如DeepSpeed、Megatron-LM)结合云平台底层技术特点和优势,打造具备差异化竞争力的 AI 加速平台产品能力;
3.负责主流 AI 模型训练和推理性能优化调优工作,提升 AI 推理业务快速部署能力,提供平台算法优化加速能力,能够灵活使用 Triton,TensorRT 等业界主流推理服务和组件,深度结合云原生产品技术架构优势,输出面向不同场景的性能加速最佳实践解决方案;
4.负责跟踪 AI行业技术发展趋势,并进行…
招聘城市:北京
…服务能力与平台化能力,为业务提供高可用、可扩展、高易用性的集群化服务;
4.参与开源共建与合作,提升团队与个人在业界的影响力。
岗位要求:
1.计算机相关专业,本科及以上学历,3年及以上工作经验;
2.精通 C++/Python/Java 中的一种,同时熟悉C++和Python更佳,具备丰富的大型软件系统研发经验;
3.具有大数据 infra 或 AI infra 方向的从业经验,并且至少参与过一种分布式系统的研发、优化或运维,包括但不限于计算引擎、调度引擎、任务编排框架、高性能计算与通信系统、应用与服务框架等;
4.非必需但可以加分的情况:熟悉Ray;参与过 Data + AI 的系统工程;在主流开源项目中贡献过重要的代码。
招聘城市:北京,上海
…系统团队需要将传统或者新型的轻量化算法和工程有机结合起来进行加速,提高大语言模型训练或者推理性能的同时,通过算法手段尽可能降低效果损失。候选人将在以下几个方向进行深入探索和落地:
1、量化方向:负责但不限于大语言模型的低精度训练(FP8)、推理(W8A8KV8等)、低精度优化器(量化梯度、优化器状态、参数等)
2、高性能模型结构:大语言模型Finetune或者其他阶段的LoRA系列(熟悉各种变种),训练阶段的MQA/GQA系列等
3、稀疏化方向:大语言模型剪枝、稀疏、蒸馏、Sparse Attention等
4、新型方向:Medusa、超长文本、Speculative Sampling等
任职要求:
分布式
1、熟练掌握Linux环境下的C/C++、Python语言;
2、具备扎实的计算机科学功底和编程能力…
招聘城市:深圳
…性;
4.与编译器、runtime及业务团队协作,推动模型在自研芯片上的端到端性能优化与落地。
岗位要求:
1.熟悉 Linux 开发环境,扎实掌握 C++/Python,具备良好的代码能力和工程能力;
2.熟悉异构计算或高性能计算基础,理解并行编程、向量化、线程/任务调度、访存优化等基本原理;
3.熟悉 PyTorch、TensorFlow 等主流深度学习框架;
4.具备性能瓶颈定位与调优能力,具备profile和debug工具使用经验。
加分项:
1.有GPU、DSA、DSP上的算子开发和性能优化经验者优先;
2.有 CUDA、ROCm生态开发经验者优先;
3.有 LLM 推理优化、融合算子开发、低精度计算或算子测试框架建设经验者优先;
4.熟悉线性代数、概率统计、数值计算或优化方法者优先。
招聘城市:北京
…性;
4.与编译器、runtime及业务团队协作,推动模型在自研芯片上的端到端性能优化与落地。
岗位要求:
1.熟悉 Linux 开发环境,扎实掌握 C++/Python,具备良好的代码能力和工程能力;
2.熟悉异构计算或高性能计算基础,理解并行编程、向量化、线程/任务调度、访存优化等基本原理;
3.熟悉 PyTorch、TensorFlow 等主流深度学习框架;
4.具备性能瓶颈定位与调优能力,具备profile和debug工具使用经验。
加分项:
1.有GPU、DSA、DSP上的算子开发和性能优化经验者优先;
2.有 CUDA、ROCm生态开发经验者优先;
3.有 LLM 推理优化、融合算子开发、低精度计算或算子测试框架建设经验者优先;
4.熟悉线性代数、概率统计、数值计算或优化方法者优先。
招聘城市:深圳
…的高性能计算(HPC)项目设计与开发,负责GPU芯片(NVIDIA/AMD等)的底层性能优化与调优;
2.针对大模型推理、训练等场景,优化和扩展vLLM、SGLang等框架的核心模块,提升计算效率与资源利用率;
3.深入分析GPU硬件架构特性(如Tensor Core、显存带宽、通信机制等),设计并实现高性能算子与算法;
4.探索前沿技术方向(如混合专家模型MoE、动态计算图优化等),推动AI工程化落地的效率提升。
岗位要求:
1.熟悉NVIDIA CUDA/AMD ROCm编程,具备GPU内核优化经验(如PTX指令调优、显存带宽优化);
2.精通Megatron-LM、DeepSpeedI等分布式训练框架,有千亿参数模型并行训练实战经验;
3.熟悉大模型训练全流程优化(数据加载、梯度累积、通信压缩等),能通过…
招聘城市:深圳
…的高性能计算(HPC)项目设计与开发,负责GPU芯片(NVIDIA/AMD等)的底层性能优化与调优;
2.针对大模型推理、训练等场景,优化和扩展vLLM、SGLang等框架的核心模块,提升计算效率与资源利用率;
3.深入分析GPU硬件架构特性(如Tensor Core、显存带宽、通信机制等),设计并实现高性能算子与算法;
4.探索前沿技术方向(如混合专家模型MoE、动态计算图优化等),推动AI工程化落地的效率提升。
岗位要求:
1.熟悉NVIDIA CUDA/AMD ROCm编程,具备GPU内核优化经验(如PTX指令调优、显存带宽优化);
2.精通Megatron-LM、DeepSpeedI等分布式训练框架,有千亿参数模型并行训练实战经验;
3.熟悉大模型训练全流程优化(数据加载、梯度累积、通信压缩等),能通过…
招聘城市:北京
…技术的创新。
岗位要求:
1.人工智能、计算机、数学等相关专业;
2.8年以上GPU研发或项目经验,有学术研究成果优先;
3.深入了解GPU硬件架构特性,具备算力诊断调优经验,场景覆盖训推程序的功能和性能异常,以及算力的性能异常;
4.熟悉NVIDIA CUDA/AMD ROCm编程,具备GPU内核虚拟化经验(如算力绝对抢占优化,kernel使用预测等);
5.熟悉深度学习框架(Pytorch, Tensorflow等),深度优化算力的运行效率;
6.有管理能力,对人工智能技术及行业有前瞻性思考。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的…
招聘城市:北京
…CPU等方面调优经历;
3.熟悉CUDA等异构硬件开发技术栈,有相关性能优化或TensorRT、tensorRT-LLM相关使用经验优先;
4.至少熟悉一种主流深度学习工具TensorFlow/Pytorch等,熟悉深度模型算法优先;
5.对追求极致高性能充满热情,具有优秀的分析问题和解决问题能力,良好的团队合作意识和沟通能力。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨…
招聘城市:深圳
…对接容器等。
岗位要求:
1.本科及以上学历,5年及以上工作经验,有高性能存储系统研发经验,对Lustre、GPFS、GlusterFS等有深刻理解和丰富实战经验;
2.具备良好的系统分析能力,良好的抽象思维和逻辑思维能力,独立分析问题解决问题的能力;
3.具有优秀的学习能力、沟通能力、服务意识和团队合作精神;
4.强烈的责任心和主动性,对工作有强烈的所有权意识,并能自我激励以实现个人和团队成长。
加分项:
1.具有5年以上并行文件系统的研发经验;
2.拥有高性能计算存储系统建设实践经验优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码…
招聘城市:上海,北京
…1. 参与下一代高性能参数服务器(Parameter Server)的架构设计、核心模块开发与持续迭代,以满足大规模稀疏模型在线推理的超低延迟、高吞吐需求。
2. 深入优化参数服务器的通信框架(如BRPC、RDMA)、存储引擎(HBM、MEM、SSD分层存储)、并发模型和负载均衡策略,解决海量参数同步中的瓶颈问题。
3. 与算法团队紧密合作,理解前沿模型(如大语言模型、推荐系统、多模态模型)对训推基础设施的需求,并将其转化为系统级的创新与优化;
4. 跟踪业界前沿技术,探索其在参数服务器中的落地场景,推动平台技术演进。
任职要求:
1. 优秀的代码能力、数据结构和基础算法功底,熟悉C++开发,有分布式系统或高性能计算相关开发经验(存储、并发…