招聘城市:深圳
…高性能推理引擎;
3.跟进机器学习前沿技术,将合适成果落地于实际应用。
岗位要求:
1.精通TensorFlow、PyTorch等主流深度学习框架,具备扎实的模型训练、调优及线上部署实践经验;
2.精通C/C++,精通常用数据结构与算法;
3.熟练掌握高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等;
4.熟悉大模型推理框架(如vLLM/SGLang/TRT-LLM等),有推理优化经验者优先;
5.优秀的分析问题和解决问题的能力,对解决具有挑战性的问题充满激情;
6.责任心强,良好的业务意识,团队合作能力和沟通协调能力。
加分项:
1.有游戏开发经验;
2.熟悉NLP,CV,语音合成等深度学习算法;
3.有大模型训练…
招聘城市:深圳
…熟悉主流大模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程师不仅…
招聘城市:北京
…熟悉主流大模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程师不仅…
招聘城市:上海
…熟悉主流大模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程师不仅…
招聘城市:杭州
…熟悉主流大模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程师不仅…
招聘城市:深圳
…上线与效果评估;
5.· 跟踪Agent与推理框架的前沿技术,结合业务需求探索创新方案并推动落地。
岗位要求:
1.· 具备扎实的后台工程能力,有行业 成熟 Agent框架的实战经验;
2.· 熟悉大模型推理框架,有相关优化经验(vLLM、sglang等);
3.· 有卡推理适配和集群化推理调度经验者优先;
4.· 有持续的一线技术优化实战经验,能独立承担Agent设计与核心模块开发,对Agent的上下文工程、工具调用、Skill设计有深入理解,了解最新上下文设计原则;
5.· 计算机、人工智能等相关专业本科及以上学历,有顶会论文或开源项目贡献者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同…
招聘城市:深圳
…2.与大模型算法同学深度合作,联合优化,打造行业领先的高性能推理引擎;
3.跟进机器学习前沿技术,将合适成果落地于实际应用。
岗位要求:
1.精通C/C++,精通常用数据结构与算法;
2.熟悉大模型推理框架(如vLLM/SGLang/TRT-LLM等);
3.熟练掌握高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等;
4.熟练掌握CUDA,有基于CUTLASS或PTX的GPU性能优化经验;
5.优秀的分析问题和解决问题的能力,对解决具有挑战性的问题充满激情;
6.责任心强,良好的业务意识,团队合作能力和沟通协调能力。
加分项:
1.有游戏开发经验;
2.熟悉NLP,CV,语音合成等深度学习算法;
3.有大模型训练…
招聘城市:深圳
…提升大模型整体训练/推理性能;
4.与分布式训练、推理、模型算法团队密切协作,共同提升大规模训推任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
岗位要求:
1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.扎实的编程基础,熟练使用 C/C++,对代码质量与工程实践有较高要求;
3.熟练掌握 GPU 编程,有实际 CUDA 开发经验;熟悉 CUTLASS、Triton 等任一或多种算子开发/优化框架;
4.熟悉并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
5.熟悉分布式并行原理,能够设计和实现大模型训练/推理场景下…
招聘城市:上海
…提升大模型整体训练/推理性能;
4.与分布式训练、推理、模型算法团队密切协作,共同提升大规模训推任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
岗位要求:
1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.扎实的编程基础,熟练使用 C/C++,对代码质量与工程实践有较高要求;
3.熟练掌握 GPU 编程,有实际 CUDA 开发经验;熟悉 CUTLASS、Triton 等任一或多种算子开发/优化框架;
4.熟悉并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
5.熟悉分布式并行原理,能够设计和实现大模型训练/推理场景下…
招聘城市:北京
…提升大模型整体训练/推理性能;
4.与分布式训练、推理、模型算法团队密切协作,共同提升大规模训推任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
岗位要求:
1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.扎实的编程基础,熟练使用 C/C++,对代码质量与工程实践有较高要求;
3.熟练掌握 GPU 编程,有实际 CUDA 开发经验;熟悉 CUTLASS、Triton 等任一或多种算子开发/优化框架;
4.熟悉并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
5.熟悉分布式并行原理,能够设计和实现大模型训练/推理场景下…
招聘城市:杭州
…提升大模型整体训练/推理性能;
4.与分布式训练、推理、模型算法团队密切协作,共同提升大规模训推任务的整体效率与稳定性;
5.跟踪业界前沿的硬件架构与系统软件(GPU 架构、网络、编译器、库等),将最新技术转化为实际性能收益。
岗位要求:
1.计算机、软件工程、数学、电子信息、自动化等相关专业,本科及以上学历;
2.扎实的编程基础,熟练使用 C/C++,对代码质量与工程实践有较高要求;
3.熟练掌握 GPU 编程,有实际 CUDA 开发经验;熟悉 CUTLASS、Triton 等任一或多种算子开发/优化框架;
4.熟悉并行计算原理,对 GPU 体系结构(SM、Warp、Memory Hierarchy、Occupancy 等)有较深入理解;
5.熟悉分布式并行原理,能够设计和实现大模型训练/推理场景下…
招聘城市:北京
…1. 模型推理服务优化:
* 负责大语言模型(LLM)推理性能的优化,包括延迟降低、吞吐量提升和资源效率优化
* 开发和应用模型压缩技术(包括但不限于量化、稀疏化等)
* 优化推理框架,支持多种硬件平台(GPU、专用AI芯片)
* 设计并实现高效、稳定、可扩展的推理服务架构
2. 性能分析与调优:
* 建立性能基准测试框架,持续监控和评估推理性能
* 分析性能瓶颈,提出并实施优化方案
* 针对不同应用场景(实时对话、批量处理等)定制优化策略
3. 技术创新与落地:
* 跟踪最新研究成果,将前沿优化技术应用到生产环境
* 与算法团队合作,参与模型架构的推理友好设计
* 编写高质量的技术文档和最佳实践指南
岗位要求:
1.必备条件:;
2.计算机、软件工程、人工智能等相关专业…
招聘城市:北京
…
3.参与大窗口、分布式训练的性能优化,持续跟进大模型训练框架前沿技术,进行关键技术预研以及落地验证;
4.深入分析模型后训练过程中的链路流程,包括数据加载、通信效率等,提升训练速度以及训练吞吐。
岗位要求:
1.精通Python及PyTorch等框架,具备Qwen、Deepseek等模型的二次训练经验者优先;
2.深入理解Transformer架构、SFT/RL训练范式及Prompt工程,了解Claude Code等Agent开发框架,有完整智能体系统搭建经验者优先;
3.熟悉常用的RL训练框架和训练技巧,有Verl、Slime、AReal等强化学习训练框架使用经验者优先;
4.深入理解分布式框架的底层通信机制、内存管理策略与并行调度等逻辑,能够精准定位核心优化方向;
5.熟悉主流推理框架,掌握 kvcache…
招聘城市:深圳
…3.优化大模型推理框架,提升框架易用性和可调试性。
岗位要求:
1.熟练掌握 C/C++、Python语言,有计算机体系结构背景或软件开发背景,熟悉系统性能调优的方式;
2.具备基础的GPU编程能力,包括但不限于Cuda、OpenCL,熟悉至少一种GPU加速库,如cublas、cudnn、cutlass等;
3.具备Tensorrt/FasterTransformer/Tensorrt-llm/vllm/sglang等推理引擎的使用和性能优化经验;
4.熟悉各类深度学习网络和算子底层实现细节,具备训推模型调试、调优实操经验优先;
5.熟悉CPU/GPU异构加速瓶颈分析方法,有服务器端 AI 芯片、GPU加速经验优先;
6.熟悉分布式推理常用加速方法,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳…
招聘城市:上海,北京
…高质量增长,优化用户使用体验,提升商户经营水平,促进行业生态伙伴关系的持续健康发展。团队秉持务实、自驱、开放以及追求卓越的工程师文化,一方面通过系统和技术体系的持续迭代升级,帮助业务高质量增长;另一方面,密切关注前沿技术趋势变化,积极创新技术能力,为业务未来发展创造新的可能性。期待优秀的你加入我们,在夯实专业、深耕平台的基础上与业务携手同行,一起用技术 “帮大家吃得更好,生活更好”。
岗位职责:
1、负责美团搜推各场景的大模型引擎架构设计与开发,包括大规模模型训练框架、高性能推理引擎构建等核心工作;
2、主导面向多业务场景的大模型引擎架构设计,优化大模型推理性能,提升吞吐并…
招聘城市:北京,上海
…AI算法服务的部署,与投放平台、检索侧的工程化对接,搭建稳定可扩展的算法工程框架,承接所有算法服务;
3. 设计和优化推理架构,确保算法服务的高可用性、稳定性和效率,建立完善的监控告警和故障恢复机制;
4. 打造具有业界一流水平的大模型推理技术能力,并通过开源共建等各类形式,形成在业界的广泛技术影响力。
任职要求:
1. 精通Java/Python,对各种AI算法有一定的了解,有丰富的算法工程集成,并有大模型部署、性能优化和落地经验;
2. 有搜广推相关场景经验,对搜广推任意架构有一定的了解;
3. 深入了解transformers、vllm、sglang、tensorrt框架中的一种或多种,有多类模型的优化经验者优先;
4…
招聘城市:北京
…美团无人车团队,与我们一起用科技推动即时零售再升级!
岗位职责:
1.负责无人车整体训练业务的计算效率提升工作,通过底层存储和通信优化、模型结构调整和特定算子优化以及模型并行等优化技巧,大幅提升各个算法业务的训练效率,推进算法的高效迭代。
2.与各个业务团队合作,深入分析训练周期中的各个环节,定位和解决训练周期中各个环节的性能瓶颈,缩短算法的迭代周期。
3.负责多模态离线大模型推理云平台的构建和性能优化工作。
任职要求:
1.熟练掌握计算机系统基本原理,了解基本的性能优化手段。
2.优秀代码能力,熟练掌握C++/Python等至少一种编程语言。
3.了解深度学习算法基本原理,熟悉CNN/Transformer等主流模型原理。
4…
招聘城市:深圳
…机制与性能优化方法;熟悉深度学习模型从训练到推理的全链路转化逻辑,具备大模型训推一体化问题定位(如精度漂移、性能衰减)与优化经验者优先;
5.精通 CPU/GPU 异构计算架构下数据传输瓶颈(PCIe 带宽、内存墙、缓存利用率)分析方法;具备服务器端 AI 芯片(如 NVIDIA H100/A100、昇腾 910)推理性能调优经验,熟悉硬件特性与软件适配策略者优先;
6.精通分布式推理核心技术(张量并行、流水线并行、ZeRO 优化、动态负载均衡),熟悉分布式通信框架(NCCL、MPI)底层原理;主导过千亿级以上参数大模型分布式推理系统部署、性能调优与稳定性保障,具备超大模型推理成本优化实践经验者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是…
招聘城市:上海
…掌握新的技术和知识,不断提升自己的技术水平。02AI Infra算法工程师(1人)岗位职责负责大语言模型(LLM)的工程化落地与高效部署,包括算法优化、分布式推理系统设计与实现。设计并实现高性能的多会话管理系统,支持大规模并发请求的高效调度与负载均衡。构建统一的模型服务API接口,确保系统稳定性和可扩展性。优化LLM推理性能,包括量化加速、KV Cache管理、批处理优化、PD分离等技术方案,参与构建企业级大模型推理平台,实现GPU资源的智能分配与调度。任职要求计算机科学、人工智能或相关专业背景,5年以上相关工作经验。深入理解LLM架构与工作原理,熟悉Transformer模型结构与推理流程。精通Python,熟练掌握PyTorch…
招聘城市:深圳
岗位职责:
1.负责开发和优化大模型推理框架;
2.主要通过GPU、CUDA性能优化的手段,结合线上实际情况,优化高性能LLM推理引擎;
3.负责大模型训练和推理前瞻性技术架构的调研和引入,技术方案不限于子图匹配、编译优化、模型量化等。
岗位要求:
1.本科及以上学历,计算机/电子/自动化/软件等相关专业,有AI工程优化经验的优先;
2.熟练GPU的高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等;
3.具备丰富的基于CUDA的GPU性能优化经验;
4.了解深度学习算法基本原理,熟悉神经网络基本架构和各算子计算方式,了解至少一种深度学习训练框架及其模型文件的解析,如PyTorch、TensorFlow…