牛大妈在社招职位搜索大模型推理性能优化工程师 有 1000+ 条结果

招聘城市:上海
…熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅…
招聘城市:深圳
…熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅…
招聘城市:北京
…熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅…
招聘城市:杭州
…熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm等,具备语言、多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅…
招聘城市:深圳
…高性能推理引擎;
3.跟进机器学习前沿技术,将合适成果落地于实际应用。
岗位要求:
1.精通TensorFlow、PyTorch等主流深度学习框架,具备扎实的模型训练、调优及线上部署实践经验;
2.精通C/C++,精通常用数据结构与算法;
3.熟练掌握高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等;
4.熟悉模型推理框架(如vLLM/SGLang/TRT-LLM等),有推理优化经验者优先;
5.优秀的分析问题和解决问题的能力,对解决具有挑战性的问题充满激情;
6.责任心强,良好的业务意识,团队合作能力和沟通协调能力。
加分项:
1.有游戏开发经验;
2.熟悉NLP,CV,语音合成等深度学习算法;
3.有模型训练…
招聘城市:北京
…分析模型训推特性,结合AI芯片和整机硬件系统,软硬协同充分发挥硬件效能。
岗位要求:
1.精通主流模型训练框架(DeepSpeed、Megatron等)和训练流程,熟悉分布式训练的底层通信机制、内存管理和优化策略、并行调度逻辑,有训练调参和性能评测经验;
2.熟悉主流模型推理框架(vLLM、SGLang等),具备在推理上进行通信优化、并行计算、存储优化等调优能力;
3.熟悉主流AI芯片(GPU H100、Ascent)架构特性和相关profiling工具,有CUDA编程、编译分析、运行时分析等经验;
4.熟悉大规模训推的可观测建设、诊断分析、故障解决,有稳定性治理经验优先;
5.有良好的沟通、解决问题能力,能主动探索业界前沿技术。
岗位介绍:
在腾讯,后台开发工程不仅…
招聘城市:北京
…1. 模型推理服务优化
* 负责语言模型(LLM)推理性能优化,包括延迟降低、吞吐量提升和资源效率优化
* 开发和应用模型压缩技术(包括但不限于量化、稀疏化等)
* 优化推理框架,支持多种硬件平台(GPU、专用AI芯片)
* 设计并实现高效、稳定、可扩展的推理服务架构
2. 性能分析与调优:
* 建立性能基准测试框架,持续监控和评估推理性能
* 分析性能瓶颈,提出并实施优化方案
* 针对不同应用场景(实时对话、批量处理等)定制优化策略
3. 技术创新与落地:
* 跟踪最新研究成果,将前沿优化技术应用到生产环境
* 与算法团队合作,参与模型架构的推理友好设计
* 编写高质量的技术文档和最佳实践指南
岗位要求:
1.必备条件:;
2.计算机、软件工程、人工智能等相关专业…
招聘城市:北京,上海
…业务模型,进行深度的推理调度策略优化和关键算子(Kernel)的性能剖析与极致优化,持续提升系统的吞吐量、降低延迟;
4、生态合作与协同:作为技术接口人,与国产芯片原厂技术支持团队紧密合作,高效推进芯片驱动、基础软件栈的引入、问题排查与版本迭代,确保技术路线顺畅推进。
任职要求:
1、熟练掌握 C++/Python 编程,具备扎实的计算机体系结构、数据结构和算法基础,具备良好的编程习惯;
2、有至少一款非Nvidia GPU的异构计算芯片适配模型训练、推理框架的相关经验,包括但不限于AI框架适配、模型移植、性能优化或算子开发;
3、熟悉至少一种主流的机器学习框架(PyTorch/PaddlePaddle/TensorFlow等),对框架内部实现有一定了解;
4、具备大型深度学习模型
招聘城市:深圳
…2.与模型算法同学深度合作,联合优化,打造行业领先的高性能推理引擎;
3.跟进机器学习前沿技术,将合适成果落地于实际应用。
岗位要求:
1.精通C/C++,精通常用数据结构与算法;
2.熟悉模型推理框架(如vLLM/SGLang/TRT-LLM等);
3.熟练掌握高性能计算优化技术,深入理解计算机体系结构,熟悉并行计算优化、访存优化,低比特计算等;
4.熟练掌握CUDA,有基于CUTLASS或PTX的GPU性能优化经验;
5.优秀的分析问题和解决问题的能力,对解决具有挑战性的问题充满激情;
6.责任心强,良好的业务意识,团队合作能力和沟通协调能力。
加分项:
1.有游戏开发经验;
2.熟悉NLP,CV,语音合成等深度学习算法;
3.有模型训练…

小红书(xiaohongshu) 模型MaaS推理资源调度系统工程/专家

全职 北京,上海,深圳,杭州
招聘城市:北京,上海,深圳,杭州
…KV Cache、模型热度等指标的弹性伸缩能力,实现容量预热、快速扩缩容、资源回收和成本归因。
4、大规模异构算力调度:面向万卡级异构 GPU 集群,建设跨集群、跨机型、跨芯片架构、跨模型的统一调度系统,解决资源分配、模型副本放置、容量池治理、热点迁移、故障迁移和资源碎片治理问题。
任职要求:
1、有分布式系统、云原生、资源调度或高性能服务治理经验。
2、熟悉 Kubernetes 调度体系、弹性伸缩、服务发现、流量治理等技术。
3、理解模型推理链路,熟悉 GPU、显存、KV Cache、batching、Token 吞吐、TTFT/TPOT 等概念。
4、有 GPU 集群、MaaS 平台、模型服务平台或推理系统经验优先。
5、具备强指标意识,能够围绕 SLA、GPU 利用率/SMA、吞吐、延迟和成本持续优化系统。
加…

小红书 模型算法工程

全职 北京,上海
招聘城市:北京,上海
…设计和实现模型训练的AI Infra框架。
任职要求:
1、本科及以上学历,计算机、人工智能和数学等相关专业,博士研究生优先;
2、熟练掌握扩散模型设计和使用技巧,在知名模型公司/团队从事图像或视频生成者优先,有多模态/OMNI模型理解&生成统一框架经验者优先;
3、有丰富的模型预训练和后训练数据处理经验,熟练掌握数据收集、数据清洗、数据去重和数据合成等流程,能针对数据质量制定出评估指标和方法,在知名模型公司/团队长期从事数据技术者优先;
4、MoE/Dense模型训练实战经验,包括模型预训练、RL Reasoning、SFT和RLHF等,熟练掌握各种模型训练和推理技巧,在模型前沿技术领域有深度探索,发表…
招聘城市:北京,上海
…专注于语言模型领域的前沿技术研究和落地,提供高性能、高可靠、可扩展的机器学习系统、丰富的异构计算资源和极致的端到端的机器学习服务体验,为公司提供核心技术能力和服务。
1、负责机器学习框架的研究与开发,服务于公司各个产品;
2、高效部署,优化NLP/多模态模型核心业务模型
【轻量化】
机器学习系统团队需要将传统或者新型的轻量化算法和工程有机结合起来进行加速,提高语言模型训练或者推理性能的同时,通过算法手段尽可能降低效果损失。候选人将在以下几个方向进行深入探索和落地:
1、量化方向:负责但不限于语言模型的低精度训练(FP8)、推理(W8A8KV8等)、低精度优化器(量化梯度、优化器…

小红书 模型压缩算法研发工程/专家

全职 北京,上海
招聘城市:北京,上海
模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 模型 API 服务、QuickSilver 模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、探索研发针对语言模型、多模态模型、StableDiffusion模型模型的压缩技术,包括但不限于量化、蒸馏、剪枝、稀疏化等;
2、参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持业务降本增效;
3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件,制定不同的模型压缩方案并在业务落地;
任职要求:
1、熟悉蒸馏、剪枝、量化等模型压缩常用…

小红书 模型推理框架研发工程/专家

全职 北京,上海
招聘城市:北京,上海
…技术高效落地!
工作职责:
1、参与/负责研发面向语言模型(LLM)/多模态模型(MLLM)等类型模型推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
4、参与/负责构建推理框架的系统容错能力,包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设;
5、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
6、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力…
招聘城市:北京
…AI 技术高效落地!
1、参与/负责研发面向语言模型(LLM)/多模态模型(MLLM)等类型模型推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/python开发;
2、熟悉至少一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现;
3、具备AI模型性能调优、量化和稀疏化经验者优先;…
招聘城市:北京,上海
…策略、模型能力、下游任务的全链路归因能力
建立并持续完善的数据质量、多样性、重复度、覆盖率等评估体系,分析和量化每个维度的影响
针对模型核心能力进行重点强化,包括不限于数学、推理、Code、Agent、ICL、OCR等
探索如何使用更少数据量,达到同样模型能力的策略,持续提升per token的通用能力训练效果
探索基于各类策略
任职要求:
模型方向充满兴趣,且能充分意识到数据对于模型能力的重要价值和数据侧的巨大空间
有很好的数据感觉,对人类文明积累下来的优质数据分布有很好的判断
有很好的NLP/多模态经验,在数据和算法方向上有深度的工作
工程能力强,有大规模数据处理的经验
招聘城市:北京
…熟悉cutlass等加速库是加分项;
3.熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm,FasterFransformer等;
4.熟悉各类深度学习网络和算子底层实现细节,训练和推理模型调试、调优有实操经验优先;
5.熟悉并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先;
7.加分项:;
8.机器学习或者体系结构相关顶会论文;
9.参与vllm、sglang等开源项目贡献者;
10.熟悉推理服务框架,具备服务部署经验者优先,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀…
招聘城市:深圳
…多模态模型大规模部署和优化经验;
3.熟悉并行策略,如数据并行、流水线并行等,熟悉NVLINK、GPU RDMA通信者优先;
4.熟悉各类深度学习网络和算子底层实现细节,有实操经验优先;
5.熟悉主流开源模型及其架构特点,具备针对不同模型进行分析优化的能力优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.熟悉常见的算子编译优化、图优化和算子融合流程,如torch.compile,triton,tilelang等;
2.熟悉GPU/AI芯片编程,如CUDA,Ascend C等,熟悉cutlass等加速库;
3.机器学习或者体系结构相关顶会论文;
4.参与vllm、sglang等开源项目贡献者。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的…
招聘城市:北京
…熟悉cutlass等加速库是加分项;
3.熟悉主流模型推理框架,如vllm,sglang,tensorrt-llm,FasterFransformer等;
4.熟悉各类深度学习网络和算子底层实现细节,训练和推理模型调试、调优有实操经验优先;
5.熟悉并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先;
7.加分项:;
8.机器学习或者体系结构相关顶会论文;
9.参与vllm、sglang等开源项目贡献者;
10.熟悉推理服务框架,具备服务部署经验者优先,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀…

小红书(xiaohongshu) 模型推理服务架构工程-hi lab

全职 北京,上海,广州
招聘城市:北京,上海,广州
…计算资源和极致的端到端的机器学习服务体验,为公司提供核心技术能力和服务。
1、负责模型推理服务的研究与开发,服务于公司各个产品;
2、负责端到端解决模型预训练、微调对齐阶段的工程、算法问题,为结果负责
任职要求:
1、熟练掌握Linux环境下的C/C++、Python语言;
2、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
3、能够熟练使用至少一种主流的机器学习框架(TensorFlow / PyTorch等),熟悉框架内部实现;
4、熟悉Transformer模型及其应用场景
5、熟悉CUDA编程;
加分项
1、备具C端业务千卡规模以上模型服务研发和运维经验
2、具备端到端优化GPU模型推理服务经验者优先