小红书(xiaohongshu) 【Dots】大模型算子优化工程师
全职 北京,上海,杭州
招聘城市:北京,上海,杭州
岗位职责:
面向大模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值
针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优
任职要求:
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof…
岗位职责:
面向大模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值
针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优
任职要求:
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof…