牛大妈在社招职位搜索Dots大模型算子优化工程师 有 3 条结果

小红书(xiaohongshu) 【Dots模型算子优化工程

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
岗位职责:
面向模型训练/推理场景,开发和优化高性能 GPU 算子(Attention、GEMM、LayerNorm、MoE、Element-wise 等),逼近硬件理论峰值
针对新模型结构(长 context、MoE、线性 Attention 等)设计定制化 kernel,解决原生框架无法覆盖的性能瓶颈
深度优化访存效率、计算-访存重叠、算子融合(fusion),降低 kernel launch 开销与显存占用
参与推理引擎核心链路优化:KV Cache 管理、量化算子(INT8/FP8/INT4)、投机采样、continuous batching 等
与训练框架、模型算法团队紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产算力)上的算子适配与性能调优
任职要求:
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof…

小红书(xiaohongshu) dots-模型结构算法工程

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
… KV Cache 优化 / 推理效率优化 / 稀疏化与动态计算
我们希望找到:真正影响模型能力边界的结构,而不是参数堆叠。
3. 优化器与训练系统
研究超大模型训练中的优化与稳定性问题,包括:
- AdamW / Muon / Sophia / Shampoo 等优化器探索
- 混合精度训练
- Batch 训练
- 大规模训练异常分析
任职要求:
我们希望你具备
基础要求
- 计算机 / 数学 / 物理等相关专业本科以上
- 扎实的 Python 能力,熟悉 PyTorch
- 良好的机器学习与深度学习基础
加分项
数学 / 算法能力强:ACM / ICPC / NOI / IOI / 数学物理竞赛背景 / 强统计学与优化基础
模型训练经验:Pretraining / MoE / 长上下文训练 / 多模态训练
有系统与性能优化能力:有分布式训练或 CUDA / Triton 算子优化经验者优先
Research Taste(重点加分…

小红书(xiaohongshu) dots-AI infra

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…变种),训练阶段的MQA/GQA系列等
3、稀疏化方向:语言模型剪枝、稀疏、蒸馏、Sparse Attention等
4、新型方向:Medusa、超长文本、Speculative Sampling等
任职要求:
分布式
1、熟练掌握Linux环境下的C/C++、Python语言;
2、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
3、能够熟练使用至少一种主流的机器学习框架(TensorFlow / PyTorch等),熟悉框架内部实现;
4、熟悉Transformer模型及其应用场景等;
轻量化
1、拥有上述一个或多个方向的实际落地经验,能独立从头到尾完成上述某个方向
2、熟练使用主流大规模训练或推理引擎开发,例如DeepSpeed/Megatron/Transformer Engine等
3、两年以上工作经验,工程能力较强者优先,拥有实际Cuda算子开发经验者优先