牛大妈在校招职位搜索分布式训练 有 260 条结果

招聘城市:北京,上海
…分析分布训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架…
招聘城市:北京,上海,杭州
…分析分布训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架…
招聘城市:北京
…优秀的代码能力、数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git开发环境;
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM训练框架(veRL/Megatron-LM/DeepSpeed等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉DP/TP/PP/ZeRO等分布训练策略原理,有大模型训练调优分析经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
5…
招聘城市:北京
…精排->出价->拍卖”的多级漏斗架构,但各模块独立优化导致优化目标不一致,前链路会制约后链路上限,漏斗效率折损大。随着大模型和生成技术的快速发展,其强大的表征能力和良好的Scaling性质也为广告系统提供了新的可能性。本研究旨在探索如何利用生成技术重塑整个广告系统,通过一个端到端的生成广告大模型完成所有决策,打破多级漏斗框架,打开模型决策空间,最大化平台收益。
【建议研究方向】
1.生成广告训练系统设计:基于前沿大模型(如Transformer、HSTU等),设计生成推荐模型的分布训练框架,优化数据/模型的高效并行处理和混合精度训练策略。
2.高性能推理引擎建设:既有大稀疏(Embedding),又…
招聘城市:北京,上海
…分析分布训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架…
招聘城市:北京,上海
…应用场景,挑战与机遇并存。
2.协同算法团队深度参与大模型项目,Codesign设计并训练行业领先的大模型。
3.从数据规模、集群体量、算法和业务复杂度多个维度提供了技术挑战和锻炼发展的机会,个人成长速度快。
4.追求卓越和鼓励创新的团队氛围。
任职要求:
1.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C++或Python。
2.学习能力强,对机器学习系统优化有技术热情,富有极客精神。
3.熟悉PyTorch框架和TVM/MLIR等编译优化技术的优先。
4.熟悉GPU、NPU硬件架构,熟练使用CUDA,NCCL,RDMA编程的优先。
5.熟悉机器学习、深度学习算法,希望从事工程架构方向的优先。
6.有分布系统、高性能计算实际项目经验的优先…
招聘城市:北京,上海
…多模态生成搜广推等前沿场景上规模落地。
1、参与开发支持下一代多模态生成搜广推超大规模(百亿-万亿级)模型的GPU千卡互联分布训练框架。
2、与公司算法同学深度合作,为重点项目进行算法与训练框架的联合优化。
3、支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2. 熟悉C/C++/CUDA,具备扎实的系统底层能力(内存、并发、网络)。
3. 有大规模分布系统开发和优化经验;有大模型分布训练经验者优先。
4. 接触过Megatron/DeepSpeed/veRL/OpenRLHF/LLaMA-Factory/MLIR/TVM/Triton/TileLang等分布异构计算…
招聘城市:上海
…技术底色: 计算机相关专业,具有较强的系统编程能力,精通 Python 和 C/C++。
2、计算底层: 熟悉 NVIDIA GPU 架构 (Hopper/Ampere/Blackwall),理解显存层次结构、流处理器(SM)工作原理。
3、框架经验: 熟悉 PyTorch 等深度学习框架,具有训练或推理性能优化经验者优先;阅读过 Megatron、DeepSpeed、vLLM、TensorRT-LLM 等开源项目源码者优先。
4、并行与分布计算: 理解并行计算与分布系统基本原理,了解数据并行(DP)、张量并行(TP)、流水线并行(PP)等常见大模型训练技术,有相关项目经验者优先。
5、网络与硬件:了解 InfiniBand、RoCE 等高速网络技术,以及 NVLink、NVSwitch 等 AI 集群互联架构。
网申须知
网申开始日期:2026-06-15 00:00
网申截止日期:2027-06-30 00:00
仅限 2026-09…
招聘城市:上海
…可用性及运维效率。
资源调度: 构建面向训练与推理场景的 GPU 资源调度体系,支持多租户资源共享、弹性扩缩容、任务优先级管理及异构算力调度,提高集群整体
工作要求:
1、技术底色: 计算机相关专业,具有较强的系统编程能力,精通 Python 和 C/C++。
2、计算底层: 熟悉 NVIDIA GPU 架构 (Hopper/Ampere/Blackwall),理解显存层次结构、流处理器(SM)工作原理。
3、框架经验: 熟悉 PyTorch 等深度学习框架,具有训练或推理性能优化经验者优先;阅读过 Megatron、DeepSpeed、vLLM、TensorRT-LLM 等开源项目源码者优先。
4、并行与分布计算: 理解并行计算与分布系统基本原理,了解数据并行(DP)、张量并行(TP)、流水线并行(PP)等常见大模型训练技术,有相关项目经验者优先。…
招聘城市:北京,上海
训练稳定性保障
3.方向三:异构算力适配
• 建设迭代多种异构算力(GPU/NPU等)的验证和适配方案,包括稳定性保障、精度验证和高性能runtime
• 开发调优GPU和NPU架构的通信算子,推进超节点架构的最佳实践
• 面向RL采样场景,深入优化NPU架构的推理性能
• 跟踪硬件生态发展,评估新硬件的技术价值,输出选型建议和规模化落地方案
4.方向四:高性能内核
• 定制开发高性能计算内核,深入发掘GPU/NPU等不同硬件架构的优化空间
• 推进算子开发范式的迭代,探索自动化算子生成(如LLM辅助生成高性能kernel)
任职要求:
1.计算机、电子工程、数学等相关专业硕士及以上学历
2.有一定大模型训练/推理/分布系统相关开发经验…

饿了么(ele) 研发工程师-C++/大模型开发

全职 北京,上海
招聘城市:北京,上海
职位描述:
负责淘宝闪购搜索推荐场景下,生成大模型训练及推理能力迭代,主要解决大规模数据下的分布训练以及在线推理能力。
1、参与生成模型相关的大规模分布机器学习平台的架构设计和构建;
2、参与大规模海量数据的离线训练和在线推理,提升模型预测的准确性和实时性;
3、与算法部门深度合作,进行算法与系统的联合优化;
4、持续关注领域内先进的技术和理论,负责机器学习系统前瞻技术的调研和引入。
任职要求:
1、计算机、软件工程、人工智能等相关专业优先;
2、具备良好的编程能力,熟练掌握C++/Python者优先,有编写高质量代码和优化算法的能力;
3、在机器学习、深度学习领域有实际…
招聘城市:北京,上海
…职责:
负责全公司机器学习基础设施的研发,包括大规模分布训练架构、高性能推理服务、深度学习编译优化、GPU硬件加速、RDMA网络优化等,支撑公司所有机器学习相关业务,如:搜索、推荐、广告、图像、NLP、语音、自动驾驶等。
任职要求:
1.本科及以上学历;
2.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C++或Python;
3.学习能力强,对机器学习系统优化有技术热情,富有极客精神。
具备以下经验者优先
1.熟悉TensorFlow/PyTorch等深度框架代码的优先;
2.熟悉TVM/MLIR等编译优化技术的优先;
3.熟悉GPU、RDMA硬件架构,熟练使用CUDA、NCCL、Verbs编程的优先;
4.熟悉机器学习、深度学习算法的优先(欢迎算法背景同学转方向);
5.有分布系统…
招聘城市:上海
分布训练框架。
通信优化: 深入优化 H/NCCL 通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。
稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 深度定制或调优 vLLM, TensorRT-LLM, Triton Inference Server 等推理框架。
算子开发: 针对 Transformer 结构编写高性能 CUDA/Triton kernels(如 FlashAttention, PagedAttention 的底层实现或改进)。
资源调度: 优化 K8s 集群下的 GPU 资源调度,实现动态扩缩容、请求批处理(Continuous Batching)以及 Prefix Caching。
3. 存储与算力管理 (Storage & Compute)
I/O 优化: 优化超大规模数据集的加载速度,解决训练
招聘城市:北京
…职责:
负责全公司机器学习基础设施的研发,包括大规模分布训练架构、高性能推理服务、深度学习编译优化、GPU硬件加速、RDMA网络优化等,支撑公司所有机器学习相关业务,如:搜索、推荐、广告、图像、NLP、语音、自动驾驶等。
任职要求:
1.本科及以上学历;
2.具备良好的计算机基础素养和分析解决问题的能力,熟练掌握C++或Python;
3.学习能力强,对机器学习系统优化有技术热情,富有极客精神。
具备以下经验者优先
1.熟悉TensorFlow/PyTorch等深度框架代码的优先;
2.熟悉TVM/MLIR等编译优化技术的优先;
3.熟悉GPU、RDMA硬件架构,熟练使用CUDA、NCCL、Verbs编程的优先;
4.熟悉机器学习、深度学习算法的优先(欢迎算法背景同学转方向);
5.有分布系统…
招聘城市:北京,广州
…部署经验者优先
了解深度学习基础与主流训练框架(PyTorch/TensorFlow),有模型训练经验
了解分布训练的基本原理(数据并行/模型并行/梯度同步等概念)
具备良好的工程能力与代码习惯,熟悉 Git 协作流程
学习能力强,对大规模系统与平台工程有热情
加分项
了解 PyTorch Distributed、DeepSpeed、FSDP 等分布训练框架
了解对象存储(S3/OSS)、并行文件系统等存储技术
有 Kubeflow、Ray 或类似平台的使用经验
有开源贡献或高质量的课程项目/毕业设计
有 GPU 集群使用经验或高性能计算相关背景
职位类别:计算机软、硬件/互联网/IT
专业要求:不限
单位简介
千曙科技是国内领先的L4级自动驾驶运力服务商。公司确立了 生成AI+车路云一体化…
招聘城市:上海
分布训练框架。
通信优化: 深入优化 H/NCCL 通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。
稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 深度定制或调优 vLLM, TensorRT-LLM, Triton Inference Server 等推理框架。
算子开发: 针对 Transformer 结构编写高性能 CUDA/Triton kernels(如 FlashAttention, PagedAttention 的底层实现或改进)。
资源调度: 优化 K8s 集群下的 GPU 资源调度,实现动态扩缩容、请求批处理(Continuous Batching)以及 Prefix Caching。
3. 存储与算力管理 (Storage & Compute)
I/O 优化: 优化超大规模数据集的加载速度,解决训练
招聘城市:上海
…机训练与推理的横向扩展性,结合CUDA Kernel优化、TensorRT部署及编译优化技术,支撑超长用户行为序列(10K+)建模与模型参数持续Scaling Up;
5. 下一代智能分发系统:参与构建面向大模型时代的智能内容分发架构,探索LLM与搜推系统的融合,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎。
工作要求:
1. 2027届应届毕业生,计算机相关专业本科及以上学历,具备扎实的C++/Python编程功底,熟悉Linux开发环境;
2. 有GPU异构计算实践经验,熟悉CUDA编程、TensorRT部署或编译优化技术(TVM/XLA/算子融合)在模型推理加速中的应用;
3. 有搜推模型训练或推理经验优先,了解PyTorch/TensorFlow等框架的底层机制,熟悉稀疏Embedding的分布多级…
招聘城市:北京,上海

3、基于自建的训推引擎,落地公司统一的大模型生产部署平台,为公司所有大模型算法同学提供端到端的一站服务。
大模型压缩方向:
1、探索研发针对大语言模型、多模态大模型等场景的压缩技术,包括但不限于量化、蒸馏、剪枝、稀疏化等;
2、参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持业务降本增效;
3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件,制定不同的模型压缩方案并在业务落地。
大模型推理方向:
1、参与/负责研发面向LLM/MLLM等模型的稳定、易用、性能领先的AI推理框架;
2、通过并行计算优化、分布架构优化、异构调度等多种框架技术,支撑…
招聘城市:上海,北京
…算法,协助团队进行奖励模型的构建和优化
Reasoning技术探索:参与模型监督、自我提升等训练优化探索
训练框架优化:学习使用LLM训练框架,参与协助优化训练流程,提升团队开发效率
任职要求:
任职资格
具备较好的编程能力和算法开发能力,熟悉常用的机器学习、深度学习算法
熟悉Llama-Factory、veRL、MS-Swift等框架,有相关项目经验更佳
了解分布训练框架如DeepSpeed、Megatron-LM等
有较强的学习意愿和团队协作精神,能保证每周至少3天实习时间,实习期至少3个月
加分项
对强化学习有基本了解或项目经验
有开源项目贡献经历,尤其是与LLM相关的项目
发表过相关领域的学术论文
对模型对齐、推理、思维链(CoT)等LLM训练技术有了解
招聘城市:深圳,其它
…较强的自我驱动力和学习能力,并乐于不断尝试、追求业务突破。加分项:1、熟悉常见的CV、NLP模型,如ViT、GPT等;2、熟悉AI领域常见分布训练技术的原理和实现,包括但不限于:数据并行、流水线并行和张量并行等,并具有相应的项目经验;3、熟悉一种或多种深度学习框架,如Pytorch、Tensorflow、PaddlePaddle、Deepspeed、Megatron等,能够熟练使用并解决使用中遇到的问题;4、熟悉GPU硬件结构和CUDA计算的原理,有CUDA相关算子开发、调试经验,对NCCL,cuDNN等有一定了解;5、熟悉AI模型训练、微调、评估算法和流程,具有相关项目经验。"
投递说明:
网申/内推>笔试(部分岗位不设笔试)>2-3轮专业面试>HR沟通>Offer
单位简介…