招聘城市:上海
…AI Infra 产品经验;8.1 年 GPU 智算工作经验;9.35周岁以下。9高级AI Infra 研发工程师(2人)岗位职责1.围绕千卡级 GPU 集群构建高性能、高可用的分布式训练框架与推理服务,持续提升算力利用率与 SLA;2.深度优化 vLLM / SGLang 等推理引擎在异构 GPU 下的性能,落地量化、PD 分离、投机解码、KV Cache 复用等关键能力;3.协同 IB / RoCE 网络与分布式存储,完成通信优化、显存管理与长序列、MoE 等场景的端到端调优;4.支撑 MaaS / MLP 平台的训练编排、模型托管、弹性伸缩等能力建设,跟踪前沿并沉淀公司级最佳实践。任职要求1.工程素养扎实,责任心强,能独立完成复杂模块的设计与落地;2.精通 Python…
招聘城市:深圳
…要求:
1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机体系结构、操作系统、网络和数据结构基础。
2. 极佳的 C++ 和 Python 编程能力,具备复杂系统架构设计能力,代码风格良好,追求极致的系统性能。
3. 深入理解 PyTorch/TensorFlow 等主流深度学习框架的底层运行机制(有向无环图优化、内存管理、算子分发等),有定制修改框架底层源码经验者优先。
4. 熟悉 GPU 体系结构,熟练使用 CUDA / C++ 编写高性能算子;熟悉 TensorRT、Triton 等推理加速工具链;具备丰富的性能 Profiling 及瓶颈分析经验。
5. 分熟悉分布式系统的核心理论,深入理解 NCCL、MPI 等通信协议;有 Megatron-LM、DeepSpeed、HugeCTR 等大规模分布式训练框架实战经验者尤佳。
6. 了解互联网广告…
招聘城市:北京
…训练经验,或有机器人任务中的预测、规划、建模经验者优先。7. 有完整相关项目经验,能够展示从问题定义、模型实现到实验验证的闭环能力者优先。8. 在 ICLR / ICML / NeurIPS / CVPR / CoRL / ICRA / IROS 等会议发表过相关论文,或有高质量开源项目、竞赛经历、顶尖实验室经历者优先。【AI INFRA】世界模型 AI Infra 高级工程师 / 实习生AI Infra · Training Systems | 北京 · 全职 / 实习| 岗位职责 RESPONSIBILITIES1. 负责世界模型、DiT、多模态生成模型的大规模训练基础设施建设,持续提升训练吞吐、MFU、显存效率、集群扩展效率、任务稳定性和资源利用率。2. 围绕 FSDP、Megatron、TorchTitan 等分布式训练框架开展工程适配和性能调优,设计并优化并行策略、计算与通信效率以及大规模 GPU…
招聘城市:北京
…PyTorch / Lightning,能独立完成模型训练、调参与实验分析。· 有视频模型训练,或机器人预测 / 规划 / 建模项目经验者优先。· 在 ICLR / ICML / NeurIPS / CVPR / CoRL / ICRA / IROS 发表过论文,或有高质量开源项目经历者优先。【AI INFRA】世界模型 AI Infra 高级工程师 / 实习生AI Infra · Training Systems | 北京 · 全职 / 实习| 岗位职责 RESPONSIBILITIES· 负责世界模型、DiT、多模态生成模型的大规模训练基础设施建设,持续提升训练吞吐、MFU、显存效率、集群扩展效率、任务稳定性和资源利用率。· 围绕 FSDP、Megatron、TorchTitan 等分布式训练框架开展工程适配和性能调优,设计并优化并行策略、计算与通信效率以及大规模 GPU 集群下的训练扩展能力。· 建立数据驱动的训练性能分析与优化体系,定位计算…
招聘城市:北京
…Python/Java等一种或多种语言和调试工具,具有丰富的工程经验;
3.熟悉常用的算法和数据结构,具有良好的软件工程意识,有高并发、大规模后台服务开发经验优先;
4.了解业界常见的分布式存缓系统,比如Alluxio、3FS、CEPH、AWS-S3、JuiceFS等,对RDMA、FUSE、文件系统有实际经验者更优;
5.了解模型训练和推理的过程,对训练数据和模型加载、checkpoint、KVCache、GPU、训练和推理框架有了解者更优;
6.具有优秀的学习能力、分析和解决问题能力、沟通能力、团队合作意识,具有强烈的责任心与主动性,对所负责工作有owner意识;
7.有开源项目贡献,参与顶会发表论文等贡献者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的…
招聘城市:深圳
…coding和调试能力;
2.熟悉GPU/AI芯片编程,如CUDA,OpenCL,Ascend C等;
3.熟悉常见的算子编译优化和算子调优手段,如torch.compile,triton等;
4.熟悉各类深度学习网络和算子底层实现细节,训练和推理模型调试、调优有实操经验优先;
5.熟悉主流推理框架,如vllm,sglang,tensorrt-llm,FasterFransformer等优先;
6.熟悉并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
7.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先。
加分项:
1.机器学习或者体系结构相关顶会论文;
2.参与vllm、sglang等开源项目贡献者;
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与…
招聘城市:深圳
…Python/Java等一种或多种语言和调试工具,具有丰富的工程经验;
3.熟悉常用的算法和数据结构,具有良好的软件工程意识,有高并发、大规模后台服务开发经验优先;
4.了解业界常见的分布式存缓系统,比如Alluxio、3FS、CEPH、AWS-S3、JuiceFS等,对RDMA、FUSE、文件系统有实际经验者更优;
5.了解模型训练和推理的过程,对训练数据和模型加载、checkpoint、KVCache、GPU、训练和推理框架有了解者更优;
6.具有优秀的学习能力、分析和解决问题能力、沟通能力、团队合作意识,具有强烈的责任心与主动性,对所负责工作有owner意识;
7.有开源项目贡献,参与顶会发表论文等贡献者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的…
招聘城市:北京,上海
…经验, 具备扎实的图像处理算法基础, 有良好的数学功底;
3. 在图像超分辨、图像修复、图像去噪、无参考质量评价等领域有丰富的经验,擅长跟踪最前沿的学术界和工业界的人工智能技术;
4. 对视频降噪、视频超分等有深刻理解和落地经验者优先;有利用图像算法和深度学习改善视频编码效率的落地经验者优先;
5. 良好的编程基础,熟练掌握python/C/C++等编程开发技术和常用的数据结构、算法, 熟练使用业界常用的算法训练工具(tensorflow\caffe\pytorch之一);
6. 有大规模商用产品转化经验者优先;有算法优化、底层异构编程(arm/gpu/dsp)经验者优先;
7. 具备良好的沟通能力和合作精神,较强的进取心和英语能力。
招聘城市:广州
…训练平台,支持超大规模稀疏模型的秒级实时训练与推理;负责开发模型推理平台,支撑数百个模型的复杂环境下的高并发、低延迟、低成本运行和海量资源的实时调度;
2.支撑视频号短视频推荐、直播推荐、红点推荐、图文推荐等大规模、复杂业务矩阵的高效迭代。
岗位要求:
1.计算机相关专业,本科及以上学历,5年及以上工作经验 熟悉 Linux 开发环境、熟悉C/C++编程语言,熟练掌握常用算法和数据结构,有搜索/广告/推荐方向业务开发经验,熟练掌握至少一门脚本语言(shell/python等);
2.熟悉至少一种深度学习相关框架如tensorflow、pytorch等,有底层框架优化且开源经验;具备扎实数学/算法功底,对机器学习、概率统计等算法原理有所了解;
3.有GPU…
招聘城市:北京,上海,杭州
…高可用、高性能的微服务体系;
2、负责构建面向大模型全流程的DevOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路稳定高效地落地;
3、负责万卡规模GPU集群效能分析及优化,通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段,提升GPU集群使用效率;
4、将平台和框架结合,通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率,涉及k8s/kubeflow、网络通信、分布式训练等;
5、优化各AI平台性能,提升系统稳定性和可扩展性,保障大规模并发场景下的服务质量与用户体验;
6、持续研究分析业内创新AI平台产品,优化技术方案,改进产品功能,提升创新能力与产品体验。…
招聘城市:北京,上海,杭州,深圳
…高可用、高性能的微服务体系;
2、负责构建面向大模型全流程的DevOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路稳定高效地落地;
3、负责万卡规模GPU集群效能分析及优化,通过调度策略优化、在离线混部、GPU虚拟化、存储&网络加速等手段,提升GPU集群使用效率;
4、将平台和框架结合,通过任务调度、弹性容灾、性能优化等措施端到端提升AI生产效率,涉及k8s/kubeflow、网络通信、分布式训练等;
5、优化各AI平台性能,提升系统稳定性和可扩展性,保障大规模并发场景下的服务质量与用户体验;
6、持续研究分析业内创新AI平台产品,优化技术方案,改进产品功能,提升创新能力与产品体验。…
招聘城市:广州
…训练平台,支持超大规模稀疏模型的秒级实时训练与推理;负责开发模型推理平台,支撑数百个模型的复杂环境下的高并发、低延迟、低成本运行和海量资源的实时调度;
2.支撑视频号短视频推荐、直播推荐、红点推荐、图文推荐等大规模、复杂业务矩阵的高效迭代。
岗位要求:
1.计算机相关专业,本科及以上学历,5年及以上工作经验 熟悉 Linux 开发环境、熟悉C/C++编程语言,熟练掌握常用算法和数据结构,有搜索/广告/推荐方向业务开发经验,熟练掌握至少一门脚本语言(shell/python等);
2.熟悉至少一种深度学习相关框架如tensorflow、pytorch等,有底层框架优化且开源经验;具备扎实数学/算法功底,对机器学习、概率统计等算法原理有所了解;
3.有GPU…
招聘城市:上海
…基于 Ray/Spark 的分布式数据处理 Pipeline,适配音视频 / 弹幕等特色数据处理需求,实现 CPU/GPU 动态编排,支撑日均 TB 级 AI 训练数据自动化处理。
4、优化算力与存储体系,结合 B 站多模态数据特点设计分级存储方案,提升 GPU 利用率、降低存储成本;搭建元数据管理与数据血缘追踪体系,缩短数据问题追溯时间,保障 AI 搜数据链路稳定性。
5、基于 B 站 AI 搜用户行为,构建Query 驱动的数据飞轮,实现 RAG 材料、搜索反馈数据的自动化沉淀与迭代,推动 “数据 - 模型 - 搜索体验” 的闭环优化。
6、跨部门协同 B 站算法、Infra、内容生态等团队,对齐 AI 搜数据需求,从数据层面推动搜索场景大模型应用落地;带领 3-10 人数据工程团队,统筹数据基建…
招聘城市:深圳
…
4.了解大模型全流程:训练、微调、RAG、推理引擎、量化、蒸馏、向量数据库等,有MaaS/LLM Inference服务开发经验优先;
5.熟悉AI Infra:GPU使用与优化、异构算力纳管、分布式任务调度、性能压测与调优,有大规模模型服务上线运维经验优先;
6.具备良好的系统设计、问题定位与跨团队协作能力,能独立负责复杂模块 / 系统,执行力强;
7.对AGI与MaaS有强烈热情,学习能力强,关注混元、DeepSeek 等主流模型及行业竞品,愿意长期深耕 AI 工程化领域;
8.有AI 安全合规、内容审核、企业级私有化交付、金融/政务等高安全要求场景经验者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创…
招聘城市:深圳
…分布式训练、Prompt 工程、RAG 等相关技术;
4.深入理解分布式系统原理,精通微服务架构、容器化、Kubernetes、CI/CD 等云原生技术;
5.精通 MySQL、Redis、MongoDB、Elasticsearch 等主流存储系统,了解其核心原理与性能优化手段;
6.熟悉消息队列、任务调度、分布式事务等中间件技术,有高并发、高可用系统设计与运维经验;
7.具备出色的问题分析与解决能力,能够快速定位并解决复杂的系统问题;
8.具备出色的沟通协调能力与团队管理能力,能够有效推动跨团队协作,带领团队攻克复杂技术难题。
加分项:
1.有游戏行业从业经验,熟悉游戏开发全流程与游戏服务器架构;
2.有 Agent 框架、工作流引擎、低代码平台开发经验;
3.有大规模 GPU 集群管理与…
招聘城市:上海
…GPU编程经验。AI Infra算法工程师(1人):负责大语言模型的工程化落地与高效部署,需5年以上相关工作经验。产品经理(1人):负责智算资源及与大模型结合的产品规划,需3年以上产品经理工作经验。高级项目经理—智算和大模型方向(1人):负责智算和大模型项目落地的整体规划,需2年以上AI相关领域技术背景工作经验。IB网络工程师(1人):负责算力中心高性能网Infiniband设计与优化,需3年以上网络相关工作经验。销售总监(1人):负责智算相关产品的销售和市场开拓,需3年以上销售经验。解决方案总监(1人):负责产品及解决方案的文案输出与售前技术交流。运维工程…
招聘城市:北京,上海,深圳
…在未知领域开疆拓土的冒险家。Kelly Guo工程经理NVIDIA 鼓励协作、透明和共同承担,团队围绕同一使命快速学习、解决难题。NVIDIA 提供丰富的跨领域机会帮助您将技术兴趣与职业理想转化为有影响力的成果。对于希望深耕机器人仿真与具身智能的人来说,这里既有广阔舞台,也有持续成长的空间。Yan Chang首席工程师 & 高级工程经理我们打造开放、多元且全球化的工作环境,让不同背景的创新者汇聚一堂,共同推动 AI 与机器人技术的未来。公司文化重视创新、协作和高标准执行,提供全球化团队和高影响力项目,帮助员工持续成长并实现职业理想。Nic Ma高级工程经理NVIDIA 是一个极具凝聚力、团结协作的团队…
招聘城市:东莞
…镜像基本原理;3. 具备 Kubernetes 基础运维或平台经验(部署、监控、日志、简单扩缩容);4. 了解 GPU/加速器的基本概念(驱动、CUDA、显存、MIG/vGPU 的概念即可,能按文档完成安装与排障);5. 熟悉至少一种模型服务/推理框架(如 KServe、NVIDIA Triton、vLLM、TensorRT-LLM 的其中之一);6. 具备基础网络与存储知识:TCP/IP、DNS、Ingress/网关、对象存储(S3 兼容)或共享存储的基本使用;7. 优秀的英语读写能力,能够熟练阅读英文技术文档与开源项目文档。自动化设备开发类上下滑动 阅读更多内容高级AOI算法应用工程师岗位职责:1.负责AOI自动光学检测设备的算法开发、调试与应用优化,针对PCB、半导体、3C电子、锂电等行业产品的外观缺陷(划伤、瑕疵、变形、缺料…