招聘城市:北京
…AI高性能算子工程师
学历:硕士
需求人数:3
需求专业:数学与统计学类,数学与统计学类(徐特立英才班),数学与应用数学(拔尖班),数学与应用数学(徐特立英才班),数学与应用数学(强基班),数学与应用数学,数学(拔尖班),徐特立数学班,人工智能
|||需求专业:数学与应用数学(徐特立英才班),数学与统计学类(徐特立英才班),徐特立数学班,数学与统计学类,数学与应用数学(强基班),数学与应用数学,人工智能,数学(拔尖班),数学与应用数学(拔尖班)
工作地点:北京市朝阳区
职位描述:1、熟练使用Linux; 熟悉python或C++者优先;2、有深度学习相关背景者,熟悉主流AI框架者优先;3、.熟悉CPU、GPU、FPGA或AI处理器架构中…
招聘城市:杭州,深圳,北京,上海
…ATE测试工程师(上海)等;5. 产品&职能类:AI芯片市场总监(上海)等。
校招:AI软件开发工程师(编译器/算子开发)(上海)等。
投递方式:扫码关注“昕原招聘”岗位随“昕”投递,点击蓝字 投递岗位。
校招公告:
昕征程
我们有成熟的舵手
也需要崭新的星图
校招和社招同步进行
期待不同职业阶段的您加入昕原
昕原半导体(上海)有限公司成立于2019年,专注于ReRAM新型存储技术及相关芯片产品的研发,涵盖AI存算一体(Computing in Memory, CIM)IP及大模型加速方案、高性能/高可靠的系统级存储(System-on-Memory, SoM)芯片、先进制程嵌入式存储(Embedded memory, eReRAM)三大应用领域,并已经在存储芯片、存算IP、高性能MCU…
招聘城市:北京
算法工程师 50万元/年
2026-08-20 11:36:16发布
职位要求:
职位性质:全职
工作城市:北京市海淀区
招聘人数:15
学历要求:硕士
职位类别:其他人员
需求专业:电子信息类,计算机类,通信类,集成电路类
职位描述:
岗位职责
"1. 负责影像处理类 IP 的算法(传统+AI)开发,包括但不限于:去噪、超分、HDR、图像拼接、深度估计等。
2. 负责 AI 处理器、RISC-V 通用处理器的架构建模与性能分析,包括但不限于:搭建数学模型及 G5 模型,分析性能瓶颈,探索更优架构,为架构演进及决策提供数据支撑。
3. 负责 AI 工具链算法开发包括但不限于:
a) 基于 MLIR 的高性能 AI 编译器开发及模型适配和调优。b) 算子编译器(PPL)的开发…
招聘城市:北京,上海,深圳,其它,成都,武汉
…AI编译器开发、算子编译器开发、LLM训推框架开发、高性能算子库开发、运行时软件开发
工作地点:北京、上海、深圳、厦门、武汉、成都、青岛
四、嵌入式软件工程师
学历要求:硕士、博士岗位职责:
1.负责系统开发与移植,包括但不限于Linux嵌入式系统固件开发和移植,涵盖多媒体、图像处理相关模块,同时承担系统软件的开发与维护工作;开展嵌入式软件开发、系统级调试与测试,分析并定位嵌入式系统软硬件联调过程中的相关问题。
2.负责驱动与底层优化,包括但不限于进行各外设模块驱动程序的开发、维护,以及底层软件的性能优化、系统稳定性保障和系统安全加固。
3.负责算法应用适配,在TPU硬件平台上移植AI算法并优化性能与…
招聘城市:深圳
…如Megatron-LM、DeepSpeed、vLLM、TGI等),至少熟练掌握PyTorch或MindSpore之一,了解框架底层算子调用机制,具备较强的性能分析、定位与优化能力,能独立解决复杂技术问题
4.加分项:有千亿参数大模型在昇腾集群上的训练或推理优化经验;在昇腾相关开源项目(MindSpore、CANNSamples等)中有代码贡献;熟悉AI编译器技术(TVM/MLIR)并有昇腾后端开发经验
4
优化与工程计算研究中心
昇腾通信研发工程师(AIInfra)
1
本科及以上
计算机科学技术或人工智能或软件类
1.昇腾平台通信算子开发与优化:
基于华为昇腾AI处理器集群,设计并实现高性能通信算子;开发并优化大模型训练中的核心通信原语如AllReduce、AllGather、ReduceScatter…
招聘城市:上海
…闵行区
招聘人数:5
学历要求:本科
职位类别:工程技术人员
语言能力:不限
需求专业:电子信息类,集成电路类,计算机类,通信类
职位描述:
岗位职责
主要职责:
1、熟悉公司自研芯片架构。
2、开发、验证MLIR算子,提升执行效率和减少运算资源消耗。
3、撰写技术文档和操作指南,帮助其他开发者理解和利用新开发的算子。
任职资格
要求:
1、了解CUDA编程和GPU架构,熟悉C++和python
2、熟悉至少一种主流的深度学习架构,如pytorch、tensorflow
3、熟悉计算机体系结构,熟悉Linux下的开发流程
4、拥有坚实的数学基础,特别是线性代数
5、持续更新和学习新的技术
加分:
1、使用openaitriton的经验
2、在GPU、NPU上开发过高性能计算加速库经验
3…
招聘城市:北京,上海
…落地。
大模型推理方向:
1、参与/负责研发面向LLM/MLLM等模型的稳定、易用、性能领先的AI推理框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,支撑各业务方向持续降本增效;
3、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等。
高性能计算方向:
1、参与/负责AI推理/训练框架的底层性能优化工作,包括但不限于高性能算子、通信库开发与优化等工作;
2、参与/负责大模型计算引擎的研发工作,通过多种方式实现训推性能SOTA;
3、参与/负责前沿AI编译加速等技术的探索和业务落地。
大模型服务方向:
1、参与/负责大模型MaaS系统的架构设计、系统研发、产品…
招聘城市:北京,上海
…性能验证
• 作为工程Pipeline的上游起点,持续推进训练Infra的架构迭代方向
2.方向二:强化学习框架
• 构建并提升在线RL训练系统的性能和Scale能力,打通策略更新、环境交互、奖励建模的端到端训练流程
• 支持Chat/Thinking/Agentic以及未来多种RL范式(PPO/GRPO/DPO等),和算法Codesign推进RL架构迭代
• 设计高效的Actor-Critic架构、经验回放机制和分布式采样系统
• 负责RL训练的性能瓶颈分析和优化,包括GPU利用率提升、通信开销降低、训练稳定性保障
3.方向三:异构算力适配
• 建设迭代多种异构算力(GPU/NPU等)的验证和适配方案,包括稳定性保障、精度验证和高性能runtime
• 开发调优GPU和NPU架构的通信算子,推进超节点架构的最佳实践
•…
招聘城市:北京,上海
…高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架(Megatron-LM/DeepSpeed/veRL等);
加分项:
1、熟悉DP/TP/PP/ZeRO等分布式训练策略原理,有大模型训练调优分析经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等…
招聘城市:北京
…学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉CUDA编程,有TensorRT或其它AI加速库、高性能算子开发经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
3、了解并行计算、网络通信、系统优化和集群硬件架构等相关知识者优先;
4、熟悉NCCL/RDMA/IB/RoCE相关知识者优先;
5…
招聘城市:北京
…学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉CUDA编程,有TensorRT或其它AI加速库、高性能算子开发经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
3、了解并行计算、网络通信、系统优化和集群硬件架构等相关知识者优先;
4、熟悉NCCL/RDMA/IB/RoCE相关知识者优先;
5…
招聘城市:北京,上海
…高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉Python开发,熟悉 Linux/Git开发环境;
2、有较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步(⭐️有大牛带着成长)
2、熟悉至少一种主流基础深度学习训练框架(TensorFlow/PyTorch/PaddlePaddle等)的使用和实现;
3、了解主流LLM模型结构,使用过至少一种主流LLM训练框架(Megatron-LM/DeepSpeed/veRL等);
加分项:
1、熟悉DP/TP/PP/ZeRO等分布式训练策略原理,有大模型训练调优分析经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等…
招聘城市:北京,上海
…推理框架(Megatron-LM/DeepSpeed/vLLM/TensorRT-LLM等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉蒸馏、剪枝、量化等模型压缩方案,有大模型压缩或小型化经验、或有相关论文者优先;
2、熟悉CUDA编程,有TensorRT或其它AI加速库、高性能算子开发经验者优先;
3、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
4、熟悉DP/TP/PP/ZeRO等分布式训练策略原理,有大模型训练调优分析经验者优先;
5、了解并行计算、网络通信…
招聘城市:上海,北京,深圳
…我们诚挚邀请怀揣梦想、敢于创新的你加入我们,一起改变世界!
【关于NVIDIA】
1999 年,NVIDIA 发明了 GPU,定义了现代实时计算机图形。
今天,我们是 AI 和加速计算领域的全球领导者。我们正在从根本上改变计算的工作方式以及计算机的功能。
从 GPU 的诞生,到 CUDA 生态的建立,再到成为 AI 时代的算力基座,每一次跨越,都不是靠一个人完成的。它是一代又一代工程师共同推动的结果。
现在,轮到你了!
【面向人群】
2027届应届毕业生(本科/硕士/博士)
【工作地点】
北京/上海/深圳
【职位类型】
AI与高性能计算类:算子开发、并行计算、AI编译系统、大语言模型(LLM)推理优化、强化学习、深度学习
硬件类:芯片架构(GPU/视频编解码/安全计算/图像…
招聘城市:上海,北京,深圳
…负责推理框架与高性能算子的设计、开发、优化和测试;
2. 支持自动驾驶算法业务中各模型的端到端推理。
职位要求:
计算机基础扎实,熟练使用C/C++,具有较强的软件开发和架构能力;
熟悉一种或多种深度学习框架或AI编译框架(Caffe/PyTorch/TensorRT/TVM等)底层工作原理;
熟悉异构计算架构,具备良好的并行计算思维,有GPU、NPU、或其他AI芯片上应用开发与优化经验;
有足够的专业领域经验:
架构方向:有2年以上推理引擎框架开发经验,掌握计算图优化,算子融合,并行调度,内存复用等关键技术;
工具链方向:推理引擎相关,精度、速度,调优分析工具链的开发经验,debug工具、可视化工具开发经验。
3
【2026春招】训练优化工程师
职位…
招聘城市:北京,杭州
…的诞生。随着技术演进,我们正努力将所有部门的规模扩大至少一倍,空缺岗位如下:服务端开发工程师、预训练数据工程师、AI 搜索算法/架构工程师、Agent Harness 团队、Agent Infra 研究工程师、前端/客户端开发工程师、测试开发工程师、AI 跨界技术人才、超算集群研发工程师、高性能算子/通信/编辑器工程师、大模型训练/推理框架工程师、高性能分布式存储工程师、AI 算力集群性能与可靠性工程师、AI 平台运维工程师、IT 基础设施团队、IDC 数据中心团队、AI 产品经理、AI 产品运营(体验与服务方向)、Code Agent 数据工程师、通用 Agent 数据产品经理(办公/生活/搜索)、专业领域数据产品经理(小语种、医学法律等学科)、AI 创作数据产品经理、情感…
招聘城市:深圳
…和项目管理能力。
5
网络与机器智能研究中心
算子工程师
1
1、核心算子开发与优化:负责大模型(涵盖不同架构与规模)中关键计算算子(如Attention、Linear、LayerNorm等)在昇腾910B、V100等异构计算平台上的高性能实现、定制化优化与持续迭代。
2、模型部署与性能调优:主导将多个国产及开源大模型高效部署到目标硬件平台,进行端到端的性能剖析、瓶颈定位与系统级优化,确保模型在训练与推理场景下的最佳性能表现。
3、应用系统底层支撑:为上层AI应用系统(如RAG、智能体、图像/视频智能处理、智能客服、文档智能分析等)提供稳定、高效的底层算子与计算内核支持,解决其在规模化应用中遇到的计算性能挑战。…
招聘城市:北京
…软件工程、物理、数学等专业
?
五、应聘流程
投递简历→简历初筛 (1日内极速反馈) →技术面试→offer→签约+入职倒计时!?
六、加入我们
渠道一:recruiting@
渠道二:13784224335(微信同号|简历直达)
七、公司地址
北京市海淀区 中关村大街1号海龙大厦
杭州市西湖区 文三路90号东部软件园创新大厦
上海市徐汇区 云锦路700号西岸智塔西塔
?
你的代码,定义中国AI算力新高度!
单位简介:
一、公司简介
中科加禾孵化于中国科学院计算技术研究所。公司聚焦AIInfra领域,着力打造通用化、低成本、高性能的基础软件工具链,加速人工智能应用落地
专注国产智算芯片应用于AI的适配和优化,突破算力卡脖子难题
推动大…
招聘城市:北京
…电子信息、电子科学与技术、通信与信息、软件工程、物理、数学等专业
五、应聘流程
投递简历 简历初筛(1日内极速反馈) 技术面试 offer 签约+入职倒计时!
六、加入我们
渠道一:recruiting@
渠道二:13784224335(微信同号|简历直达)
七、公司地址
北京市海淀区 中关村大街1号海龙大厦
杭州市西湖区 文三路90号东部软件园创新大厦
上海市徐汇区 云锦路700号西岸智塔西塔
附件: 中科加禾全球校园招聘.pdf
单位简介
我们是谁ABOUT US
中科加禾-着力打造通用化、低成本、高性能的基础软件工具链,发挥编译技术优势,为用户提供AI应用跨多种CPU、GPU、NPU执行的统一软件平台
我们优势OUR ADVANTAGES
核心团队: 毕业于清华大学、中国科学…
招聘城市:上海
NPU算子开发工程师 25万元/年
2025-12-16 16:33:37发布
职位要求:
职位性质:全职
工作城市:上海市闵行区
招聘人数:3
学历要求:本科
职位类别:其他专业技术人员
语言能力:不限
需求专业:电子信息类,集成电路类,计算机类,通信类
职位描述:
岗位职责
1、负责算子开发与优化;
2、框架适配与集成。
任职资格
1、计算机科学与技术、自动化、人工智能等相关专业,本科以上学历;
2、有NPU/GPU加速器开发经验,熟悉CUDA/OpenCL/CANN者优先;
3、精通C/C++/汇编语言,熟悉PyTorch、Tensorflow、ONNX等主流框架和自定义算子开发,熟悉并理解Transformer架构原理;
4、理解AI芯片的基本架构(如SIMD处理单元、L1/L2/DDR memory层级、DMA工作机制),熟悉张量运算、数据编排;
5…