牛大妈在校招职位搜索CUDA编程 有 82 条结果

招聘城市:北京,上海
岗位职责:
1.负责LLM大语言模型的推理优化;
2.负责机器学习引擎的编译优化工作;
3.负责模型稀疏化和模型量化工作。
任职要求:
1.熟练掌握CUDA编程、C++编程,数据结构和算法知识;
2.熟悉TVM或TensorRT或FastTransformer等推理优化框架;
3.熟悉LLM大模型相关背景知识,有相关方向的研究经验和产出。
岗位亮点
1.紧跟人工智能行业进展,接触到前沿技术和行业趋势,磨练出对人工智能的独到见解;
2.参与AI大模型的数据、训练与评测的全流程,了解从理论到工程实践的全面技能;
3.有机会参与公司的创新项目,跨足不同领域,拓宽人工智能技术的应用范围。
招聘城市:北京
岗位职责:
1.负责LLM大语言模型的推理优化;
2.负责机器学习引擎的编译优化工作;
3.负责模型稀疏化和模型量化工作。
任职要求:
1.熟练掌握CUDA编程、C++编程,数据结构和算法知识;
2.熟悉TVM或TensorRT或FastTransformer等推理优化框架;
3.熟悉LLM大模型相关背景知识,有相关方向的研究经验和产出。
岗位亮点
1.紧跟人工智能行业进展,接触到前沿技术和行业趋势,磨练出对人工智能的独到见解;
2.参与AI大模型的数据、训练与评测的全流程,了解从理论到工程实践的全面技能;
3.有机会参与公司的创新项目,跨足不同领域,拓宽人工智能技术的应用范围。
招聘城市:北京
岗位介绍:
职位描述
工作职责:
• 参与大模型训练/推理流水线性能分析与优化
• 对数据预处理、推理、后处理环节做 Profiling,消除瓶颈
• 设计 GPU 加速方案:CUDA Kernel 优化、算子融合、混合精度
• 优化数据加载链路(I/O、解码、预处理),减少 GPU 空闲
• 探索编译优化(torch.compile / TensorRT / Triton)落地
工作要求:
• CS/EE/数学相关专业在读;
• 熟悉 Python + PyTorch/JAX
• 了解 GPU 计算原理,有 CUDA 编程经验优先
• 有性能分析工具经验(Nsight/PyTorch Profiler)优先
• 有 C/C++ 基础,能读底层框架源码
• 熟悉 vLLM/TGI/TensorRT-LLM 加分
• 有 Triton(OpenAI)编程经验加分
网申须知
网申开始日期:2026-03-05 00:00
网申截止日期:2026-06-01 00:00
仅限 2026-09 至 2027-08 毕业的大学生,快来投递吧~
投递简历

小红书 AI推理工程实习生

兼职 北京
招聘城市:北京
岗位职责:
1. 参与对深度学习模型进行模型剪枝、蒸馏、量化等相关压缩技术的研究与落地;
2. 参与研发深度学习模型推理服务框架,实现推理服务高吞吐、低延迟、高可用;
3. 参与不同NPU/GPU上高性能训练/推理算子研发,实现训练/推理计算加速。
任职要求:
- 优秀的代码能力,扎实的数据结构和基础算法功底;
- 熟悉至少一种主流的机器学习框架(Tensorflow/Pytorch);
- 熟悉c++/cuda编程
- 对模型压缩领域技术有一定基础。

小红书 大模型推理工程实习生

兼职 北京
招聘城市:北京
岗位职责:
1. 参与对深度学习模型进行模型剪枝、蒸馏、量化等相关压缩技术的研究与落地;
2. 参与研发深度学习模型推理服务框架,实现推理服务高吞吐、低延迟、高可用;
3. 参与不同NPU/GPU上高性能训练/推理算子研发,实现训练/推理计算加速。
任职要求:
- 优秀的代码能力,扎实的数据结构和基础算法功底;
- 熟悉至少一种主流的机器学习框架(Tensorflow/Pytorch);
- 熟悉c++/cuda编程
- 对模型压缩领域技术有一定基础。
招聘城市:北京,上海
…的端到端的机器学习服务体验,为公司提供核心技术能力和服务。
1、负责机器学习框架的研究与开发,服务于公司各个产品;
2、高效部署,优化NLP/多模态大模型核心业务模型。
任职要求:
1、本科及以上学历,计算机等相关专业方向优先;
2、熟练掌握GPU CUDA编程
3、熟练掌握Megatron/DeepSpeed/FSDP等框架的研发,熟练掌握模型并行分布式技术;
4、对大语言模型算法感兴趣,有机器学习算法知识背景;
5、追求技术极致,务实,渴望有自己的作品和代表作。
【加分项】
1、对于算子优化(CUDA or Triton)、通信优化有深入钻研者;
2、对芯片体系结构和指令执行pipeline有深刻认知者;
3、MLSys方向的知名开源项目贡献者;
4、ACM等编程竞赛获奖者。
招聘城市:北京,上海
…推理系统优化、模型量化压缩和模型部署;
2.负责开发和维护基于大规模数据的推理引擎;
3.参与解决推理过程中的技术难题,提升推理算法的性能和效果;
4.开展相关领域的技术研究,提出创新性的解决方案。
任职要求:
1.大学本科及以上学历,计算机相关专业优先;
2.有软件开发经验,有推理引擎开发经验者优先考虑;
3. 熟练掌握C++、CUDA编程,熟悉常见的数据结构和算法;
4. 熟悉机器学习和深度学习理论,具备扎实的编程能力,熟悉Transformer结构优化者优先;
5. 熟悉常用的深度学习框架,如TensorFlow、PyTorch等,熟悉以下推理框架者优先sglang/vllm、FasterTransformer、DeepSpeed FastGen、TensorRT-LLM等;
6. 具备良好的团队合作精神和沟通能力,能够承担一定的工程管理职责。
招聘城市:上海
…侧工作,包括模型训练、参数服务器、特征样本流水线等,通过引擎能力的持续建设结合多元异构算力为业务提供高效、灵活、稳定的搜广推模型服务。
你将专注于大规模AI训练系统最核心的性能优化赛道,直面千亿参数模型训练中的效率瓶颈,解决工业级AI系统在性能与规模上面临的真实挑战。
【岗位职责】
1、深入参与GPU异构计算栈的研发与调优,从算子、内存、通信多维度挖掘硬件极限性能;通过CUDA编程、内核融合、混合精度训练、通信与计算重叠等高级优化技术,不断提升训练引擎效率。
2、推动自动化扩展、智能资源调度、跨架构设备兼容(NV GPU、GPGPU、XPU等)、AI系统可观测性等先进技术在公司模型训练平台落地…
招聘城市:上海
…闵行区
招聘人数:5
学历要求:本科
职位类别:工程技术人员
语言能力:不限
需求专业:电子信息类,集成电路类,计算机类,通信类
职位描述:
岗位职责
主要职责:
1、熟悉公司自研芯片架构。
2、开发、验证MLIR算子,提升执行效率和减少运算资源消耗。
3、撰写技术文档和操作指南,帮助其他开发者理解和利用新开发的算子。
任职资格
要求:
1、了解CUDA编程和GPU架构,熟悉C++和python
2、熟悉至少一种主流的深度学习架构,如pytorch、tensorflow
3、熟悉计算机体系结构,熟悉Linux下的开发流程
4、拥有坚实的数学基础,特别是线性代数
5、持续更新和学习新的技术
加分:
1、使用openaitriton的经验
2、在GPU、NPU上开发过高性能计算加速库经验
3…
招聘城市:北京
大模型推理引擎研发工程师
更新时间:2026-03-06
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
1.负责LLM大语言模型的推理优化;
2.负责机器学习引擎的编译优化工作;
3.负责模型稀疏化和模型量化工作。
岗位基本要求
1.熟练掌握CUDA编程、C++编程,数据结构和算法知识;
2.熟悉TVM或TensorRT或FastTransformer等推理优化框架;
3.熟悉LLM大模型相关背景知识,有相关方向的研究经验和产出。
岗位亮点
1.紧跟人工智能行业进展,接触到前沿技术和行业趋势,磨练出对人工智能的独到见解;
2.参与AI大模型的数据、训练与评测的全流程,了解从理论到工程实践的全面技能;
3.有机会参与公司的创新项目,跨足…
招聘城市:北京,上海
岗位职责:
简介:多模态训练pretrain和posttrain的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、超长序列的高效pretrain训练方案。
2、基于投机采样的方式加速多模态RL的训练效率。
3、针对compute use场景的大规模agentic RL 高效训练方案探索。
任职要求:
1、精通 C++/Python,熟悉 CUDA 编程、NCCL 通信库或 RDMA 网络优化;
2、具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心;
3、至少深入研读过 Megatron-LM, vLLM, Sglang, VERL 其中之一的源码,并有过定制化修改或性能调优经历。
加分项目:
1、有很强的学术研究能力和优秀的学术成果(AI领域顶会/顶刊论文);
2、熟悉…
招聘城市:北京,上海
岗位职责:
简介:打造 world class,production ready 的大模型推理引擎,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、异构硬件高性能推理算子研究与开发。
2、Model System Co -design,充分利用硬件特性。
3、Scale up & scale out 分布式推理系统设计,高效可靠的推理调度体系。
4、投机推理算法研究与落地。
5、模型/KVCache 量化算法研究与算子开发。
任职要求:
1、具有扎实的编程功底,熟悉 C++/CUDA 编程最佳;
2、深入理解 Transformer/MoE/Attention 等 LLM 概念;
3、熟悉 RDMA,PD 分离等技术;
4、有一手的开源推理引擎使用/开发/调优经验最佳。

NVIDIA英伟达 26届秋招

全职 上海,北京
招聘城市:上海,北京
…或智能代理框架(例如 LangChain、LangGraph、AutoGen、OpenAI 函数、RAG、向量数据库、及时工程)的经验
应届生与实习生招聘岗位
岗位申请通过以下邮箱投递: [email protected]
以下 应届生与实习生招聘 岗位工作地点为: 北京或上海
JR2007916
Deep Learning Performance Architect - New College Grad 2026
JR2006158
Deep Learning Performance Architect - Intern - 2026
 Deep Learning Performance Architect 
深入理解软硬件性能分析方法,并有优化性能经验
熟悉并行编程模型或 CUDA
了解常用 AI 编译技术(例如 OpenAI Triton、MLIR、TVM 等)
熟悉主流 LLM 框架(vLLM、SGLang、 TensorRT-LLM )
JR2007090
Deep Learning Performance Architect - New College Grad 2026
JR2006236
Computer Architecture Intern - LLM, 2026 
JR2006158
Deep Learning Performance Architect - Intern - 2026
JR2006721
Computer Architecture Intern – 2026
 Deep Learning Performance Architect 
扎实的计算机系统知识背景,以及数理逻辑…
招聘城市:上海
…机械工程及自动化、信息工程以及电气工程等相关专业;
2.编程能力:熟练掌握Python和Pytorch或其他AI领域常用的编程语言,熟练掌握数据结构与算法相关知识;
3.思维能力:具有创新思维和数学建模能力,注重问题和算法的细节;
4.沟通能力:能清晰地向不同背景的人讲述复杂的技术概念;
5.学习能力:能快速掌握新知识,能快速阅读文献;
6.合作意识:能和团队融洽相处,有高度的责任意识。
【加分项】
1.有良好的数学基础,尤其是组合优化、计算几何、概率统计、线性代数、数值计算方法等;
2.对AI4CO、生成模型/AIGC、强化学习其中之一有较深入的理解;
3.熟悉CUDA编程
福利待遇
【薪酬福利】
校招岗位薪酬区间:
① 产品、研发岗位年薪19…
招聘城市:北京,上海
…学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM训练或推理框架(Megatron-LM/DeepSpeed/vLLM/TensorRT-LLM等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉蒸馏、剪枝、量化等模型压缩方案,有大模型压缩或小型化经验、或有相关论文者优先;
2、熟悉CUDA编程,有TensorRT或其它AI加速库、高性能算子开发经验者优先;
3、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
4…
招聘城市:北京
…数据结构和基础算法功底,熟悉C++/Python开发,熟悉 Linux/Git 开发环境;
2、熟悉至少一种主流基础深度学习训练或推理框架(TensorFlow/PyTorch/PaddlePaddle/TensorRT等)的使用和实现;
3、熟悉主流LLM模型结构,熟悉至少一种主流LLM推理框架(vLLM/SGLang/TensorRT-LLM等)的使用和实现;
4、熟悉GPU硬件架构,了解GPU 软件栈(CUDA,cuDNN),具备 GPU 性能分析的能力;
5、有强烈的工作责任心,较好的学习能力、沟通协作能力和自驱力,能和团队一起探索新技术,推进技术进步。
加分项:
1、熟悉CUDA编程,有TensorRT或其它AI加速库、高性能算子开发经验者优先;
2、熟悉至少一种AI编译加速组件者优先,包含但不限与TorchInductor/TVM/Triton/XLA等;
3、了解并行计算、网络通信…
招聘城市:北京,深圳
…DriveDreamer、Sora等,有场景级生成模型训练经验;
c.生成式AI:熟悉Diffusion Model、ControlNet、3D生成等,有可控生成与场景编辑经验;
d.熟练使用AI工具提升研发效率:能将AI编程助手、大语言模型等工具融入日常开发与研究流程,具备AI辅助编程、方案设计、文献调研的实践经验;
加分项:
1.顶会论文(CVPR/ECCV/ICCV/NeurIPS/SIGGRAPH等);
2.城市级户外场景重建工程落地经验;
3.无人机系统或自动驾驶仿真平台经验;
4.CUDA编程、GPU渲染优化经验;
5.对技术有热情,具备快速学习能力和较强自驱力,善于将前沿技术转化为实际产品。
【岗位吸引力】
1 .技术前沿,行业稀缺:你将站在3DGS、世界模型、生成式AI与低空经济的交叉前沿,这…
招聘城市:上海
…、增量更新及高频检索的技术瓶颈,优化GPU显存管理与Host-Device数据搬运效率;
4. GPU异构计算与Scaling:优化GPU多卡/多机训练与推理的横向扩展性,结合CUDA Kernel优化、TensorRT部署及编译优化技术,支撑超长用户行为序列(10K+)建模与模型参数持续Scaling Up;
5. 下一代智能分发系统:参与构建面向大模型时代的智能内容分发架构,探索LLM与搜推系统的融合,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎。
工作要求:
1. 计算机相关专业,具备扎实的C++/Python编程功底,熟悉Linux开发环境;
2. 有GPU异构计算实践经验,熟悉CUDA编程、TensorRT部署或编译优化技术(TVM/XLA/算子融合)在模型推理加速中的应用;
3. 有搜推模型…
招聘城市:北京,上海
…评估新硬件的技术价值,输出选型建议和规模化落地方案
4.方向四:高性能内核
• 定制开发高性能计算内核,深入发掘GPU/NPU等不同硬件架构的优化空间
• 推进算子开发范式的迭代,探索自动化算子生成(如LLM辅助生成高性能kernel)
任职要求:
1.计算机、电子工程、数学等相关专业硕士及以上学历
2.有一定大模型训练/推理/分布式系统相关开发经验
3.熟悉PyTorch/Megatron-LM/DeepSpeed等主流框架中至少一个的内部实现
4.熟悉至少一种分布式并行策略(DP/TP/PP/SP/EP)的原理和实现细节,或有高性能算子开发经验
5.扎实的C++/Python/CUDA编程能力,有性能优化经验
6.有实际参与过10B+参数规模模型训练的项目经验优先
招聘城市:上海

6.编写高质量技术文档,参与技术分享与代码评审。
任职资格
1.硕士及以上学历,计算机、软件工程、人工智能、电子工程等相关专业; 有相关论文或项目经验者优先。
2.熟悉C++/Python编程,具备良好的编码习惯与工程能力;
3.熟悉Linux开发环境,有Git、CMake、Docker等工具使用经验。
4.熟悉深度学习框架(PyTorch/TensorFlow等)及大模型结构(Transformer等);
5.熟悉GPU/CUDA编程、高性能计算或模型优化者优先;
6.了解推理框架(如vLLM、SGLang、DeepSpeed等)者优先。
薪资福利
六险一金、年底双薪
联系方式:
联系人:潘**
简历接收邮箱:l********@
公司介绍:
昕原半导体(上海)有限公司成立于2019年,专注于ReRAM新型存储技术及相关芯片产品的研发,涵盖AI存算一体…