牛大妈在校招职位搜索性能优化 有 1000+ 条结果

小红书 媒体性能优化实习生

兼职 北京,上海
招聘城市:北京,上海
…音视频和图像处理算法在服务端和客户端的工程优化与业务落地。通过软硬一体优化,提升算法性能,降低计算成本或功耗,实现媒体算法在服务端和客户端的业务落地。
任职要求:
任职要求:
1、计算机相关专业,对性能优化工作感兴趣;
2、有扎实的编程基础知识,了解常见数据结构与算法;
3、熟悉C++/python编程,有Linux/Andorid/IOS中至少一种系统平台的开发;
4、熟悉X86/ARM平台的SIMD指令集,有CUDA/OpenGL/Vulkan/Metal加速经验优先;
5工作认真负责,有钻研和主动学习的精神,善于团队沟通与协作。
加分项:
* 有中大型项目的性能优化实战经验;
* 有AI算法优化经验。
我们能为你提供:
* 参与一线互联网产品性能优化的实践机会…
招聘城市:北京
…为可服用的工具链或者平台,支持算法和业务自动化、高效的完成模型优化
4. 持续调研业界前沿的多模态模型推理性能优化技术,编写清晰的技术文档,分享优化经验,支持团队技术能力的提升。
任职要求:
1. 计算机相关专业本科及以上学历,有相关项目经验。
2. 熟悉LLM, Diffusion等相关模型结构和推理流程,熟悉GPU、NPU、分布式相关硬件原理。
3. 具备良好的编程能力,熟练掌握Python/C++,有优秀的代码规范意识。
4. 熟悉深度学习框架(如Pytorch, TensorRT/OnnxRuntime、VLLM/SGLang)或多模态模型工具链(如Diffusers)。
5. 熟悉模型量化、剪枝、知识蒸馏、模型并行等优化技术,具备相关实践经验。
6. 具备良好的问题分析和解决能力,能够快速定位和解决模型性能问题。
岗位亮点…
招聘城市:北京,上海
…为可服用的工具链或者平台,支持算法和业务自动化、高效的完成模型优化
4. 持续调研业界前沿的多模态模型推理性能优化技术,编写清晰的技术文档,分享优化经验,支持团队技术能力的提升。
任职要求:
1. 计算机相关专业本科及以上学历,有相关项目经验。
2. 熟悉LLM, Diffusion等相关模型结构和推理流程,熟悉GPU、NPU、分布式相关硬件原理。
3. 具备良好的编程能力,熟练掌握Python/C++,有优秀的代码规范意识。
4. 熟悉深度学习框架(如Pytorch, TensorRT/OnnxRuntime、VLLM/SGLang)或多模态模型工具链(如Diffusers)。
5. 熟悉模型量化、剪枝、知识蒸馏、模型并行等优化技术,具备相关实践经验。
6. 具备良好的问题分析和解决能力,能够快速定位和解决模型性能问题。
岗位亮点…
招聘城市:上海,杭州
…转换、验证和部署
分析并优化模型推理的吞吐、延迟与显存占用
任职要求:
我们希望你:
有过互联网企业实习经验,每周到岗 4-5 个工作日,实习 6 个月以上者优先,27年及以后毕业
1、大学本科或以上学历,计算机相关专业
2、熟练使用 Python,熟悉 PyTorch 深度学习框架
3、熟悉常见深度学习模型结构
4、熟悉GPU 基本原理,有 CUDA、Triton Kernel 开发或优化经验者优先,有使用 profiler(如 Nsight Systems、 Nsight C、PyTorch profiler 等)进行性能分析优化的经验优先
5、有以下其一或多项经验者优先
使用过 vLLM/SGLang/Tensorrt-LLM或其他大模型推理框架,并熟悉底层原理
熟悉TensorRT/ONNX Runtime等模型部署或加速,熟悉模型量化压缩、编译优化优化手段
6…
招聘城市:广州
人工智能研发工程师(大模型优化
不限
硕士研究生,本科生
1年以下
1万元以上
职位诱惑:五险一金,年终奖,双休,有年假
职位描述
Description
岗位价值:
深度参与大模型推理性能优化工作,推动AI产品算力和大模型解决方案的最佳落地,成为连接前沿AI技术与业务场景的关键力量。
您将负责:
-?分析大模型推理业务场景(如LLM、VLM等),设计高性能、低成本的模型构建方案并推动工程实现;
-?优化开源大模型(如DeepSeek、Llama、Qwen等),研究vLLM、SGLang等框架技术实现高效的加速推进系统;
-?对接融合算子与优化算子,保障功能完整与性能领先。
我们期待您:
-?研究生学历,计算机、人工智能相关专业;
-?熟练掌握C++/Python及Linux开发,熟悉PyTorch及…

北京千曙科技有限公司 模型优化工程师

全职 北京,广州
招聘城市:北京,广州
…文档,参与性能数据分析与汇报
任职要求
本科或硕士应届毕业生,计算机/电子/自动化/数学等相关专业
扎实的深度学习基础,熟悉 Transformer/CNN 等主流模型架构
熟练使用 PyTorch 或 TensorFlow,有模型训练与调试经验
了解模型推理部署的基本流程(ONNX 导出、推理引擎使用等)
了解混合精度训练(FP16/BF16)的基本概念
具备 Python 编程能力,了解 C/C++ 者优先
学习能力强,对性能优化与系统底层有浓厚兴趣
加分项
有 TensorRT、TVM、ONNX Runtime 等推理引擎使用经验
了解 CUDA 编程基础与 GPU 架构基本概念
有使用 Nsight、nvprof、torch.profiler 等性能分析工具的经验
有量化/剪枝/蒸馏等模型压缩的实践经验(课程项目或论文均可)
有相关竞赛(如 MLPerf、模型推理优化赛等)参赛…
招聘城市:北京,上海
…人工智能、移动计算相关专业。
2.论文要求:
在 AI系统/移动计算/模型压缩 相关会议或期刊发表或投稿论文(MLSys/EuroSys/MobiSys/MobiCom/CVPR/ICCV等),或有相关研究经历。
或在 On-device AI/Model Compression/Efficient Inference 方向有深入研究(需提供技术报告或开源项目)。
3.熟悉至少一种移动端开发技术栈(Android/iOS/Flutter/React Native),有端侧性能优化经验。
4.了解深度学习推理框架(TensorFlow Lite/ONNX Runtime/MNN/NCNN/Core ML等),有模型部署实践。
5.熟悉Python/C++/Java/Kotlin/Swift任一语言,有系统编程或性能调优经验者优先。
6.加分项:参与过端侧AI开源项目(如llama.cpp/MLC-LLM/web-llm);有GPU/NPU异构计算经验;了解WebAssembly/WebGPU。
【实习收获】
掌握端侧大模型从研究到…
招聘城市:北京,上海
岗位职责:
本课题聚焦 Diffusion/Autoregressive 范式下 LLM 的极致性能优化与 SLO 低时延推理,面向大模型在线服务中 TTFT、TPOT、P99 时延与吞吐成本 难以兼顾的问题,结合最新 AI Infra SOTA 展开系统研究。自回归模型虽具备成熟生态,但受限于逐 token 串行生成;Diffusion Language Model 则具备并行去噪与迭代 refinement 潜力,有望突破解码瓶颈。
课题拟结合 vLLM/PagedAttention、FlashAttention、TensorRT-LLM、Speculative Decoding、Medusa、EAGLE、SGLang 等代表性工作,从 KV Cache 管理、连续批处理、动态调度、算子融合、并行解码、低比特量化与软硬件协同优化 等方向,构建统一的跨范式推理优化框架。
研究目标是在保证生成质量前提下,实现满足不同 SLO 的低时延、高吞吐与低成本推理,为大模型在智能问答、代码生成…
招聘城市:北京
…极致优化,持续提升系统的吞吐量、降低延迟;
4、生态合作与协同:作为技术接口人,与国产芯片原厂技术支持团队紧密合作,高效推进芯片驱动、基础软件栈的引入、问题排查与版本迭代,确保技术路线顺畅推进。
任职要求:
任职资格:
1、熟练掌握 C++/Python 编程,具备扎实的计算机体系结构、数据结构和算法基础,具备良好的编程习惯;
2、有至少一款非Nvidia GPU的异构计算芯片适配大模型训练、推理框架的相关经验,包括但不限于AI框架适配、模型移植、性能优化或算子开发;
3、熟悉至少一种主流的机器学习框架(PyTorch/PaddlePaddle/TensorFlow等),对框架内部实现有一定了解;
4、具备大型深度学习模型(尤其是大语言模型LLM或多模态模型)的训练或推理优化实践…
招聘城市:北京
…优异的性能表现、灵活的基础能力等特点
人才背景: 人员团队博士占比约20%,硕士占比约60%,来自于国内外重点高校,曾就职于华为、浪潮、阿里、百度、GPU芯片等知名企业
团队氛围: 扁平管理、开放包容、充满活力、创新驱动
晋升体系: 导师带教,助力成长,实现快速晋升
薪酬福利:薪资高于业界同行!15薪及以上!入职即缴六险一金 另有发明专利 享各地区人才政策补贴 年度体检 超长带薪年假 零食饮品 节日礼品等超赞福利
三、热招岗位
AI 框架及算法优化
职责: AI模型优化
要求: 了解算法,了解PyTorch等AI框架,有大模型训练实习经验者优先
AI 编译器开发工程师
职责: 编译器产品设计与开发
要求: 了解芯片编译…
招聘城市:北京,上海
…完成高性能工程落地,深入框架层开展算子融合、内存/通信优化、流水编排等系统级性能调优。
3、探索基于大模型的高性能 Kernel 自动合成技术,参考 LLM-driven Kernel Generation 范式,研究高效 GPU/NPU Kernel 的端到端自动生成与迭代优化方法。
4、基于DSL(如 Triton、TVM TIR、Halide 等)的编译优化与自动调优技术研究。
5、多硬件后端(NVIDIA/国产芯片)的统一算子库建设与迁移适配。
任职要求:
1、GPU编程:写过CUDA kernel,理解warp/SM/显存层次结构;
2、训练框架:用过或改过Megatron/DeepSpeed/FSDP,不只是跑过demo;
3、通信系统:了解NCCL原理,或有网络协议栈/RDMA相关经验;
4、编译优化:接触过 XLA/TorchInductor/TVM 等编译器,或做过IR优化
5…

小红书 服务器测试实习生

兼职 杭州
招聘城市:杭州
岗位职责:
1. 参与GPU硬件基准性能、通用CNN/RNN模型推理性能、LLM大语言模型推理性能的测试与优化工作。
2. 参与Deep Learning模型训练性能的测试与优化工作。
3. 参与将GPU性能测试SOP转化为脚本实现工作。
4. 跟踪业界前沿技术(如大模型、多模态、强化学习等),探索其在业务中的应用可能性。
任职要求:
1、教育背景:计算机、数学、统计学或相关专业硕士及以上在读,扎实的算法与数据结构基础。
2、技术能力:
- 熟悉机器学习/深度学习经典模型(如CNN、RNN、Transformer等),有TensorFlow/PyTorch等框架实战经验。
- 掌握模型性能优化方法(如量化、剪枝、蒸馏、ONNX转换等),能独立完成训练/推理链路压测与分析。
3、编程能力:熟练使用Python,或熟悉C++/Java,会…
招聘城市:北京
…Pony.ai、泛亚等自动驾驶行业头部公司,自动驾驶技术团队博士占比高达30%,依靠视觉、激光等传感器,实时感知预测周围环境,通过高精地图定位和智能决策规划,保证自动配送车全场景即时配送能力。自2020年起,自动配送车已在北京、深圳等多地进入常态化试运营阶段,运营车辆超500台,日均运营超16小时,截止2022年6月,已经累计配送近220万单。
欢迎加入美团无人车团队,与我们一起用科技推动即时零售再升级!
岗位职责:
1. 负责自动驾驶模型在嵌入式平台上的部署与性能优化
2. 设计并实现模型量化、剪枝、蒸馏等轻量化技术方案。
3. 协同算法团队完成模型训练到部署的全流程闭环。
4…
招聘城市:深圳
…图谱、图数据库或向量检索系统开发经验,至少1年基于LLM的知识工程或RAG系统开发经验
2.精通知识图谱全栈技术,熟悉LLM和信息抽取、知识融合、存储查询等完整流程,至少精通一种主流图数据库(Neo4j/NebulaGraph/TigerGraph等)
3.向量检索系统经验:有Milvus/Weaviate/Qdrant等向量数据库实战经验
4.精通Python和C,熟悉Java/Scala,熟悉PyTorch/TensorFlow框架
5.具备大规模数据处理系统设计经验,熟悉微服务架构、容器化部署、服务治理等云原生技术,有系统性能优化经验,能够解决高并发场景下的性能瓶颈
6.加分项:有数据库开发优化经验;有亿级实体规模知识图谱项目经验;有开源项目贡献经验;在相关领域顶会有论文发表(如KDD、WWW…
招聘城市:上海,北京
岗位介绍:
职位描述
工作职责:
1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率;
2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;
3、持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)。
工作要求:
1、本科及以上学历,计算机相关专业;
2、熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础;
3、深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
4、熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率;
2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;
工作要求:
1、本科及以上学历,计算机相关专业;
2、熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础;
3、了解自然语言处理、计算机视觉或多模态算法,了解主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
4、了解常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),了解异步强化学习范式;
5、有相关领域开源项目贡献经验者优先;
6、具备大规模训练实操…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1、参与强化学习训练框架的研发与性能优化,根据业务需求持续演进训练策略与系统能力,提升大规模模型训练效率;
2、深度分析与定位训练系统中的性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性;
3、持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)。
工作要求:
1、本科及以上学历,计算机相关专业;
2、熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础;
3、深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构;
4、熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉…

小红书 IOS开发实习生-发布工程

兼职 北京,广州
招聘城市:北京,广州
岗位职责:
工作职责:
1)负责小红书产品的 iOS 客户端创作相关业务开发
2)参与 App 性能、稳定性等方面的改进与优化
任职要求:
任职资格:
1)具备大学本科及以上学历,计算机相关专业
2)熟悉并掌握 iOS 相关开发语言以及技术栈。例如 Swift、Cocoapods 等。
3)对数据结构、计算机网络、数据库、操作系统等课程掌握良好
4)重视用户体验,有技术热情和好奇心
加分项:
大厂实习经历、个人开源项目、个人博客
性能优化、稳定性、架构、编程语言等任一方面有兴趣和研究
了解音视频、相机基本知识
关注 WWDC 的新技术
招聘城市:北京,上海
…RL采样场景,深入优化NPU架构的推理性能
• 跟踪硬件生态发展,评估新硬件的技术价值,输出选型建议和规模化落地方案
4.方向四:高性能内核
• 定制开发高性能计算内核,深入发掘GPU/NPU等不同硬件架构的优化空间
• 推进算子开发范式的迭代,探索自动化算子生成(如LLM辅助生成高性能kernel)
任职要求:
1.计算机、电子工程、数学等相关专业硕士及以上学历
2.有一定大模型训练/推理/分布式系统相关开发经验
3.熟悉PyTorch/Megatron-LM/DeepSpeed等主流框架中至少一个的内部实现
4.熟悉至少一种分布式并行策略(DP/TP/PP/SP/EP)的原理和实现细节,或有高性能算子开发经验
5.扎实的C++/Python/CUDA编程能力,有性能优化经验
6…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
- 参与漫画后端系统的设计、开发和优化,保障系统的稳定性和高效性。
- 协助团队进行项目的需求分析、架构设计、功能实现和性能优化
- 参与AIGC工具的开发和建设
工作要求:
- 计算机相关专业毕业,具备扎实的计算机基础,掌握常见数据结构和算法。
- 有互联网公司实习经验者优先,能快速适应开发环境和团队合作。
- 良好的沟通能力和团队协作精神,富有责任心,能够独立完成任务并在压力下工作。
- 对后端开发充满热情,愿意不断学习、成长并挑战技术难题。
【加分项】
- 熟悉MySQL、Redis、Kafka等常用数据库及中间件。
- 了解网络安全,逆向等技术。
- 有开源项目或个人项目经验。
投递简历