牛大妈在校招职位搜索AI Infra 推理系统工程师 有 49 条结果

美团(meituan) AI Infra / 推理系统工程

全职 北京,上海
招聘城市:北京,上海
…训练、推理、部署、调度、监控等基础设施建设。
2. 优化模型推理性能、资源利用率、服务稳定性和成本效率。
3. 参与GPU/NPU资源管理、分布式任务调度、模型服务化、缓存和并发优化。
4. 支撑大模型应用、Agent平台、训练平台和评测平台的基础能力。
5. 跟踪推理框架、训练框架、云原生和高性能计算方向的技术演进。
任职要求:
岗位要求
1. 本科及以上学历,计算机、软件工程、人工智能、自动化、电子信息等相关专业。
2. 编程基础扎实,熟悉 C++、Python、Go、Rust 、Java中至少一门语言。
3. 理解操作系统、计算机网络、分布式系统、数据库等基础知识。
4. 对性能优化、系统稳定性、云原生、GPU计算或大模型部署有兴趣。
5. 具备较强的问题定位和工程实现能力…
招聘城市:北京
【北斗】大模型推理系统工程
更新时间:2026-06-11
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
【愿景】
美团龙猫基座大模型,不只聪明,更懂生活。从语言理解到全模态感知,从架构创新到极致推理,从海量预训练到亿级真实订单 —— 我们造的不仅是实验室里的“优等生”,更是活在大街小巷、三餐四季里的AI。 而我们想做的远不止于此 —— 让模型自己提出假设、训练自己、不断进化; 让一群智能体像团队一样分工协作、攻克复杂问题; 让 AI 走出屏幕,理解物理世界、走进真实场景。 这是我们正在冲刺的方向,也是你可以参与定义的未来。 加入我们,一起把智能带进真实物理世界,亲手打造…
招聘城市:北京,上海

【团队介绍】
基座大模型AI Infra团队,以支撑前沿基础模型持续演进为目标,面向大模型研发与生产全链路,构建高性能、高稳定性、可持续扩展的AI基础设施体系。围绕高效率实验平台、大规模训练生产能力,以及模型结构与芯片架构协同优化, 沉淀软硬一体、训推贯通的关键基础能力,提升模型迭代效率、训练资源利用率与系统上限。
【你将负责】
模型推理是大模型应用的核心能力,是影响大模型应用成本和效率的关键因素。本课题专注于大模型推理加速与分布式系统优化的前沿技术探索,通过软硬件协同设计和算法工程联合优化,降低大模型推理的应用成本,提高推理性能。研究内容包括但不限于:
1.投机推理(Speculative Decoding),研究…

快看我的同事上春晚了火山引擎持续 快看我的同事上春晚了火山引擎持续招聘中

全职 北京,上海,深圳,成都,杭州,广州
招聘城市:北京,上海,深圳,成都,杭州,广州
快看,我的同事上春晚了|火山引擎持续招聘中!
字节跳动招聘
招聘概要:
火山引擎是字节跳动旗下AI云服务平台,致力于将字节跳动在快速发展中积累的增长方法、技术能力与应用工具开放给外部企业,提供AI云服务,助力企业智能化转型与增长。
当前,火山引擎正持续开展社会招聘与实习生招聘,岗位覆盖 研发方向 (多模态/大模型/控制/大语言模型/AIGC算法工程等)、 AI Infra (大模型推理/训练系统工程)、 实施运维 (HiAgent实施运维、技术支持、SRE)、 产品方向 (豆包大模型/语音/应用产品经理与运营、产品解决方案架构、大模型安全解决方案专家)以及 非产品与研发方向 (销售、运营、客户成功、产品设计、战略投资等)。
热招城市…
招聘城市:北京,上海
…负责前沿AI编译加速等技术的探索和业务落地。
大模型服务方向:
1、参与/负责大模型MaaS系统的架构设计、系统研发、产品研发等工作;
2、深入参与面向大模型场景的请求调度、异构资源调度、引擎优化等核心工作,实现万亿级并行推理系统
3、为内部产品线提供解决方案,协助公司内用户解决大模型应用过程中业务在MaaS上的使用问题。
任职要求:
1、本科及以上学历,计算机、人工智能等相关专业优先;
2、熟悉Linux/Unix平台上的C++/Python/Rust编程,熟悉常用的数据结构和算法,有良好的编程习惯;
3、具备大模型方向头部开源框架开发经验,或者具有大模型工程优化的前沿论文成果;
4、熟悉至少一种大模型训练或推理框架的…
招聘城市:上海
…后训练、推理、评测等关键环节理解深入。
? 学术先锋
在大模型、机器学习、多模态、人工智能系统等相关方向有较强学术积累, 顶会顶刊论文作者优先(NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ECCV等),科研创新能力突出。
? 开源项目
有GitHub开源项目经历,参与过大模型训练、推理、Agent、多模态、AIGC、系统优化等项目建设者优先;如有主导项目、核心贡献或具备一定社区影响力者更佳。
? 实战导向
拥有大模型相关实习与业务项目经验,具备良好的工程意识、问题解决能力和业务理解能力,能够推动技术方案走向实际应用。
06 招聘岗位
大模型算法工程 (2027届云弧计划)
AI Infra研发工程 (2027届云弧计划)
工作地点:上海
07 研究方向与课题
【基础模型】
? 大…
招聘城市:北京,上海
…的动态推理架构:针对Agent多轮对话、工具调用等复杂交互带来的极致动态性,研究智能KV Cache管理优化策略(如动态复用、分级存储、长短时记忆重组),解决长序列及高并发下的显存瓶颈。
2.极致模型压缩:研究前沿的模型压缩技术,包括先进的高比例量化(INT4/FP4/低比特混合精度)、结构化/非结构化稀疏(Sparsity),并开发对应的硬件友好型Mega算子,压榨硬件极限性能。
3.下一代投机采样技术: 深入研究并落地最前沿的解码加速技术,包括Draft-Target分离部署架构、Structured Speculative Decoding等异构投机采样方案;探索多Token预测(MTP)在线联合验证、无轻量模型依赖的自投机(Self-Speculative)等免草稿模型加速路径。
4.前沿推理系统深度开发:跟踪并引领AI Infra业界…
招聘城市:北京,上海
…是我们】
1.算力资源充足,问题规模真实:接触真实 GPU 集群、训练任务调度、推理集群和资源治理,在工业级场景下优化 GPU 利用率、任务吞吐、训练稳定性和单位算力成本,技术栈横跨 AI系统、平台和工程架构,成长面很宽。
2.技术挑战硬核,工程深度足:大稀疏+大稠密模型课题,既有传统TB级别的稀疏Embedding,又有LLM规模的Dense。既要搞定稀疏多级异构存储,又要搞定大模型场景下的混合精度、并行策略、通信等难题,以及推理系统上的吞吐、延迟、模型量化等工作。
3.带教资源好,能快速补齐 AI + Infra 复合能力:紧密合作的算法专家团队,补充AI模型领域知;资深 AI Infra专家 1V1指导,全程重度参与系统设计和实现。

sunrise曦望 曦引力芯引擎曦望2027届实习生招聘启动

兼职 杭州,北京,上海,深圳,成都,香港
招聘城市:杭州,北京,上海,深圳,成都,香港
…算力资源和团队支持;参与芯片与系统级关键项目,快速积累产业经验;直接对话行业顶尖芯片架构、开源项目核心贡献者;扁平直接,工程驱动,在高自由度环境中快速迭代;提供转正机会,上升通道与晋升机制明确,可在核心项目中进阶;对标硅谷的顶级环境,兼具开放、协作、创新属性
招聘摘要: sunrise曦望现开展27届实习生招聘和26届春招。公司是国内首家All - in推理的GPU芯片公司,定义AI推理时代基础设施新范式,两代自研芯片已量产交付,全栈自研指令集等,研发团队实力强劲,获近40亿投资。招聘岗位包括芯片类(数字验证工程等)、AI Infra类(AI Infra推理引擎工程等)、运营类(供应…
招聘城市:北京
【北斗】分布式AI推理/AI-Infra研发工程
更新时间:2026-06-03
岗位职责
为了更好地提升城市即时配送的效率与体验,2017年,美团启动了无人机配送服务的探索,通过科技创新推动履约工具变革,加快建设空地协同的本地即时配送网络。目前,美团已初步完成了自主飞行无人机、智能化调度系统及高效率运营体系的研发建设工作,由此打造了一个服务于多场景、多天候的城市低空物流解决方案。
1、推理框架研发:参与构建与优化高性能分布式 AI 推理引擎,支持大模型在多卡、多机环境下的高效分布式部署与高效通信;
2、分布式任务调度:参与设计与实现面向大模型推理的高效任务调度算法。针对 Prefill与…
招聘城市:上海
…招聘信息
AI Infra研发工程【2027届云弧计划】
2026-06-22 11:58:28
职位描述
岗位职责:
在本岗位,您将有机会深入基础设施技术本质,同时驱动大模型与业务高效落地,具体将参与:
1. 大模型训练与推理基础设施研发:参与构建和优化面向大规模分布式训练/推理Infra 平台,支持文本、图像、视频、语音等多模态大模型、扩散模型的训练与推理。涵盖集群资源调度、训练框架优化、高性能通信、混合精度训练、显存优化等关键环节,确保模型的训练效率与系统稳定性;
2. 前沿Infra 技术探索与创新:持续跟踪并攻关大模型基础设施领域的前沿方向(如:超大规模异构集群管理、更高效的并行策略、MoE 训练/推理优化、量化与推理加速框架…
招聘城市:上海
…特色内容场景的推荐策略优化,探索兴趣发现、内容多样性、新内容冷启动、UP 主成长扶持、社区质量治理等问题。
4.跟踪推荐系统、深度学习、大模型、多模态理解、图学习、强化学习、生成式推荐等前沿技术,并推动在真实业务场景中的实验和落地。
5.参与推荐系统数据链路、特征工程、离线训练、在线推理、A/B 实验和效果分析,协助优化大规模推荐服务的稳定性与性能。
6.深入理解产品和业务,通过数据分析发现推荐机制中的问题,提出可验证的算法或策略改进方案,并与产品、工程、运营团队协同推进。
7.参与大模型 API 在推荐系统中的应用探索,包括内容标签生成、视频摘要、评论/弹幕理解、用户兴趣归因、推荐理由生成、冷启动内容理解等方向…
招聘城市:上海
量化AI工程AIInfra&深度学习方向)
招聘人数:3人
单位名称:爱凡哲投资管理有限公司
薪资待遇:面议
工作地点:上海市
发布日期:2026-03-03
基本要求
工作类型:全职
学历要求:硕士研究生及以上
专业要求:计算机科学与技术,数学类
岗位职责
1.负责量化基金场景下的大模型(LLM)与深度学习模型的部署、运维与工程化落地,包括训练环境、推理服务及稳定性保障。
2.参与量化投研与交易相关的深度学习建模与系统实现,包括市场微观结构建模、时序预测、交易执行优化及研究自动化等方向。
3.将研究阶段的算法转化为可上线的生产级系统,完成训练、评估、部署及持续迭代优化。
4.构建高性能模型推理架构,优化延迟…
招聘城市:上海
AI 框架适配调优:对接 PyTorch、TensorFlow、vLLM 等主流框架,完成训练 / 推理场景参数调优,实现计算与通信重叠,提升端到端任务性能
6、集群基准测试:使用行业标准压测工具完成集群算力、吞吐、时延基准测试,定位性能瓶颈并落地优化方案
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1、计算机、网络工程、电子信息、高性能计算、人工智能等相关专业;
2、熟悉 Linux 操作系统,掌握基础 Linux 命令,了解 Shell/Python 任意一种脚本语言,具备基础脚本编写能力;
3、了解计算机网络基础原理,熟悉 TCP/IP、二层 / 三层网络架构,有 RDMA、InfiniBand、RoCE 网络认知者优先;
4、了解 GPU、CUDA 基本概念,接触过分布式计算、高性能集群、AI 训练环境…
招聘城市:上海
…训练底座 (Training Infra)
框架优化: 负责维护和优化基于 Megatron-LM, FSDP, VeRL的分布式训练框架,通过多维并行策略提高训练吞吐。
算子优化: 参与多模态大模型训练核心算子的设计与优化,包括 Attention、MoE、算子融合等方向,持续提升模型训练效率和硬件利用率。
通信优化: 深入优化 H/NCCL通信库,解决 RDMA/RoCE 网络下的通信瓶颈,提升多机多卡并行效率(DP/PP/TP/CP/EP)。
稳定性保障: 构建自动容错与快速恢复系统(Checkpoint 优化、故障自动检测与接续),确保千卡集群在数月跨度的训练中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 负责基于 vLLM、TensorRT-LLM、SGLang、Triton Inference Server 等推理框架的开发与优化,提升大模型在线服务的吞吐…
招聘城市:上海
…QPS的在线推理服务架构,满足社区实时搜推需求;
4. 突破超大Embedding表的存储/更新/检索技术瓶颈,优化存储和计算效率;
5. 优化GPU多卡/多机训练和推理的可扩展性,支持超长行为序列建模和参数scaling up的持续迭代;
6. 搜推工程团队致力于构建下一代智能内容分发系统,让用户发现更多“感兴趣”的内容。加入我们,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎,在B站实现你的技术理想。
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1. 计算机相关专业本科及以上学历,具备扎实的C++/Python编程功底;
2. 有大规模搜广推模型训练或推理的成功…
招聘城市:深圳,其它
…Python / C++ / Java 等至少一门开发语言,数据结构与算法基础扎实,编程能力过硬;
具备一定的算法理论基础和实际工程落地能力,参与过算法模块、功能应用的设计与实现(含课程项目、竞赛、实习);
了解机器学习/深度学习基本理论,熟悉 TensorFlow / PyTorch 等主流框架者优先。
加分项:
AI应用开发:有基于大模型API或开源模型做应用开发的经验(如RAG、Agent、Prompt工程等);
AI算法优化:有模型训练、微调、推理加速或部署经验;
AI Infra方向:了解GPU集群、分布式训练、模型 serving 等技术。
核心素质:
AI技术有强烈的探索欲和自驱力,乐于动手实验新技术;
具备出色的问题分析与攻坚能力,在复杂技术难题面前不退缩
投递说明:
接收简历时间: 2026 年 8 月…
招聘城市:北京,上海
岗位职责:
1、主导新一代训练与推理引擎的架构设计与核心模块开发,支撑搜广推业务在长序列建模、生成式推荐、Agent 等前沿场景的规模落地;
2、与存储、数据平台深度协同,打造端到端 ML 数据 Pipeline:统一特征管理、秒级调试、版本追踪与一键上线,让数据科学家专注模型创新;
3、持续优化训推基础设施:自研 Embedding 高速存储、特征 DSL 引擎、弹性调度与服务化推理框架,实现 10x 级性能提升;
4、跟踪 LLM / Agent 最新进展,将其工程化落地到搜索、广告、推荐及智能体业务,定义行业新标准。
任职要求:
1、计算机及相关专业本科以上学历,具备高性能系统AI Infra 研发经验;
2、精通 C/C++,具备扎实的系统底层能力(内存、并发…
招聘城市:北京,上海
岗位职责:
1、主导新一代训练与推理引擎的架构设计与核心模块开发,支撑搜广推业务在长序列建模、生成式推荐、Agent 等前沿场景的规模落地;
2、与存储、数据平台深度协同,打造端到端 ML 数据 Pipeline:统一特征管理、秒级调试、版本追踪与一键上线,让数据科学家专注模型创新;
3、持续优化训推基础设施:自研 Embedding 高速存储、特征 DSL 引擎、弹性调度与服务化推理框架,实现 10x 级性能提升;
4、跟踪 LLM / Agent 最新进展,将其工程化落地到搜索、广告、推荐及智能体业务,定义行业新标准。
任职要求:
1、计算机及相关专业本科以上学历,具备高性能系统AI Infra 研发经验;
2、精通 C/C++,具备扎实的系统底层能力(内存、并发…
招聘城市:北京
天翼云科技有限公司
招聘信息
【超级优才专项】研发工程
2026-07-28 22:46:47
职位描述
工作职责
可以参与到AI Infra、训练推理、算力调度、计算、AI存储、智算网络、AI云电脑、基础软硬件、数据库、操作系统、模型服务、AI应用、大数据等一个或多个领域,开展科研及技术研发工作。 1.从事云计算、云网融合领域的新技术研究探索,开展技术评测与验证; 2.承担天翼云操作系统、弹性计算、分布式存储、服务器、云安全等技术及软硬协同、云网融合、云边协同、ABC一体化(AI/BigData/Cloud)等方向关键问题的深入研究,提出创新方法,并与产品研发团队协同,完成落地实施; 3.跟踪、研究云计算领域前沿技术和相关产业的…