牛大妈在社招职位搜索规划架构师-AI算力配套优化 有 368 条结果

招聘城市:深圳
…的规划和性能优化,包括网络专线、内存、磁盘、CPU
2.推动公司整体CPU和内存使用效能提升,包括RL框架和KV Cache的内存压缩优化,大规模K8S集群的CPU超卖和内存压缩能力建设。
岗位要求:
1.3年以上相关开发经验,熟悉Go/C++/Python/Java等至少两门语言;
2.熟悉Linux、虚拟化技术、K8S、Docker;有KVM或K8S集群优化经验优先,有混部技术经验优先;
3.了解x86、ARM架构,了解计算机系统底层硬件,有相关网络基础知识;有服务器CPU、网络、存储性能调优,内存压缩优化等经验优先;
4.对AI基础设施感兴趣,熟悉AI所需的周边配套资源,了解AI算法原理和深度学习框架优先。
岗位介绍:
在腾讯,优秀的技术运营工程

小红书(xiaohongshu) 【Dots】大模型算子优化工程

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…紧密协作,将算法需求转化为高效的系统实现
探索新硬件(新一代 GPU / 国产)上的算子适配与性能调优
任职要求:
基础要求
扎实的 CUDA 编程能力,深入理解 GPU 体系结构(SM、warp、shared memory、tensor core、访存层级)
熟悉性能分析工具(Nsight Compute/Systems、nvprof),能定位并解决计算/访存瓶颈
熟悉至少一种主流训练或推理框架(Megatron-LM、vLLM、SGLang、TensorRT-LLM、FlashInfer 等)
理解 Transformer 结构及其在训练/推理中的计算特征
加分项:
有 FlashAttention / Fle Attention 等前沿算子的复现或改进经验
熟悉 Triton、CUTLASS,能高效开发模板化 kernel
有 FP8 / 低比特量化算子落地经验
有 MoE、长序列、投机解码等新场景的算子优化实战
熟悉 NCCL / 通信算子优化,理解计算-通信 overlap
有开源贡献(vLLM /…
招聘城市:深圳
…项目把控及推进能力,能够清晰地规划和拆解团队目标,并具备hands on能力;
6.符合以下要求其中一条或以上:;
7.熟悉NIC/RDMA等内核网络协议栈和驱动设计实现,熟悉计算机网络,了解集合通信库(如: NCCL)和相关算法(如: AllReduce)的设计实现与性能分析优化
8.熟悉GPU、NPU计算加速卡卡间互联技术,包括互联应用场景,互联接口和互联组网。熟悉业界典型的互联方案;
9.熟悉CXL等内存一致性协议及应用场景,有相关异构架构设计经验者优先;
10.熟悉计算机体系结构,硬件设计和实现,熟悉ARM/RISC-V SOC体系架构
11.熟悉PCIe、DDR、存储系统等总线和相关协议。
加分项:
1.有成功设计和实现AI硬件加速解决方案的项目经验…

腾讯(tencent) AI infra规划架构

全职 深圳
招聘城市:深圳
…通过AI基础设施和软硬件协同优化来提升公司大模型训练和推理的效率。负责前沿异构计算芯片、大模型推理优化、大规模训练的技术演进跟踪和落地。
岗位要求:
1.2年以上相关开发经验,熟悉Go/C++/Python/Java等至少两门语言;
2.有TensorFlow、Pytorch使用或者优化经验,有机器学习平台开发经验优先;
3.了解GPU、CUDA、神经网络、RAG等技术,有大模型分布式训练和推理优化经验优先;
4.对AI底层硬软件基础设施,AI工程化和大模型推理优化感兴趣。
岗位介绍:
在腾讯,优秀的技术运营工程始终赋能业务,关注技术运营的质量、成本、效率和安全。他们不仅是经验丰富的问题解决者,更是具有全局视角的架构,通过自动化…

腾讯(tencent) AI infra规划架构

全职 深圳
招聘城市:深圳
…通过AI基础设施和软硬件协同优化来提升公司大模型训练和推理的效率。负责前沿异构计算芯片、大模型推理优化、大规模训练的技术演进跟踪和落地。
岗位要求:
1.2年以上相关开发经验,熟悉Go/C++/Python/Java等至少两门语言;
2.有TensorFlow、Pytorch使用或者优化经验,有机器学习平台开发经验优先;
3.了解GPU、CUDA、神经网络、RAG等技术,有大模型分布式训练和推理优化经验优先;
4.对AI底层硬软件基础设施,AI工程化和大模型推理优化感兴趣。
岗位介绍:
在腾讯,优秀的技术运营工程始终赋能业务,关注技术运营的质量、成本、效率和安全。他们不仅是经验丰富的问题解决者,更是具有全局视角的架构,通过自动化…
招聘城市:深圳
…异构/AI产品的技术架构分析与对比,深入剖析技术细节,挖掘成本优化空间;
2.负责腾讯云推理平台效能优化,通过装箱策略、调度策略优化及软硬协同技术持续优化平台成本与效能;
3.负责持续跟踪AI芯片/AI行业技术发展趋势,探索分析领域技术发展,参与腾讯云异构类机型规划和生命周期管理,参与制定硬件技术降本方案,并推动在公司内规模应用;
4.参与跨事业群、跨部门的联合项目管理工作。
岗位要求:
1.计算机相关专业硕士及以上学历,有互联网产品或云平台的后台开发经验;
2.有云计算、虚拟化及K8S运维、开发或开源软件维护经验者优先;
3.有高并发、高可靠、大规模的后台服务系统架构设计经验者优先…
招聘城市:深圳
岗位职责:
1.基于自研芯片,研发高性能推理与训练框架,解决芯片落地过程中的全链路问题;
2.能根据硬件特性和AI模型特点,不断迭代和完善框架性能和易用性、持续提升推理模型整网性能,和业务一起构建自研芯片软件生态。
岗位要求:
1.熟悉Linux开发环境,掌握Python/C++等语言,具备良好的编程基础以及系统设计能力;
2.熟悉GPU或SIMD编程体系架构,了解LLM、AIGC等模型结构,能够使用nvpro、nsys等profiler工具;
3.精通主流训练推理框架和加速技术,包括但不限于:Pytorch、Megatron、DeepSpeed、VLLM、Sglang等;
4.具有系统性分析模型性能瓶颈的能力,熟悉从算子调用,到模型训练推理,再到结果返回的功能定义和具体逻辑;
5.具备良好的…
招聘城市:北京
岗位职责:
1.基于自研芯片,研发高性能推理与训练框架,解决芯片落地过程中的全链路问题;
2.能根据硬件特性和AI模型特点,不断迭代和完善框架性能和易用性、持续提升推理模型整网性能,和业务一起构建自研芯片软件生态。
岗位要求:
1.熟悉Linux开发环境,掌握Python/C++等语言,具备良好的编程基础以及系统设计能力;
2.熟悉GPU或SIMD编程体系架构,了解LLM、AIGC等模型结构,能够使用nvpro、nsys等profiler工具;
3.精通主流训练推理框架和加速技术,包括但不限于:Pytorch、Megatron、DeepSpeed、VLLM、Sglang等;
4.具有系统性分析模型性能瓶颈的能力,熟悉从算子调用,到模型训练推理,再到结果返回的功能定义和具体逻辑;
5.具备良好的…
招聘城市:深圳
…熟悉服务器硬件架构和计算机网络,了解GPU服务器、GPU高速网络、IDC等AI基础设施技术优先;
3.了解供应链各个模块及其流程,具备专业的供应链管理知识和技能,熟悉先进的供应链体系理念及运作;
4.擅长各团队间的沟通交流、具备较强的项目管理落地能力,具有自我持续优化的驱动,具备针对复杂问题的分析和解决的能力;
5.较强的专业数据分析能力,掌握供应链流程及ERP系统应用,有较强IT系统优化AI提效意识。
岗位介绍:
在腾讯,优秀的技术运营工程始终赋能业务,关注技术运营的质量、成本、效率和安全。他们不仅是经验丰富的问题解决者,更是具有全局视角的架构
招聘城市:上海
岗位职责:
1.基于自研芯片,研发高性能图和算子编译器,解决芯片落地过程中编译相关性能、易用性等问题;
2.探索和研发自动生成算子解决方案,提升生成算子效率;
3.不断迭代编译器功能、性能和易用性,和业务一起构建AI生态。
岗位要求:
1.熟悉Linux开发环境,掌握Python/C++等语言, 有良好的编程基础、系统设计优化能力;
2.熟悉GPU/AI DSA体系结构和原理,有Nvidia/AMD/Intel或 AI 芯片等编译相关的开发优化经验;
3.精通MLIR、Triton、tilelang或其他CodeGen框架;
4.具备良好的技术热情和责任感,优秀的分析解决问题能力,良好的团队意识和沟通能力。
加分项:
1.熟悉Cuda、ROCm算子开发与pytorch/tensorflow框架;
2.熟悉LLM常见模型结构和…
招聘城市:北京
岗位职责:
1.基于自研芯片,研发高性能图和算子编译器,解决芯片落地过程中编译相关性能、易用性等问题;
2.探索和研发自动生成算子解决方案,提升生成算子效率;
3.不断迭代编译器功能、性能和易用性,和业务一起构建AI生态。
岗位要求:
1.熟悉Linux开发环境,掌握Python/C++等语言, 有良好的编程基础、系统设计优化能力;
2.熟悉GPU/AI DSA体系结构和原理,有Nvidia/AMD/Intel或 AI 芯片等编译相关的开发优化经验;
3.精通MLIR、Triton、tilelang或其他CodeGen框架;
4.具备良好的技术热情和责任感,优秀的分析解决问题能力,良好的团队意识和沟通能力。
加分项:
1.熟悉Cuda、ROCm算子开发与pytorch/tensorflow框架;
2.熟悉LLM常见模型结构和…
招聘城市:深圳
…Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有高性能计算(HPC)、编译器优化、系统级性能调优相关经验或论文/开源项目贡献。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的…
招聘城市:北京,上海
岗位职责:
1、核心引擎开发与优化:负责或深度参与基于国产异构计算芯片(如NPU/PPU等)的大模型训练/推理引擎的架构设计、开发与迭代,构建高性能、高稳定性的上层软件栈;
2、大模型业务落地:将引擎能力应用于公司核心业务,主导或参与多模态、大语言模型等前沿AI模型在国产芯片上的训练、微调与推理部署,解决实际落地中的技术难题;
3、极致性能调优:针对各类业务大模型,进行深度的推理调度策略优化和关键算子(Kernel)的性能剖析与极致优化,持续提升系统的吞吐量、降低延迟;
4、生态合作与协同:作为技术接口人,与国产芯片原厂技术支持团队紧密合作,高效推进芯片驱动、基础软件栈的引入、问题排查与…

小红书(xiaohongshu) dots-模型结构算法工程

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…LLM 预训练团队,负责下一代基座模型的架构设计与训练系统研发。
团队聚焦:
- Scaling Law
- 优化器与训练稳定性
- 长上下文与推理能力扩展
- 高效训练与推理
- MoE 与稀疏化架构
我们关注的不只是"把模型做大"。我们更关注:什么样的结构、优化与训练机制,能够让模型更高效地产生智能。
你将参与的方向
1. Scaling Law 与能力扩展
研究模型能力如何随着以下维度共同演化:
- 参数规模
- 数据规模
- Token 数量
- Inference Compute
- Context Length
你将参与设计大规模实验,并分析不同结构与训练策略下的 scaling behavior。
2. 新型模型结构探索
探索 Transformer 之后的结构优化方向,包括但不限于:
- MoE
- Hybrid Attention
- Retrieval-enhanced Architecture
以及:长上下文建模 / KV Cache 优化 / 推理效率优化
招聘城市:杭州
…训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨…
招聘城市:北京,上海
…隔离、记忆管理和知识检索。
8、具备 AI 应用全链路压测实践,能够覆盖应用接入、Agent 编排、模型推理、上下文处理、RAG 检索及 Tool 调用,并根据压测结果完成容量规划和性能优化
9、具备大模型应用成本测算与治理经验,能够结合流量规模、Token 消耗、模型单价、模型路由和工具调用核算成本,并推动成本预算、归因和优化落地。
10、熟悉超时、重试、幂等、限流、熔断、缓存、消息队列、任务调度、容灾和分布式追踪等生产工程能力。
11、能够在效果、时延、稳定性、成本和研发效率之间进行技术取舍,并推动架构方案跨团队落地。
12、具备良好的技术影响,能够制定工程规范、推动公共组件建设,并指导团队解决复杂技术问题。
加分项
有自研 Agent Runtime、Multi…
招聘城市:深圳
…服务。依托各地的数据中心,我们将云计算、大数据、人工智能、物联网、安全等先进技术与智慧产业业务场景相结合,同时面向金融、教育、医疗、零售、制造与消费电子、交通、能源与资源、广电、文旅、建筑与地产、农业、体育、运营商等领域,打造全面的智慧行业解决方案。目前,腾讯云在助力产业数字化方面取得了丰富的实践经验,为众多优秀的企业提供优质服务,帮助他们实现数字化和智慧化升级。加入我们,一起“产业智变,云启未来”!
对应的产品包括:数据库、大数据、音视频、计算、存储、网络、云智能与AI产品、腾讯会议、腾讯企点、企业中台SaaS等;
对应的智慧行业包括:互联网与传媒、金融、工业、能源、建筑与不动产、农业、运营商、教育、体育等。
招聘城市:深圳
…训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨…

小红书(xiaohongshu) 【dots】applied posttrain算法工程

全职 上海,北京,杭州
招聘城市:上海,北京,杭州
…复杂应用场景下应用这些工具的实践经验。
2、对齐技术研究经验:深入理解监督学习、强化学习、表示学习等方法,并在至少一个 AI 领域有过研究经历或通过机器学习算法成功解决过复杂问题。
3、卓越的实验设计与问题解决能力:具备设计复杂实验和分析实验结果的能力,能够识别并解决模型在真实应用中的关键技术挑战,具备创新思维,并能够有效沟通、与团队协作。
加分项:
在顶级学术会议(如 ICML、ICLR、NeurIPS、ACL、CVPR、AAAI)发表过有影响的研究成果。
在 ACM/ICPC、NOI/IOI、Kaggle 等竞赛中获得优异成绩者优先。
参与过 AI 相关的有大影响的开源/闭源项目、有 AI Alignment 相关研究经验或大模型应用项目经历者优先。
招聘城市:上海
…训练算法有一定了解(如 Transformer、LLM 训练技巧、优化器、并行算法等),能与算法同学就结构与算子设计进行深入讨论;
3.有参加过编程竞赛(如 ICPC、NOI/IOI、Codeforces、AtCoder 等)并取得优异成绩的经历,具备优秀的算法与代码实现能力;
4.有国产异构硬件(如昇腾、寒武纪等)算子开发经验。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起参与团队愿景、文化和产品方向的探讨…