招聘城市:北京,上海,广州
岗位职责:
职位描述
团队专注于大模型机器学习系统领域的前沿技术研究和落地,提供高性能、高可靠、可扩展的机器学习系统、丰富的异构计算资源和极致的端到端的机器学习服务体验,为公司提供核心技术能力和服务。
1、负责大模型推理服务的研究与开发,服务于公司各个产品;
2、负责端到端解决大模型预训练、微调对齐阶段的工程、算法问题,为结果负责
任职要求:
1、熟练掌握Linux环境下的C/C++、Python语言;
2、具备扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯;
3、能够熟练使用至少一种主流的机器学习框架(TensorFlow / PyTorch等),熟悉框架内部实现;
4、熟悉Transformer模型及其应用场景
5、熟悉…
招聘城市:北京,上海
…对话/搜索产品的架构挑战与稳定性有深刻兴趣,追求高可靠、高性能、高复用工程实践;
- 本科及以上学历,3年以上相关后端开发经验(特别优秀者可放宽)。
加分项
- 有高并发IM/聊天/实时交互系统开发经验;
- 参与过大模型应用后端(如Agent、Tool Call、上下文管理)建设;
- 熟悉DeepSeek、Llama等开源大模型推理/服务化部署实践;
- 小红书/点点是重度用户,有真实使用场景洞察。
【我们提供】
- 极具竞争力的薪酬(较高水平的月薪+平均4个月年终奖+高增长空间的期权,更为创造突出价值的成员提供超过20个月月薪的年终奖,具体面议);
- 参与公司战略级AI项目,从0到1打造现象级Agent应用的机会;
- 顶尖AI工程师文化…
招聘城市:北京,上海
…Tool编排、RAG服务与知识增强框架;
- 推动AI工程标准化建设,包括可配置Pipeline、可视化调试平台、自动化测试与监控体系;
- 参与复杂场景攻关(如多轮交互、工具链路容错、成本控制),驱动点点AI能力持续领先。
任职要求:
【任职要求】
- 熟悉大模型应用架构,精通Function Call / Agent / ReAct / Tool Calling / Workflow等核心机制,有实际落地经验;
- 精通Python/Go/Rust至少一种,具备高并发服务化开发经验,熟悉异步通信(SSE /gRPC /WebSocket /MQ);
- 深入理解分布式任务调度、流程编排框架(如Airflow /Temporal /Dagster等),有自研或深度优化经验优先;
- 熟悉LLM 上下文管理、KV Cache、Token 复用、批处理推理等优化手段,有性能调优实战;
- 具备强烈的Owner意识与系统设计能力,能独立负责复杂模块从设计到落地的…
招聘城市:深圳
岗位职责:
1.负责设计与演进业界领先的大模型在线推理平台,构建支撑亿级日调用量的高性能、高可用、高扩展的服务体系,为公司AI业务提供坚实的推理能力基座;
2.负责设计高性能推理服务架构,结合推理引擎与底层硬件的核心特性,优化动态调度、资源管理等核心后台策略,实现服务性能与成本效益的最优化;
3.负责研发标准化的推理服务框架与配套工具链,打通从模型研发、性能优化到线上部署的全链路流程,提升推理服务工程化落地效率;
4.负责构建平台的高可用架构与可观测性体系,落地故障容灾、限流熔断等核心能力,为容量规划、应急响应提供数据与技术支撑,保障服务的可靠性。
岗位要求…
招聘城市:北京
…Kubernetes、微服务治理、RPC 框架)。
加分项:
1.有语音(ASR / TTS / 语音合成)或语音大模型 / 多模态模型工程落地经验;
2.熟悉流式传输协议(WebSocket、RTC / WebRTC)与音视频编解码链路;
3.深入掌握 KV Cache、投机解码、量化、Continuous Batching 等大模型推理加速技术;
4.有开源大模型推理框架(vLLM、SGLang、TensorRT-LLM 等)二次开发或社区贡献经验;
5.熟悉语音服务关键指标(实时率 RTF、首字延迟、音质 / 一致性)的优化方法。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考…
招聘城市:北京
…1. 模型推理服务优化:
* 负责大语言模型(LLM)推理性能的优化,包括延迟降低、吞吐量提升和资源效率优化
* 开发和应用模型压缩技术(包括但不限于量化、稀疏化等)
* 优化推理框架,支持多种硬件平台(GPU、专用AI芯片)
* 设计并实现高效、稳定、可扩展的推理服务架构
2. 性能分析与调优:
* 建立性能基准测试框架,持续监控和评估推理性能
* 分析性能瓶颈,提出并实施优化方案
* 针对不同应用场景(实时对话、批量处理等)定制优化策略
3. 技术创新与落地:
* 跟踪最新研究成果,将前沿优化技术应用到生产环境
* 与算法团队合作,参与模型架构的推理友好设计
* 编写高质量的技术文档和最佳实践指南
岗位要求:
1.必备条件:;
2.计算机、软件工程、人工智能等相关专业…
招聘城市:北京
岗位职责:
1.配合算法工程师,推动大模型相关算法的落地,打造高吞吐、低延迟的推理系统,在产品上实现快与准的交互体验;
2.探索面向高并发场景下(千万量级)的高性能推理服务架构,针对NVIDIA GPU、NPU等国产算力进行性能调优,包括算子融合、显存管理、计算图编译优化、Batching、KVCache管理,打造高效的推理服务架构,结合LLM能力实现业务的高效运转;
3.持续跟进业界最新Infra技术,如高效通信库、量化、稀疏蒸馏等训练部署方案,配合实际业务进行技术预研;
4.结合推理引擎和业务服务,优化动态流量调度、资源管理等结合业务实际情况的后台策略。
岗位要求:
1.具备扎实的编程语言基础,掌握 C++/Python/Golang 至少一门语言,熟悉Linux开发环境…
招聘城市:上海
…Java/Python/C++),熟悉微服务架构、分布式系统、数据库设计与 API 开发
有 AI / LLM 相关项目经验,理解大模型的基本原理与调用方式,有 Agent 编排、结构化输出设计、工具调用/Function Calling、RAG 架构、多 Agent 协作或模型微调等实践经验。
具备全栈思维,能独立完成从服务端 AI 能力设计到客户端交互实现的端到端开发,不局限于单一技术栈。
产品意识强,能从用户场景出发思考 AI 能力的价值,而非仅完成技术接入;理解 AI Native 产品的核心特征与传统产品的差异。
加分项(按方向):
增长方向:有用 AI 重构传统增长流程的经验(智能触达、AI 文案生成、智能实验、归因分析),或 AARRR 增长方法论 + 工程落地经验
Agent 架构方向:熟悉 LangChain…
招聘城市:深圳
…机基础与系统设计能力;
3.具备AI 工程化经验,熟悉大模型推理服务部署与优化、分布式训练、Prompt 工程、RAG 等相关技术;
4.深入理解分布式系统原理,精通微服务架构、容器化、Kubernetes、CI/CD 等云原生技术;
5.精通 MySQL、Redis、MongoDB、Elasticsearch 等主流存储系统,了解其核心原理与性能优化手段;
6.熟悉消息队列、任务调度、分布式事务等中间件技术,有高并发、高可用系统设计与运维经验;
7.具备出色的问题分析与解决能力,能够快速定位并解决复杂的系统问题;
8.具备出色的沟通协调能力与团队管理能力,能够有效推动跨团队协作,带领团队攻克复杂技术难题。
加分项:
1.有游戏行业从业经验,熟悉游戏开发全流程与游戏服务器架构;…
招聘城市:东莞
…7. 有较强的逻辑思维和分析能力;8. 对数学感兴趣(如统计学、代数),并能使用数学工具/方法解决问题;9. 有较强的解决问题能力和优秀的沟通、表达技巧;10. 英文听说读写良好。AI基础架构工程师岗位职责1. 协助搭建与维护 AI 计算环境:包含 GPU 驱动/CUDA 与容器运行时的基本兼容,镜像基线与依赖管理;2. 在 Kubernetes 或容器环境中部署与运营模型推理服务(如 KServe、NVIDIA Triton、vLLM 等),实现基础的弹性与发布;3. 建设观测与告警:集成 DCGM、Prometheus/Grafana、日志(如 Loki/ELK)与基本 Trace,用于容量与性能可视化;4. 参与常见存储与网络配置:对象存储/S3 兼容方案、共享文件系统(如 NFS/CephFS 的基础使用)、基础网络与入口网关…
招聘城市:北京,上海
…具备大模型应用成本测算与治理经验,能够结合流量规模、Token 消耗、模型单价、模型路由和工具调用核算成本,并推动成本预算、归因和优化落地。
10、熟悉超时、重试、幂等、限流、熔断、缓存、消息队列、任务调度、容灾和分布式追踪等生产工程能力。
11、能够在效果、时延、稳定性、成本和研发效率之间进行技术取舍,并推动架构方案跨团队落地。
12、具备良好的技术影响力,能够制定工程规范、推动公共组件建设,并指导团队解决复杂技术问题。
加分项
有自研 Agent Runtime、Multi-Agent 平台、Workflow 引擎或分布式任务调度系统经验。
有搜索、推荐、知识问答、交易决策或其他复杂任务型 AI 应用架构经验。
有大规模模型网关、多模型路由、高并发流式服务或推理资源…
招聘城市:北京,上海
…用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。
工作职责:
1、参与/负责大模型推理服务平台(MaaS)的架构设计、系统研发、产品研发等工作;
2、深入参与面向大模型场景的请求调度、异构资源调度、引擎优化等核心工作,实现千亿级Token并行推理平台;
3、为内部产品线提供解决方案,协助公司内用户解决大模型应用过程中业务在平台上的使用问题。
任职要求:
任职资格:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/Golang/Python开发;
2、有大规模分布式系统实践经验,擅长对现实问题进行建模并运用解决
3、熟悉大模型的基本原理和常见应用场景,例如 Transformer、StableDiffusion…
招聘城市:北京,上海
岗位职责:
【业务介绍】小红书业务技术部-引擎架构团队,支撑社区、搜索、商业化等小红书核心业务落地AI技术
【工作职责】:
1. 参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)的推理服务的研发和优化;
2. 在PD分离、EP部署的基础上,优化Agentic 服务的推理效率,降低推理成本
任职要求:
1. 熟练掌握GPU CUDA编程
2. 追求技术极致,务实,渴望有自己的作品和代表作
3. 加分项
- 对芯片体系结构和指令执行pipeline有深刻认知者
- MLSys方向的知名开源项目贡献者
- ACM等编程竞赛获奖者
招聘城市:北京
…AI 技术高效落地!
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志/监控、工作流编排等;
3、与全公司各业务算法部门深度合作,为重点项目进行算法与系统的联合优化,支撑业务目标达成。
任职要求:
1、优秀的代码能力、数据结构和基础算法功底,熟悉C++/python开发;
2、熟悉至少一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现;
3、具备AI模型性能调优、量化和稀疏化经验者优先;…
招聘城市:北京,上海
…侧推理架构的优化,提升用户的使用体验。
2. 负责服务端的Diffusion、LLM、VLM、Omini模型等先进算法的部署和极致性能优化,提升推理效率,降低成本。
3. 负责Diffusion、VLM等大模型算法训练的框架优化及效率提升,提高算法迭代训练效率,降低成本。
4. 打造具有业界一流水平的大模型推理技术能力,并通过开源共建等各类形式,形成在业界的广泛技术影响力
任职要求:
1. 对各种AI算法有一定的了解,有丰富的算法工程集成,性能优化和落地经验
2. 熟悉CUDA编程、CUDNN,TensorRT等工具,有丰富的服务端性能优化经验者优先
3. 深入了解NCNN、MNN、TNN、TVM、VLLM框架中的一种或多种,熟悉汇编优化和移动端GPU优化,有多类模型的…
招聘城市:北京,上海
…工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
工作职责:
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
4、参与/负责构建推理框架的系统容错能力,包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设;
5、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志…
招聘城市:上海
…大模型性能瓶颈,熟练分析单机及分布式情况下不同性能热点和优化手段;
4.熟悉大模型量化算法,int8/fp8/混合精度量化,了解模型蒸馏、稀疏化、剪裁技术;
5.熟悉推理服务框架,具备服务部署经验者优先,了解k8s,容器化服务,Triton Inference Server (https://github.com/triton-inference-server/server)实现原理者优先;
6.熟悉分布式模型部署及并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
7.熟练掌握Python及C++;
8.了解GPU体系结构者优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构…
招聘城市:北京
…训练和推理模型调试、调优有实操经验优先;
5.熟悉并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先;
7.加分项:;
8.机器学习或者体系结构相关顶会论文;
9.参与vllm、sglang等开源项目贡献者;
10.熟悉推理服务框架,具备服务部署经验者优先,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的…
招聘城市:北京
…训练和推理模型调试、调优有实操经验优先;
5.熟悉并行策略,如模型并行、流水线并行等,了解NVLINK、GPU通信者优先;
6.具备GPU、AI芯片体系结构知识,熟悉芯片特性,具备系统性能分析和调优经验优先;
7.加分项:;
8.机器学习或者体系结构相关顶会论文;
9.参与vllm、sglang等开源项目贡献者;
10.熟悉推理服务框架,具备服务部署经验者优先,有超大模型分布式部署经验优先。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的…
招聘城市:北京,上海,杭州
…模型、多租户、高并发场景下的请求调度与服务治理体系,提升模型服务的稳定性和资源效率。
5、开发者体验优化:持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。
6、业务打通与协同:与推理引擎、调度、算法及上层业务团队协同,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。
任职要求:
1、熟悉 Go / Rust / Java / Python / C++ 中至少一门语言,具备扎实的服务端研发能力。
2、有大规模分布式系统、高并发 API 网关、服务治理、流控限流、鉴权、多租户系统等相关经验。
3、能对复杂业务问题进行系统建模和抽象,具备良好的稳定性、可观测性和工程质量意识。
4、了解大…