招聘城市:上海,北京,杭州
…通过监控工具(如Prometheus、Grafana)对Kubernetes集群进行全面性能分析,并优化关键节点、组件和流程,以提升整体系统的稳定性和响应速度。
3、集群部署与运维: 独立负责Kubernetes集群的稳定部署、监控与维护工作,确保集群在高负载环境下的可靠运行。
4、平台化能力建设: 研究并实施Kubernetes平台化的能力建设,提升平台的扩展性、可用性和可管理性。
5、跟踪云原生生态的最新发展趋势,研究并应用新技术以提升底座的稳定性、可扩展性、可维护性。
任职要求:
1、计算机科学、软件工程等相关专业本科及以上学历,3年以上容器、Kubernetes 或相关分布式系统开发经验。
2、熟练掌握 Kubernetes 核心组件的原理和开发,有二次开发能力。
3…
招聘城市:成都
岗位职责:
1.负责 TKE 云原生容器网络架构的设计、开发和优化,打造高性能、高可靠性的容器网络;
2.负责数万 Kubernetes 集群的网络生命周期管理,解决容器网络在超大规模集群下的性能瓶颈问题(如网络延迟、带宽、安全隔离等);
3.设计并实现容器网络的高级功能,如网络策略(NetworkPolicy)、多租户隔离、IPv6支持、混合云网络互通等;
4.研究和探索容器技术的新方向,跟踪容器技术的发展趋势,持续优化产品性能和用户体验。
岗位要求:
1.计算机相关专业本科以上学历,3年以上容器或网络相关开发经验;
2.精通计算机网络,熟悉常见的网络问题,排障能力强;
3.熟悉Linux内核网络栈如 Netfilter、Conntrack等;熟悉 DPDK、eBPF、Cilium等技术者优先;
4…
招聘城市:上海,北京,杭州
…
3.针对不同业务场景,研究并改进 Kubernetes 调度算法,包括任务优先级、抢占机制、节点选择等,提升集群的资源分配效率和稳定性。
4.与多集群管理平台、资源隔离、QoS 管理等模块协同工作,确保在复杂场景下的资源调度策略具备高可用性和可扩展性。
5.跟踪云原生生态的最新发展趋势,研究并应用新技术以提升系统性能和调度灵活性。
6.支持系统的性能监控与故障诊断,参与系统优化和技术问题的快速解决,保障系统的高效稳定运行。
任职要求:
任职要求
1.计算机科学、软件工程等相关专业本科及以上学历,3年以上容器、Kubernetes 或相关分布式系统开发经验。
2.熟练掌握 Kubernetes 核心组件的原理和开发,具备调度器(Scheduler)相关…
招聘城市:深圳
…LLMOps体系建设: 设计和实现涵盖模型开发、评估、部署、服务的自动化流水线,重点保障大模型在生产环境的稳定性与性能;
4.私有云集成与优化: 主导平台与私有云底层(Kubernetes等)的深度集成,实现GPU等异构资源的精细调度与成本管控。
岗位要求:
1.必备经验:具备AI基础设施(AI Infra) 的架构设计经验。拥有构建或运维大模型训练/推理平台的实际经验,熟悉其关键技术挑战;
2.核心技术能力: 熟悉 Kubernetes,熟悉GPU虚拟化、分布式训练框架(如PyTorch DDP),熟练掌握LLMOps全链路工具与理念,并有实践经验,熟悉向量数据库、推理优化框架(如vLLM)等大模型相关技术栈;
3.附加要求: 熟悉AIOps经典场景(如异常检测、根因分析),并对LLM…
招聘城市:上海
…优化策略,支持平台对大模型和多模态模型任务的高效处理;
工作要求:
1.计算机科学、软件工程、人工智能或相关专业本科及以上学历,5年以上分布式系统、资源调度或大规模计算相关经验;
2.精通Python/Go/Java/C++至少一种主流编程语言,具有良好的代码风格和开发习惯;
3.熟悉Kubernetes架构和生态,熟悉Docker/Containerd/Kata/Podman等容器技术,有丰富的机器学习系统实践和开发经验;
4.熟悉常见的机器学习和深度学习框架,如TensorFlow、PyTorch、XGBoost等;
5.具备优秀的沟通能力和团队协作精神,能够有效地与跨职能团队合作,推动项目顺利进行;
加分项:
1.参与或主导过机器学习训练框架的设计与开发,熟悉分布式训练、模型并行等技术,有…
招聘城市:武汉
…交付质量、项目经营结果负责;
2.负责售前与售后的衔接,并聚焦客户和其他重要干系人的需求,保证客户满意度;
3.编写项目所涉及阶段汇报及项目验收报告等文档。
岗位要求:
1.计算机科学、信息技术或相关专业本科以上学历;
2.具有网络、服务器、存储、云计算、容灾备份和信息安全等相关配置和现场实施交付经验,至少满足其中四项;
3.具备丰富的 Docker、Kubernetes 容器化技术实战经验;
4.熟悉常见的中间和数据库,如 MySQL、Redis、Elasticsearch、MinIO、Kafka、Etcd 等,有部署和运维经验更佳;
5.熟悉云服务体系,包括Iaas、Paas和Saas;或者有一定的开发或者运维经验,有脚本(shell、python等)开发经验优先;
6.熟悉负载均衡、各类VPN网关(支持IPsec…
招聘城市:北京
…熟悉时序预测、异常检测等算法;
2.具备以下至少一个方向经验:;
3.a. AIOps相关项目开发(故障诊断/根因分析);
4.b.资源调度优化(强化学习/运筹学模型);
5.c.大模型在系统场景的应用实践;
6.了解分布式系统基本原理,对Kubernetes/监控体系等基础设施有认知者优先。
加分项:
1.有智能运维平台或云资源管理系统的AI模块开发经验;
2.熟悉LLM的工程化应用(如日志解析、运维知识库构建);
3.在系统以及AI顶会上有过发表相关论文。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景…
招聘城市:上海
…发放5k)。现面向社会招聘,具体信息如下:招聘职位及要求:Python系统开发工程师:工作地点上海,需国内重点高校计算机相关专业毕业,有五年以上系统开发经验,有良好代码习惯,有交易系统开发经验优先。需具备扎实的Python开发能力,熟悉Python 3和常见并发模型;有后端系统开发经验,熟悉服务通信方式和微服务相关原则;有高可用相关经验和实践;熟悉Docker、Kubernetes、常见数据库、缓存系统和消息队列等;有交易等相关系统经验,对系统稳定性和工程质量有追求,对工作认真负责,具备良好沟通和团队协作能力,热爱编程,自驱力强。薪资open谈。技术负责人:工作地点上海,具体要求未详细提供,薪资open谈。本次招聘活动为社招,网申…
招聘城市:北京
…式存储与计算资源的协同调度,有效解决大规模训练任务中的性能瓶颈,提升整体计算效率;
3.基于Kubernetes、Docker等云原生技术,构建高可用调度框架,全面支持分布式训练框架,实现任务编排、容灾与混部能力,并深入K8s调度器、CSI插件及CRD的开发,推动大规模训推技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动技术与平台能力的升级和创新。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下…
招聘城市:深圳
…职责:
1.熟悉客户技术架构,结合客户场景为客户提供最佳的容器化解决方案;
2.作为客户、产研团队的沟通桥梁,及时解决客户问题,提升客户对容器产品的满意度。
岗位要求:
1.本科及以上学历,5年以上 linux 服务器开发或者运维经验;
2.熟练使用 kubernetes,熟悉 kubernetes 调度、监控、网络、存储等技术原理或者方案;
3.熟悉一线公有云厂商的kubernetes产品,有丰富使用经验;
4.有丰富的应用或者大数据/AI 服务的容器化经验为佳;
5.有较好的团队合作精神,工作自驱力强。
岗位介绍:
“用户为本,科技向善”,是写在每位腾讯产品人心中的一句箴言。在互联网浪潮中,大众的生活已被深刻地改变,如何为用户创造价值…
招聘城市:深圳
岗位职责:
1.负责腾讯云Cube安全沙箱的控制面功能开发设计及大规模高可用高性能保证;
2.负责腾讯云Cube安全沙箱控制面的可持续优雅设计及敏捷迭代能力建设;
3.探索定义面向Agent Infra的控制面抽象, 原生具备系统级的快照回滚和分支探索能力。
岗位要求:
1.本科及以上学历,拥有丰富的大规模基础设施控制面研发运营经验,熟悉 Kubernetes 等大规模控制面系统;
2.对性能和优化有敏锐的洞察力, 追求持续性的优雅设计和抽象;
3.对新技术有强烈的好奇心,并能迅速形成新技术和现有系统结合的可落地路径;
4.有良好的自驱力和团队合作能力,有把事情做到极致的追求…
招聘城市:深圳
…方案,保障多租户场景的服务稳定性;
4.基于业务负载特征构建资源预测模型,推动弹性调度与容量管理的智能化演进;
5.参与多模态集群统一管控平面的建设,提升整体运维效率与可观测性;
6.探索 AI/ML 技术在调度优化、异常识别、根因分析等场景的工程化落地。
岗位要求:
1.3 年以上分布式系统、云原生基础设施或数据库内核研发经验;
2.深入理解分布式调度系统原理,有 Kubernetes 调度器、云数据库管控系统或大规模资源管理平台(如 Yarn、Mesos)的开发经验;
3.有元数据管理、分布式 KV 存储(如 etcd、TiKV)或 Catalog 系统的设计与开发经验;
4.熟悉负载预测、容量规划或在线资源优化相关方向,有实际工程落地经验;…
招聘城市:北京,上海,杭州
…部、集群调度、GPU虚拟化、故障快速恢复、存储&网络加速等手段,提升大规模GPU集群的整体使用效率。
2、负责构建面向大模型训练、微调、推理、部署全流程LLMOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路稳定高效地落地。
3、持续关注业界最新的GPU资源调度相关技术动态,探索建设业界领先的资源调度策略及方法,构建下一代大规模AI资源调度系统。
任职要求:
任职资格:
1、熟悉云原生生态及工具,如Kubernetes、Kubeflow、Volcano等,有GPU虚拟化、GPU集群调度、故障容错、高速存储/网络等经验优先;
2、了解大模型基本概念及训推生命周期,如预训练、微调、对齐、推理、部署等基本概念及流程,能够支撑大模型平台构建&优化即可;
3…
招聘城市:深圳
岗位职责:
1.负责 deepseek 等AI大模型在 K8s 上的推理部署方案研发,深度对接客户场景;
2.负责AI Infra相关能力在TKE的落地,如AI 相关工作负载的设计与研发,降低用户使用成本;
3.通过优化 AI 部署的计算、网络、存储相关资源,提升训练及推理效率;
4.负责推理稳定性、亲和性调度、推理框架优化、GPU池化等相关工作,降低推理成本,提升推理效率。
岗位要求:
1.本科及以上学历,5年及以上相关工作经验;
2.熟悉Kubernetes生态,对Kubernetes源码有了解,具备 K8s Operator 相关开发经验优先;
3.熟悉 AI 训练、微调、推理等各个环节,熟悉主流大模型推理框架,如triton、vllm、lightllm、ollama、sglang等优先;
4.熟悉GPU、 CUDA 、 RDMA 、 NCCL 等相关技术优先,熟悉KubeFlow 、 Ray等相关…
招聘城市:深圳
…云计算相关产品功能设计及实现。
岗位要求:
1.本科及以上学历,计算机相关专业,扎实的计算机专业基本功;
2.具备3年及以上工作经验,拥有良好的编码习惯,熟练使用相关领域的常见开源框架,开发语言不限,精通Python者优先;
3.熟悉Linux内核基本原理,掌握分析、调优工具,有分布式、虚拟化、虚拟网络、OpenStack、Kubernetes、Docker、libvirt/QEMU/KVM等相关开源软件经验者优先;
4.对云计算领域有浓厚的兴趣,具备优秀的技术工程架构能力、学习能力、协同沟通能力、优秀的分析问题和解决问题的能力,对解决技术难题充满激情和乐于分享的意识。
加分项:
1.在同等条件下,通过腾讯云认证或取得同等资格认证的候选人,我们会优先考虑。
招聘城市:北京
…2.设计和开发混沌工程实验,通过引入混沌来测试系统的鲁棒性和稳定性;
3.负责解决容灾和混沌工程开发过程中遇到的技术难题,保证产品的质量和性能;
4.负责中间件的稳定性,运维效率,多AZ高可用容灾能力等的建设工作。
岗位要求:
1.熟悉 Golang 开发,3年及以上使用经验,有后端或系统软件开发经验,并有项目落地;
2.熟悉容灾和混沌工程等高可用相关概念和技术,具有相关工作经验者优先;
3.具有基于kubernetes进行中间件、数据库等有状态应用管理经验者优先;
4.对常用开源中间件(如kafka、zookeeper、elasticsearch等)的内部工作原理比较熟悉,及有稳定性建设经验者优先;
5.具备较强…
招聘城市:北京
…式存储与计算资源的协同调度,有效解决大规模训练任务中的性能瓶颈,提升整体计算效率;
3.基于Kubernetes、Docker等云原生技术,构建高可用调度框架,全面支持分布式训练框架,实现任务编排、容灾与混部能力,并深入K8s调度器、CSI插件及CRD的开发,推动大规模训推技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动技术与平台能力的升级和创新。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下…
招聘城市:深圳
…优化RDMA高速网络、分布式存储与计算资源的协同调度,有效解决大规模训练任务中的性能瓶颈,提升整体计算效率;
3.基于Kubernetes、Docker等云原生技术,构建高可用调度框架,全面支持分布式训练框架,实现任务编排、容灾与混部能力,并深入K8s调度器、CSI插件及CRD的开发,推动大规模训推技术的实际落地;
4.积极探索混合云、虚拟化、ARM异构计算等前沿方向,不断推动。
岗位要求:
1.熟练掌握Go/Python/C++至少一门编程语言,精通数据结构和算法,具备扎实的编程基础和问题解决能力;
2.熟悉Kubernetes核心组件(调度器/网络/存储)、容器运行时及CRD开发,具备丰富的大规模集群调优经验,能够有效应对复杂环境下的调度需求;…
招聘城市:深圳
…卡级 GPU 集群全局资源调度体系的战略规划与架构设计,通过构建动态资源画像、智能负载预测及精细化调度策略,实现资源利用率显著提升,保障离线训练与在线推理任务的高效稳定运行;
2.深入解析 RDMA 协议栈、分布式存储 IO 路径与计算资源的协同机制,定位并攻克大规模训练任务中的网络瓶颈、存储延迟等性能卡点,优化数据流转全链路吞吐量,支撑超大规模模型高效训练;
3.基于 Kubernetes、Docker 等云原生技术栈,主导高可用调度框架的架构设计与核心模块开发,深度适配分布式训练框架(如 Megatron-LM、DeepSpeed)需求,实现任务智能编排、自动化容灾与混合部署能力;深入 K8s 调度器源码级优化、CSI 插件定制开发及 CRD 扩展设计…
招聘城市:深圳
岗位职责:
1.负责公司研发、测试平台产品需求的架构设计和开发工作;
2.对接公司各事业群的研效平台,负责各对接平台的运营支持与用户问题的解决;
3.参与研发效能建设,了解行业风向,提升研发效率和质量,分享有价值的内容。
岗位要求:
1.本科及以上学历,五年以上IT方面工作经验,有研发平台工作经验优先;
2.精通Docker容器技术原理和运行机制、Kubernetes体系架构的原理和运行机制;
3.精通go、python开发设计后台程序,熟悉shell、前端开发vue优先;
4.熟悉DevOps的理念,熟悉敏捷开发、持续集成持续交付等实践,了解Git、Ansible、Prometheus 、Jenkins等常用工具链;
5.熟悉云平台相关技术、paas中间件、分布式系统、高可用、高并发技术;
6.软件知识结构…