牛大妈在校招职位搜索Prometheus 有 21 条结果

招聘城市:新加坡
岗位职责:
Business Unit
What the Role Entails
You will support the reliability, scalability, and security of Tencent’s business-critical systems in a cloud-native environment:
System Monitoring & Incident Response
a. Monitor production systems using tools like Prometheus/Grafana; identify and troubleshoot outages.
b. Participate in on-call rotations to resolve real-time incidents (with mentor guidance).
Automation & DevOps Practices
a. Develop scripts (Python/Shell) to automate deployment, scaling, and recovery tasks.
b. Assist in CI/CD pipeline optimization using GitLab, Docker, and Kubernetes.
Infrastructure Optimization
a. Analyze system performance metrics; propose solutions to enhance reliability and cost efficiency.
b. Support cloud infrastructure management (Tencent Cloud/AWS/Azure).
Collaboration & Documentation
a. Work with cross-functional teams (Dev, Data, Security) to design SLOs/SLIs for critical services.
b. Document system configurations, runbooks, and post-incident reports.
Who We Look For
Currently pursuing a PhD or Master’s in Computer Science…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
- 协助团队搭建和维护可观测平台,包括日志采集、指标监控、链路追踪相关组件的部署与调试(如Prometheus、Grafana、Jaeger等)。
- 协助进行监控告警规则的梳理、优化,参与日常告警排查,整理问题处理手册,提升告警准确性和处理效率。
- 协助开发可观测相关工具或脚本,优化数据采集、分析流程,提升团队运维效率。
- 参与可观测平台的需求讨论、测试验证,收集用户反馈,协助输出产品优化建议。
- 整理可观测相关技术文档、操作手册,协助完成团队知识库搭建。
- 配合团队完成其他与可观测相关的辅助工作,主动学习行业前沿技术和最佳实践。
工作要求:
- 本科及以上学历,计算机、软件工程、网络工程等相关专业。
- 具备良好的学习能力、逻辑思维能力和问题排查能力…
招聘城市:上海
…高速网络(InfiniBand/RoCE)及调度平台(Slurm/K8s)的部署与维护,保障硬件稳定与算力利用率。
2、大模型服务:基于vLLM/TensorRT-LLM部署大模型推理服务,管理API网关、限流与监控(延迟/吞吐量),支撑RAG应用及向量数据库运维。
3、监控与优化:搭建GPU/模型服务可观测性系统(Prometheus+Grafana),定位硬件故障或模型性能瓶颈,控制算力成本。
任职资格
任职要求:
1、本科及以上学历,有GPU集群或AI应用运维实战优先。
2、模型技能:亲手部署过10B以上开源模型(Llama/Qwen),熟悉vLLM/TGI参数调优。
薪资福利
五险一金
周末双休
员工体检
不定期旅游...
联系方式:
联系人:姚**
简历接收邮箱:w****@
公司介绍:
上海翌旭网络科技有限公司成立于2018年…
招聘城市:上海
…工作职责:
• 参与大模型训推平台开发,支撑千卡至万卡训练任务
• 开发任务调度系统(Kubernetes + Volcano)
• 集成分布式训练框架(Megatron-LM/DeepSpeed/FSDP)
• 构建实验管理平台(实验追踪、超参搜索、模型版本管理)
• 开发 GPU 监控、故障检测、断点续传等运维工具
工作要求:
• CS相关专业在读;
• 熟悉 Python,掌握后端框架(FastAPI/Flask/Go 均可)
• 了解 Kubernetes,有容器化部署经验优先
• 了解分布式训练原理(DP/MP/PP)优先
• 有 Linux 系统管理和 Shell 脚本经验
• 了解 Prometheus/Grafana 监控体系加分
• 有 MLflow/W&B/Kubeflow 经验加分
网申须知
网申开始日期:2026-03-05 00:00
网申截止日期:2026-06-30 00:00
仅限 2026-09 至 2027-08 毕业的大学生,快来投递吧~
投递简历
招聘城市:上海
…环境标准化工作;
2.基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案;
3.编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库;
4.协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行;
5.跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率。
职位描述
工作职责:
面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行
团队通用职责:
1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作
2、基于 Prometheus、Grafana…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
面向高性能 GPU 大卡集群、AI 训推集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行
团队职责:
1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作
2、基于 Prometheus、Grafana、DCGM 等搭建集群监控大盘,输出性能报表与优化方案
3、编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀知识库
4、协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行
5、跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与效率
岗位职责:
聚焦 RoCEv2/InfiniBand RDMA 无损网络,专职网络异常排查、故障…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行
团队通用职责:
1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作;
2、基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案;
3、编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库;
4、协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行;
5、跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率。
岗位具体职责:
聚焦 GPU 服务…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行
团队通用职责:
1、参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作
2、基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案
3、编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库
4、协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行
5、跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率
岗位具体职责:
聚焦硬件、驱动…

腾讯(tencent) Cloud Engineer Intern 107771

兼职 新加坡
招聘城市:新加坡
…as Official Accounts, Mini Programs, Weixin Pay, WeCom and search function. WXG provides solutions and connectivity for intelligent upgrades across all industries. WXG is also responsible for the development and operation of QQ Mail, WeRead and other products.
What the Role Entails
What the Role EntailsYou will support the reliability, scalability, and security of Tencent’s business-critical systems in a cloud-native environment:
System Monitoring & Incident Response Monitor production systems using tools like Prometheus/Grafana; identify and troubleshoot outages.
Participate in on-call rotations to resolve real-time incidents (with mentor guidance).
Automation & DevOps Practices Develop scripts (Python/Shell) to automate deployment, scaling, and recovery tasks.
Assist in CI/CD pipeline optimization using GitLab, Docker, and Kubernetes.
Infrastructure Optimization Analyze system performance metrics; propose solutions to enhance reliability and cost efficiency.
Support cloud infrastructure management (Tencent Cloud/AWS/Azure).
Collaboration & DocumentationWork with cross-functional teams (Dev, Data, Security) to…
招聘城市:深圳,其它
…职位要求 任职要求:1、计算机、软件工程、电子工程或相关专业本科及以上学历。2、掌握黑盒/白盒测试方法,熟练设计测试用例,掌握功能、性能、安全测试流程。3、掌握至少一门编程语言(Python/Java/JavaScript),能编写自动化脚本。4、熟悉接口测试工具、性能测试工具及缺陷管理工具。5、熟悉操作数据库(MySQL、Redis、Prometheus),能编写复杂查询。6、熟悉Linux命令、网络协议(TCP/IP、HTTP),具备环境搭建及问题排查能力。7、熟练使用抓包工具(如Fiddler、Charles)及日志分析定位问题。
政治面貌 无要求
实习实践经验 无要求
职位简介 一、薪资待遇 1、薪资待遇:具有竞争力的薪资、五险一金、绩效奖金、丰厚的季度奖金以及每年一 次的调薪机会。 2、食宿环境:双人间、独卫…
招聘城市:上海
…工作职责:
• 参与大模型训推平台开发,支撑千卡至万卡训练任务
• 开发任务调度系统(Kubernetes + Volcano)
• 集成分布式训练框架(Megatron-LM/DeepSpeed/FSDP)
• 构建实验管理平台(实验追踪、超参搜索、模型版本管理)
• 开发 GPU 监控、故障检测、断点续传等运维工具
工作要求:
• CS相关专业在读;
• 熟悉 Python,掌握后端框架(FastAPI/Flask/Go 均可)
• 了解 Kubernetes,有容器化部署经验优先
• 了解分布式训练原理(DP/MP/PP)优先
• 有 Linux 系统管理和 Shell 脚本经验
• 了解 Prometheus/Grafana 监控体系加分
• 有 MLflow/W&B/Kubeflow 经验加分
网申须知
网申开始日期:2026-03-05 00:00
网申截止日期:2026-06-01 00:00
仅限 2026-09 至 2027-08 毕业的大学生,快来投递吧~
投递简历
招聘城市:北京
…具备良好的沟通协作能力、责任心强,能适应快节奏的迭代开发。
加分项(优先考虑):
- 高校孵化的企业,工作稳定,媲美国央企;
- 有高并发、分布式系统、微服务架构设计与落地经验;
- 有GitHub项目、技术博客等;
- 熟悉容器化技术(Docker)及编排系统(Kubernetes);
- 了解 CI/CD 流程,有 Jenkins/GitLab CI 等实践经验;
- 掌握 Prometheus、Grafana、ELK 等监控与日志分析工具;
- 对前端技术栈(Vue/React)有一定了解,能高效对接前端需求;
- 有大数据平台等复杂业务系统开发经验;
- 在高水平技术会议/期刊发表论文,或在算法/编程竞赛中获奖。
岗位亮点:
- 处于业务快速增长期,项目丰富,技术挑战大,成长空间广阔;
- 技术氛围浓厚,鼓励技术创新与分享;
- 免费餐补、全天候免费饮品供应;
- 弹性工作制…
招聘城市:广州
…测试等)。 优先条件: 1、有网络运维开发经验(如 SNMP、Netconf、SSH 自动化、设备对接等); 2、 熟悉主流网络设备厂商(华为、思科、H3C 等)相关接口或协议; 3、有监控系统(如 Prometheus / Zabbix)开发或集成经验; 4、有大规模分布式系统或高并发系统开发经验; 5、有 DevOps/SRE 实践经验,熟悉 CI/CD 流程; 6、有自动化运维平台、调度系统开发经验; 7、掌握 Python语言,能够编写自动化脚本或辅助工具。
单位简介
广州南天电脑系统有限公司(以下简称“广州南天”)于1992年成立,是云南南天电子信息产业股份有限公司(股票代码000948)控股的专业子公司,公司具有二十多年建设金融行业和国家部分重点行业信息化工程的丰富经验,以软件业务、集成服务业务…
招聘城市:上海,杭州
…的创新应用。
任职要求:
任职资格
1、计算机科学、软件工程或相关专业在读本科生 / 研究生;
2、熟悉 Python 或 Java 至少一门语言,具备良好的编程习惯和工程实践能力;
3、了解常见机器学习算法(分类、聚类、异常检测等),具备基础的概率统计知识;
4、具备良好的学习能力和自驱力,乐于探索前沿技术,能够将思路转化为工程实现。
加分项
1、了解 AIOps 方向相关技术,如时序异常检测、根因定位、关联分析等算法,并有实际项目经验;
2、熟悉云原生可观测性技术体系,如 Prometheus、OpenTelemetry、ELK、SkyWalking 等;
3、对大模型应用、LLM/Agent 在运维场景的应用有所了解或有项目经验;
4、有开源社区贡献经历,或在技术博客、论文方面有公开产出。
招聘城市:北京
…具备良好的沟通协作能力、责任心强,能适应快节奏的迭代开发。
加分项(优先考虑):
- 高校孵化的企业,工作稳定,媲美国央企;
- 有高并发、分布式系统、微服务架构设计与落地经验;
- 有GitHub项目、技术博客等;
- 熟悉容器化技术(Docker)及编排系统(Kubernetes);
- 了解 CI/CD 流程,有 Jenkins/GitLab CI 等实践经验;
- 掌握 Prometheus、Grafana、ELK 等监控与日志分析工具;
- 对前端技术栈(Vue/React)有一定了解,能高效对接前端需求;
- 有大数据平台等复杂业务系统开发经验;
- 在高水平技术会议/期刊发表论文,或在算法/编程竞赛中获奖。
岗位亮点:
- 处于业务快速增长期,项目丰富,技术挑战大,成长空间广阔;
- 技术氛围浓厚,鼓励技术创新与分享;
- 免费餐补、全天候免费饮品供应;
- 弹性工作制…

广州嘉为科技有限公司 2026招聘

全职 北京,上海,武汉,其它
招聘城市:北京,上海,武汉,其它
…查看]
八、岗位详情
(一)运维开发实习生
工作职责
1、基于项目要求,进行日常巡检、故障处理等工作;
2、参与一体化运维平台的开发与优化;
3、协助建设自动化运维能力,提升系统稳定性。
任职资格
1、计算机相关专业,2027届本科;
2、熟悉Linux操作系统及常用命令,能编写Shell/Python脚本;
3、了解Docker/Kubernetes或Prometheus等监控工具者优先;
4、对AI智能体(Agent)自动处理运维场景有强烈兴趣。
?
(二)测试开发工程师
工作职责
1、根据测试需求进行功能测试、集成测试、回归测试并编写测试报告;
2、参与自动化测试平台的开发与维护,编写测试脚本;
3、协助训练AI识别业务流程Bug,提升测试覆盖率和效率。
任职资格
1、计算机相关专业…
招聘城市:帕罗奥多
…Proficient in at least one backend language (Python / Go / Node.js / Java)
● Familiar with modern frontend frameworks (Next.js / Vue / React) and TypeScript
● Knowledge of databases (MySQL / PostgreSQL / NoSQL) and Git workflows
● Understanding or project experience with AI apps, RAG, or agent frameworks
● Strong communication skills and ability to collaborate in English
Nice-to-Haves● Experience with LangChain, LlamaIndex, or Autogen
● Familiarity with Kubernetes, Docker, Prometheus, or Grafana
● Academic research, open-source, or AI project experience
Location State(s)
US-California-Palo Alto
The expected base pay range for this position in the location(s) listed above is $28.27 to $60.00 per hour. Actual pay may vary depending on job-related knowledge, skills, and experience.
This position will be eligible for 1 hour of paid sick leave for every 30 hours worked and up to 13 paid holidays throughout the calendar year…
招聘城市:广州
…日志分析等,建设运维全流程,包含部署、监控、报警,自动化,CI/CD等。
4、负责线上环境自动化巡检与故障处理。
岗位要求:
1、2026届毕业生,本科及以上学历,计算机科学、软件工程、信息技术相关专业;
2、熟悉Linux、Windows以及网络相关知识、虚拟化及Docker容器技术,掌握k8s知识,能够处理k8s集群问题。
3、熟练使用各种公有云平台使用方式,例如:阿里云、腾讯云等。
4、熟练使用prometheus、alertmanager、grafana等监控和告警组件。
5、熟悉主流运维软件,如nginx、redis、kafka、jumpserver等。熟悉常见自动化工具Jenkins、gitlab、argo等。
6、熟练掌握Shell等主流脚本开发,具有Python或Go语言开发经验。
7、具备良好的抗压能力、沟通学习能力、问题分析与解决能力。
投递说明:
简历投递…

腾讯(tencent) AI IT Engineer 106076

全职 新加坡
招聘城市:新加坡
…Next.js, Vue) & strong understanding of databases (MySQL / PostgreSQL / NoSQL), and Git workflows
●Familiarity with AI applications, RAG workflows, or agent-based frameworks is advantageous.
●Experience with tools such as LangChain, LlamaIndex, Autogen, Kubernetes, Docker, Prometheus, or Grafana is preferred.
●Understanding of IT asset management, ITSM processes (e.g., ServiceNow, Jira), and enterprise IT infrastructure is beneficial.
Why Join Us?
Work in a dynamic and collaborative environment.
Opportunity to enhance IT service delivery processes.
Be part of a growing team that supports global IT operations.
Equal Employment Opportunity at Tencent
As an equal opportunity employer, we firmly believe that diverse voices fuel our innovation and allow us to better serve our users and the community. We foster an environment where every employee of Tencent feels supported and inspired to achieve individual and common goals.
Work Location: Singapore-CapitaSky
岗位要求:
岗位要求详情请见上方岗位职责内说明
招聘城市:北京
…具备良好的沟通协作能力、责任心强,能适应快节奏的迭代开发。
加分项(优先考虑):
- 高校孵化的企业,工作稳定,媲美国央企;
- 有高并发、分布式系统、微服务架构设计与落地经验;
- 有GitHub项目、技术博客等;
- 熟悉容器化技术(Docker)及编排系统(Kubernetes);
- 了解 CI/CD 流程,有 Jenkins/GitLab CI 等实践经验;
- 掌握 Prometheus、Grafana、ELK 等监控与日志分析工具;
- 对前端技术栈(Vue/React)有一定了解,能高效对接前端需求;
- 有大数据平台等复杂业务系统开发经验;
- 在高水平技术会议/期刊发表论文,或在算法/编程竞赛中获奖。
岗位亮点:
- 处于业务快速增长期,项目丰富,技术挑战大,成长空间广阔;
- 技术氛围浓厚,鼓励技术创新与分享;
- 免费餐补、全天候免费饮品供应;
- 弹性工作制…