牛大妈在社招职位搜索混元大模型平台全栈开发工程师深圳 北京 有 7 条结果

招聘城市:深圳
…一站式平台前端架构与研发:负责模型一站式平台的前后端链路研发工作,覆盖模型训练、效果评测、服务部署、数据管理、权限管理等核心模块的建设与迭代。主导平台前端架构设计,构建高复用、可配置、可扩展的组件化与模板化体系,持续提升平台研发效率与用户体验;
2.复杂交互与可视化能力建设:负责模型训练监控、评测看板、任务流编排、模型对比等复杂交互页面的开发与优化。设计并实现与模型训练、推理、评测等后端服务的高效通信方案,处理流式数据、实时状态同步等高并发场景;
3.通用能力沉淀与工程化升级:沉淀组件库、公共模块及工程化能力,推动平台能力标准化和…
招聘城市:深圳
…AI 训练集群稳定性治理成功案例者优先;
6.具备优秀的技术领导力与跨团队协作能力,能主导复杂技术项目落地;拥有清晰的逻辑思维与表达能力,善于沉淀技术经验并推动团队技术成长;
7.对技术有极致追求,有较强的问题驱动能力与创新意识,了解行业主流模型训练基础设施技术(如 DeepSpeed、FSDP、Slurm 等)者优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更多协作团队拓展新的思考。我们也珍视你的挑战精神,同时欢迎你一起…
招聘城市:西安
…AI模型训练与推理场景,保障高并发、高可用、灵活扩缩容的云原生服务能力;
2.基于Kubernetes构建容器化调度框架,优化AI任务资源调度策略,提升GPU等异构算力利用率,支撑万亿级参数模型的分布式训练需求;
3.开发AI平台核心组件,包括任务编排、监控告警、日志分析等模块,推动平台自动化与智能化运维能力建设;
4.结合腾讯云星脉高性能网络、向量数据库等底层技术,优化AI任务的链路性能,降低训练与推理延迟;
5.参与AI模型(如模型)的工程化落地,提供分布式训练框架支持,解决模型部署中的性能瓶颈与资源管理问题1;
6.探索AI与云原生技术的结合,推动模型量化…
招聘城市:深圳
…网络基础,有高并发分布式系统实践优先;
3.熟悉云原生技术:K8s、Docker、微服务、RPC/HTTP、消息队列、数据库、缓存,有云厂商或中间件研发经验优先;
4.了解模型流程:训练、微调、RAG、推理引擎、量化、蒸馏、向量数据库等,有MaaS/LLM Inference服务开发经验优先;
5.熟悉AI Infra:GPU使用与优化、异构算力纳管、分布式任务调度、性能压测与调优,有大规模模型服务上线运维经验优先;
6.具备良好的系统设计、问题定位与跨团队协作能力,能独立负责复杂模块 / 系统,执行力强;
7.对AGI与MaaS有强烈热情,学习能力强,关注、DeepSeek 等主流模型及行业竞品,愿意长期深耕 AI 工程化领域;
8.有AI 安全合规…
招聘城市:北京
…并实现 Agent 执行链路的 tracing & observability 系统;
2.参与构建 Agent 质量评估体系:自动化 eval pipeline、A/B testing、regression detection;
3.开发 Agent debugging 工具;
4.参与核心支撑平台(标注、SBS 评测、数据管道)的架构设计与开发
5.和 AI 研究团队零距离,能第一时间触碰最新的模型能力,并与团队紧密协作,将模型与 Agent 协同进化的研究成果工程化落地;
6.探索并实践 AI Agent的日常工作流。
岗位要求:
1.使用 Cursor / Claude Code / Codex 等进行重度编程,对 agentic coding 的能力边界和 failure mode 有切身的体感;
2.极客精神,喜欢折腾新技术,享受新技术带来的生产力突破,拥有一定的工程能力和系统设计功底;
3.熟悉 AI/Agent 技术,了解 LLM…
招聘城市:深圳
…挖掘,覆盖top的数据来源和渠道;
3.负责系统的建设,优化数据调度、抓取、解析、存储流程;
4.帮助团队攻克各种数据开发技术难关,提升数据系统的效果与性能。
岗位要求:
1.出色的分析问题,解决问题能力,能从纷繁复杂的数据中分析出问题本质;
2.熟悉主流数据开发技术及框架工具;
3.熟悉Python/Go/C++其中一种语言,具备扎实的编码能力;
4.熟悉常见数据对抗疯狂策略,并具备相关的实战经验;
5.熟悉传统机器学习模型、数据统计模型、熟悉使用一种或几种深度学习框架(如tensorflow、pytorch),熟悉hive/spark/flink/mr等分布式计算编程者更优;
6.加分项:逆向、混淆、脱壳、分布式、数据分析、数据挖掘;
7.有模型数据开发和负责整体工作者优先。
招聘城市:北京
…序列并行、MoE 路由与专家并行的工程约束;
7.熟悉模型研发流程,理解各训练阶段的数据形态、资源特征与失败模式;具备在既有基础设施之上构建抽象层的经验,能说明能力边界的划分依据与取舍过程;
8.具备矩阵型组织中的技术决策与推动能力,以平台能力的实际使用规模与效率提升衡量交付成果。
加分项:
1.有万卡级训练集群建设或运营经验,或异构算力适配与统一调度经验;
2.有 RL 训练链路工程化经验,包括训推部编排、权重同步、工具沙箱环境管理;
3.有模型评测体系、数据血缘或数据管理系统的建设经验;
4.主导过多平台整合、技术收敛或大规模系统迁移;
5.在 PyTorch…