招聘城市:北京,上海
…参与AI平台大模型推理部署等流程及工具的研发建设,完善平台现有功能。
2、参与AI平台Quota管理模块的开发,实现多机房、多集群环境下的,各种异构计算资源的配额管理功能。
3、参与AI平台联邦调度能力的设计和开发,与下游云原生团队共同实现平台联邦和弹性部署能力。
任职要求:
1、计算机/软件工程相关专业在校生,熟悉Go/Python/Java至少一门语言
2、了解Linux系统及算法基础,熟悉MySQL/Redis等组件使用
3、了解 Kubernetes 架构和生态,有一定的云原生机器学习系统实践和开发经验;
具备快速学习能力,能持续跟踪AI基础设施技术动态
加分项
1、接触过Mesos、Yarn、Argo、Volcano 等云原生技术
2、熟悉大模型推理基本原理,拥有使用…
招聘城市:北京,上海
…模型推理部署等流程及工具的研发建设,完善平台现有功能。
参与AI平台Quota管理模块的开发,实现多机房、多集群环境下的,各种异构计算资源的配额管理功能。
参与AI平台联邦调度能力的设计和开发,与下游云原生团队共同实现平台联邦和弹性部署能力。
任职要求:
任职要求:
计算机/软件工程相关专业在校生,熟悉Go/Python/Java至少一门语言
了解Linux系统及算法基础,熟悉MySQL/Redis等组件使用
了解 Kubernetes 架构和生态,有一定的云原生机器学习系统实践和开发经验;
具备快速学习能力,能持续跟踪AI基础设施技术动态
加分项:
接触过Mesos、Yarn、Argo、Volcano 等云原生技术
熟悉大模型推理基本原理,拥有使用 vLLM/TensorRT-LLM等推理框架部署大模型…
招聘城市:北京,上海,杭州
…的基座模型,降低部署成本。同时通过融合的方式,对多场景数据进行综合建模,提升多场景的Embedding&标签效果。
统一基座模型需要解决的核心技术难点包括:
1、基座统一但仍可支持业务的定制微调,且训练成本和推理成本较低;
2、多体裁内容(如笔记、直播、商品、Query等)的理解可以融合在一个统一模型,且效果比独立训练更好。
研究方向会针对要解决的问题设立,包括:基于多Head或MoE的轻量化微调及融合推理、多体裁内容形式的统一建模。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟悉Python等至少一门编程语言;
3、熟悉大模型领域…
招聘城市:北京,上海,杭州
…的基座模型,降低部署成本。同时通过融合的方式,对多场景数据进行综合建模,提升多场景的Embedding&标签效果。
统一基座模型需要解决的核心技术难点包括:
1、基座统一但仍可支持业务的定制微调,且训练成本和推理成本较低;
2、多体裁内容(如笔记、直播、商品、Query等)的理解可以融合在一个统一模型,且效果比独立训练更好。
研究方向会针对要解决的问题设立,包括:基于多Head或MoE的轻量化微调及融合推理、多体裁内容形式的统一建模。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟悉Python等至少一门编程语言;
3、熟悉大模型领域…
招聘城市:上海,北京
岗位职责:
核心职责
参与小红书大模型平台推理部署等流程及工具的研发建设,完善平台现有功能
参与平台Quota管理模块的开发,实现多机房、多集群环境下的,各种异构计算资源的配额管理功能
参与平台大模型训练/压缩/推理/数据集/资源调度等流程及工具的研发建设
任职要求:
任职要求
计算机/软件工程相关专业在校生,熟悉Go/Python/Java至少一门语言
了解Linux系统及算法基础,熟悉MySQL/Redis/MQ等组件使用
熟悉 Kubernetes 技术栈,有一定的云原生机器学习系统实践和开发经验
有大模型部署经验,对 vLLM/SGLang/Dynamo 等至少一种推理框架有使用经验
具备快速学习能力,熟练使用 Git,熟练使用 github copilot/cursor 等 AI 编程工具
加分项
接触过…
招聘城市:北京,上海,杭州
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
招聘城市:上海
…异常检测、服务器故障定位,支撑大模型训练、分布式算力业务稳定高效运行
1.参与大规模 GPU 集群日常压测、基线梳理、运维保障,配合完成集群扩容、版本升级、环境标准化工作;
2.基于 Prometheus、Grafana、DCGM 等工具搭建集群监控大盘,输出性能报表、故障分析报告与优化方案;
3.编写 Shell/Python 自动化脚本、运维 SOP、故障处理手册,沉淀技术知识库;
4.协同算法、平台、网络团队,联动定位集群全链路问题,保障大模型训练、分布式任务稳定运行;
5.跟踪 GPU 集群、RDMA 网络、分布式通信前沿技术,持续优化集群架构与运行效率。
职位描述
工作职责:
面向高性能 GPU 大卡集群、AI 训练 / 推理集群,聚焦集群全栈性能优化、网络异常检测、服务器故障定位,支撑大模型训练、分布…
招聘城市:北京
…模型效果”的分析与归因框架。
2.探索面向预训练的数据价值建模方法,包括自动化质量评估、样本筛选、语义去重、污染检测、覆盖度建模、长序列数据组织与高价值 token 挖掘。
3.研究 Data Mixture、动态配比、课程学习和多阶段训练策略,分析不同类型数据在不同模型规模、训练阶段和能力维度上的边际收益,提升 token efficiency 与 scaling efficiency。
4.探索合成数据、蒸馏数据、模型自生成数据和反馈数据在预训练中的有效使用方式,研究合成数据的有效性、多样性保持、退化机制和训练配比策略。
5.构建可复现、可扩展的大规模数据处理与实验闭环,将数据构建、训练验证、能力评测、数据诊断和策略更新结合起来,形成面向基础模型持续迭代的数据飞轮…
招聘城市:北京,上海
…实现多种模态的基座和推理模型的高效稳定训练。
2.面向多种算力、网络环境和应用场景,设计并实现高性能的模型推理架构,应用量化、剪枝等模型压缩方法,持续降低推理成本。
3.通过手工优化方法,对特化模型子结构和硬件设备上实现SOTA性能,持续迭代基于编译的优化方案,提升通用优化的适用性、优化效果以及对新硬件的覆盖能力。
4.管理及优化全公司算法团队硬件资源,通过算法预估与启发式策略,对全公司万级别节点的大规模GPU/CPU集群构建精细化调度服务能力,持续提升资源使用效率。
【为什么是我们】
1.业界前列的算力规模,海量数据和丰富的应用场景,挑战与机遇并存。
2.协同算法团队深度参与大模型项目…
招聘城市:北京,上海
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
招聘城市:北京,上海,杭州
…探索新一代大语言模型基座架构,完成扩散模型(diffusion model)在大语言模型的重塑,突破逐个token预测的方式,实现高效的推理模式,探索全新scaling law;
2、实现大模型训练的数据清洗、合成和评估;设计和实现大模型训练的AI Infra框架。
任职要求:
1、本科及以上学历,计算机、人工智能和数学等相关专业;
2、熟练掌握扩散模型设计和使用技巧,在知名大模型公司/团队从事图像或视频生成者优先,有多模态/OMNI大模型理解&生成统一框架经验者优先;
3、有丰富的大模型预训练和后训练数据处理经验,熟练掌握数据收集、数据清洗、数据去重和数据合成等流程,能针对数据质量制定出评估指标和方法,在知名大模型公司/团队长期…
招聘城市:北京,上海,杭州
…探索新一代大语言模型基座架构,完成扩散模型(diffusion model)在大语言模型的重塑,突破逐个token预测的方式,实现高效的推理模式,探索全新scaling law;
2、实现大模型训练的数据清洗、合成和评估;设计和实现大模型训练的AI Infra框架。
任职要求:
1、本科及以上学历,计算机、人工智能和数学等相关专业;
2、熟练掌握扩散模型设计和使用技巧,在知名大模型公司/团队从事图像或视频生成者优先,有多模态/OMNI大模型理解&生成统一框架经验者优先;
3、有丰富的大模型预训练和后训练数据处理经验,熟练掌握数据收集、数据清洗、数据去重和数据合成等流程,能针对数据质量制定出评估指标和方法,在知名大模型公司/团队长期…
招聘城市:北京,上海,杭州
…部署成本及维护代价。更关键的是,模型间存在“知识壁垒”——图像生成模型无法直接复用理解模型对业务商品逻辑的深刻认知,而推荐系统也无法享受到生成模型内部丰富的多模态精细化特征。
因此,我们希望构建一套真正的多模态统一基座模型,实现输入端图文交错混合理解,输出端兼顾“高质量表征提取”、“文本生成”以及“图像生成”。通过底层世界知识的共享,实现降本增效,并利用多模态理解任务倒逼生成测能力的提升,产生图像生成能力增益效果。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟悉Python等至少一门编程语言;
3、熟悉大模型领域尤其是强化…
招聘城市:北京,上海
岗位职责:
工作职责:
1、参与千亿级大模型的分布式强化学习 RL 训练框架研发,提升百卡~千卡级训练吞吐与资源利用率
2、参与 100B以上多模态强化学习算法流程适配(如DAPO等),各领域任务的 RL 正确性验证
3、实验并调优不同并行策略(Tensor/ZeRO/FSDP/Pipeline Parallelism)在超大规模模型上的最佳配置组合
4、协助定位分析分布式训练中的关键性能瓶颈(如GPU利用率低、显存瓶颈、网络通信阻塞、I/O延迟等),设计并实施优化方案进行验证。
5、参与研发/优化训练引擎的关键特性,如大规模集群下的稳定断点续训、高性能异步Rollout机制、以及高性能算子(Kernel)的集成与优化。
任职要求:
任职资格:
1、优秀的代码…
招聘城市:深圳,其它
…Bullet、Gazebo 等物理仿真引擎,熟悉 ROS 通信;
4、熟悉常见机器?本体部署、测试,具备 sim2real 经验;
5、熟练掌握 C++/python 编程语言,熟悉 PyTorch/TensorFlow 等深度学习框架使用方式,精通 Ubuntu Linux 开发环境,具有较强编程能力,熟悉 git, docker, CI 等开发工具;
6、具备良好的团队合作和沟通能力,能够与其他团队成员协作开发和调试软件程序,对前沿技术保有浓厚的兴趣。
企业简介
诺亦腾机器人(Noitom Robotics)是一家面向具身智能与人形机器人产业的数据公司,以“数据”为核心交付界面,为机器人企业、具身智能模型团队等提供高质量、可规模化的训练数据与相关基础设施能力。从数据基础设施这一底层环节切入,构建以数据获取、处理、交付与长期利用…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1.参与大规模MoE模型的持续预训练(CPT):数据清洗与混合策略、训练调优与结果分析
2.参与RLVR/RLAIF强化学习训练流程:数据构建、reward shaping、训练调优
3.参与多语种机器翻译(MT)方向:语料处理、模型微调、评测
4.参与Long horizon agentic RL(长程智能体强化学习)方向:搭建复杂交互环境与任务流、多步骤推理轨迹(Trajectory)收集、Reward设计与策略网络优化
5.编写实验脚本、构建评测工具,支持模型上线前的质量验证
工作要求:
面向2027届海内外本硕博毕业生(2026年9月-2027年8月期间毕业)
1. 深度学习基础扎实,熟悉当前主流LLM架构
2. 熟悉常见大模型训练框架(Megatron/DeepSpeed/Verl)
3. 有LLM相关项目经验:CPT、SFT、RL 任意…
招聘城市:上海
…中保持极高可用性。
2. 推理加速与工程化 (Inference Infra)
高性能引擎: 负责基于 vLLM、TensorRT-LLM、SGLang、Triton Inference Server 等推理框架的开发与优化,提升大模型在线服务的吞吐、时延和资源利用率。
算子优化: 参与 Transformer 核心算子的开发与性能优化,包括 Attention、KV Cache、量化推理、算子融合等方向,探索 CUDA/Triton 等高性能实现方案。
推理架构: 参与构建面向大规模生产环境的推理服务体系,支持高并发、低延迟和高可用的模型服务部署与运维。
3. 存储与算力管理 (Storage & Compute)
I/O 优化: 优化超大规模数据集的加载速度,解决训练过程中的存储带宽瓶颈(如利用 GPFS, Lustre 或 JuiceFS)。
稳定性保障: 构建大规模集群故障检测、自动恢复与容灾体系…
招聘城市:北京,上海
…学习模型高性能AI Infra服务。主导SOTA AI Infra架构设计与核心模块开发,支撑AI业务在大规模多模态生成式搜广推等前沿场景上规模落地。
1、参与开发支持下一代多模态生成式搜广推超大规模(百亿-万亿级)模型的GPU千卡互联分布式训练框架。
2、与公司算法同学深度合作,为重点项目进行算法与训练框架的联合优化。
3、支撑业界领先的多模态模型在国内最大的生活兴趣社区上落地。
任职要求:
【岗位要求】
1. 有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具。
2. 熟悉C/C++/CUDA,具备扎实的系统底层能力(内存、并发、网络)。
3. 有大规模分布式系统开发和优化经验;有大模型分布…
招聘城市:北京,上海,杭州
岗位职责:
深入研究和应用AI大模型技术,对工程架构做全面设计,推动架构智能化升级,确保系统具备高扩展性、高稳定性和高性能,以适应不断变化的业务需求和数据量的增长。
任职要求:
1、不限年级,本科及以上在读,人工智能/计算机/软件工程等相关专业优先;
2、具备优秀的代码能力、数据结构和基础算法功底,熟练掌握C/C++、Python等一个或多个编程语言;
3、熟悉大模型相关的算法和技术,有自然语言处理、大模型训练、强化学习算法经验者优先;
4、在软件工程或者人工智能领域有出色的科研经历,在NeurlPS/ICRL/ICML/ISSTA/ACL/EMNLP等国际顶级期刊会议上发表论文者优先;
5、良好的沟通协作能力,责任心强,积极…
招聘城市:广州
…年以上?作经验,1年以上?模型基础设施、训推平台运维相关?作经验; 2、熟悉Linux系统常?操作命令,能独?完成?模型部署、训推平台搭建、GPU资源管理与监控; 3、了解主流?模型(如deepseek、ChatGLM等)的部署架构与运维要点,熟悉容器化部署(Docker、K8s)者优先; 4、具备良好的技术学习能?与问题排查能?,能快速适配?模型基础设施相关技术迭代需求; 5、具备基础的技术带教与分享能?,能协助培养团队?模型基础设施相关技术?才; 6、?作责任?强,具备良好的沟通能?,能对接?商与团队内部推进?作落地,严格遵守?内信息安全与运维规范。 优先条件 1、有银?、?融?业?模型基础设施搭建、训推平台运维相关?作经验者…