招聘城市:北京,上海
岗位职责:
【业务介绍】
作为公司统一的模型训练引擎团队,支撑公司内所有搜推广类业务的训练工程侧工作,包括模型训练、参数服务器、特征样本流水线等,通过引擎能力的持续建设结合多元异构算力为业务提供高效、灵活、稳定的搜广推模型服务。
为公司核心的搜广推业务提供关键的模型训练引擎支撑,解决超大规模稀疏特征训练的核心问题,不断挖掘异构硬件算力,为公司搜广推业务增长提供保障,并获得快速的成长与提升。
【岗位职责】
1、负责小红书搜广推业务线的机器学习训练框架的研发与迭代,核心支持公司所有相关业务场景;
2、深入参与分布式训练、自动并行化、参数服务器、特征样本流水线等…
招聘城市:深圳
…
1. 掌握机器学习基本原理和工程链路,熟悉数据工程、模型训练、模型推理等流程,具有MLOps相关平台实际开发经验,有大规模搜/广/推工程平台研发经验者优先。
2. 具备丰富的分布式系统开发经验,掌握负载均衡、容灾备份、数据库查询优化、缓存、消息队列等技术与系统。
3. 熟练掌握Java/Go/Python至少一种编程语言,具有良好的软件设计、和代码开发能力。
4. 熟悉Spring Boot、VUE、MySQL等框架组件,了解PyTorch/Megatron/VERL等机器学习框架。
6. 良好的沟通和团队协调能力,具备较好的自驱力,学习能力。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有…
招聘城市:深圳
…至少一种主流编译器框架(如 Triton/TileLang、TVM、MLIR等)的使用和开发;
4.熟悉深度学习框架(如 TensorFlow、PyTorch 等)的原理和使用,了解深度学习模型的训练和推理过程;
5.了解硬件架构(如 CPU、GPU、DSA 等)基本原理,能够针对不同硬件平台进行性能优化;
6.参与过大型编译器项目或在开源编译器项目中做出贡献的开发者优先考虑。
加分项:
1.发表过编译器相关顶会论文(PLDI、CGO、ASPLOS、POPL等);
2.熟悉异构计算编译(CUDA、SYCL、OpenCL)或AI编译器(如XLA、Torch Compile、Triton、TileLang、智源Flag项目);
3.有AI、搜广推等业务场景生产经验,或异构芯片平台使能经验。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家…
招聘城市:上海,北京
…训练框架(基于PyTorch等)的研发与优化,重点解决千卡乃至万卡级别集群的扩展性、容错与性能瓶颈问题;
2、负责训练系统中关键组件的设计与开发,包括但不限于大规模分布式参数服务器、高性能嵌入向量(Embedding)训练与推理、高效的优化器实现等;
3、深入系统底层,利用高性能网络(如RoCE v2, InfiniBand)、RDMA技术以及NVMe SSD存储,优化数据读取、通信和Checkpoint存储等关键路径,实现极致的端到端训练性能;
4、与算法团队紧密合作,理解前沿模型(如大语言模型、推荐系统、多模态模型)对训练基础设施的需求,并将其转化为系统级的创新与优化;
5、负责GPU/XPU计算资源的精细调度与性能优化,深入挖掘硬件潜力,降低训练…
招聘城市:上海
…多卡/多机训练和推理的可扩展性,支持超长行为序列建模和参数scaling up的持续迭代;
搜推工程团队致力于构建下一代智能内容分发系统,让用户发现更多“感兴趣”的内容。加入我们,用技术创造快乐,一起构建支撑亿万年轻人内容消费的智能引擎,在B站实现你的技术理想。
工作要求:
✓计算机相关专业本科及以上学历,具备扎实的C++/Python编程功底;
✓有大规模搜广推模型训练或推理的成功经验,了解PyTorch/TensorFlow等框架的底层原理;
✓有异构计算经验,熟悉GPU高性能计算,熟悉编译优化技术(TVM、TensorRT、XLA等)在模型推理中的应用;
✓深入理解千亿参数DNN模型的分布式训练和高性能推理技术,有…
招聘城市:上海,北京
…式系统或高性能计算相关开发经验(存储、并发、网络)。
2. 有一线互联网公司有参数服务器或大规模稀疏模型推理系统研发经历,深入理解并拥有大规模参数服务和分布式系统的实践经验,熟悉其架构、一致性协议与性能调优。
3. 参与推理/训练参数服务器的迭代优化,优化GPU PS embedding 相关功能,包括不限于参数更新 / 存储 / 索引构建等模块升级与运维。
4. 熟悉高性能网络技术(RDMA、RoCE、DPDK)及内核旁路优化,有异构计算(GPU/XPU)在参数服务器中应用的经验,对搜推广检索系统和模型有深入了解。
5. 熟悉至少一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现。
6. 在顶级会议(OSDI、SOSP、NSDI…
招聘城市:深圳
…
3. 深入理解 PyTorch/TensorFlow 等主流深度学习框架的底层运行机制(有向无环图优化、内存管理、算子分发等),有定制修改框架底层源码经验者优先。
4. 熟悉 GPU 体系结构,熟练使用 CUDA / C++ 编写高性能算子;熟悉 TensorRT、Triton 等推理加速工具链;具备丰富的性能 Profiling 及瓶颈分析经验。
5. 分熟悉分布式系统的核心理论,深入理解 NCCL、MPI 等通信协议;有 Megatron-LM、DeepSpeed、HugeCTR 等大规模分布式训练框架实战经验者尤佳。
6. 了解互联网广告/推荐系统的基本业务链路,熟悉常见的搜广推模型结构(如 DCN、DIN、Transformer 等)。
加分项:
1. 在顶级会议发表过推荐算法相关论文。
2. PyTorch, DeepSpeed, vLLM 等知名开源 AI 框架的活跃贡献者(Contributor/Committer)。
岗位介绍:
渴望…
招聘城市:深圳
…
3. 深入理解 PyTorch/TensorFlow 等主流深度学习框架的底层运行机制(有向无环图优化、内存管理、算子分发等),有定制修改框架底层源码经验者优先。
4. 熟悉 GPU 体系结构,熟练使用 CUDA / C++ 编写高性能算子;熟悉 TensorRT、Triton 等推理加速工具链;具备丰富的性能 Profiling 及瓶颈分析经验。
5. 分熟悉分布式系统的核心理论,深入理解 NCCL、MPI 等通信协议;有 Megatron-LM、DeepSpeed、HugeCTR 等大规模分布式训练框架实战经验者尤佳。
6. 了解互联网广告/推荐系统的基本业务链路,熟悉常见的搜广推模型结构(如 DCN、DIN、Transformer 等)。
加分项:
1. 在顶级会议发表过推荐算法相关论文。
2. PyTorch, DeepSpeed, vLLM 等知名开源 AI 框架的活跃贡献者(Contributor/Committer)。
岗位介绍:
渴望…
招聘城市:北京
…价值。
岗位职责:
1. Agent系统架构:微信生态下生活服务Agent全链路系统设计与开发——Harness框架、上下文治理、工具编排、长程规划、自我纠错等
2. 规模化落地:与产品协作,对接美团丰富的业务场景,推动Agent能力多场景规模化应用
3. 前沿探索:多智能体协作、Skill自进化、推理成本优化
4. 后训练与飞轮:SFT/DPO/GRPO落地生活服务场景,构建评测体系,打通线上反馈→数据→训练闭环
任职要求:
1. 动手能力强,能独立设计和交付复杂系统,有搜广推大型系统经验优先
2. 有Agent系统或对话系统完整项目经验
3. 对LLM原理和Agent决策有理解,愿意跨工程与算法边界
4. 有好奇心,敢想敢做,能扛事
5. 加…