招聘城市:深圳
…熟悉PyTorch、Megatron等框架,掌握3D并行、ZeRO机制、Flash-Attn等的原理、使用场景、优劣势以及可优化方向;
2.熟悉使用主流推理框架,如vLLM、SGLang,掌握kvcache、量化、投机采样、算子优化等推理优化方法;
3.熟悉常见RL训练算法,如DPO、GRPO、PPO等,理解不同算法的差别和使用场景;
4.熟悉Ray框架,有Ray框架优化经验者优先;
5.熟练掌握CUDA性能优化手段,有算子编写优化项目经验者优先;
6.对大模型、强化学习前沿技术比较敏锐者优先;
7.有实际大模型RL训练,性能和效果优化经验的优先;
8.良好的沟通能力、解决问题能力。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀…
招聘城市:北京
…Agent框架的研发与维护,支持强化学习、数据生成及自动化评估等业务需求;
2.负责优化框架的易用性与稳定性,解决实际运行中的性能瓶颈,保障实验流程的高效执行;
3.支持各类外部Agent策略及评估逻辑的接入,维护相关接口与组件,确保系统的兼容性与扩展性;
4.结合大模型训练视角,配合算法团队进行新Agent范式的工程化落地与探索。
岗位要求:
1.具备扎实的Python编程能力,熟悉异步编程(Asyncio)及并发处理的最佳实践,有良好的代码规范意识;
2.熟悉大模型与Agent相关应用技术,熟练使用AI编程工具并理解其工作原理;
3.熟悉K8S及容器化技术,具备相关环境下的开发或部署经验;
4.了解大模型训练全…
招聘城市:深圳
岗位职责:
1.负责混元多模态大模型的RL后训练框架研发;
2.设计和开发高效的框架和算子,以支持各种硬件加速器;
3.参与强化学习算法的优化和实现,提高训练和推理性能;
4.跨团队协作,与算法、软件、硬件团队密切合作,提高框架性能和稳定性。
岗位要求:
1.熟悉常用的大模型训练推理框架,如PyTorch/Megatron/VLLM/Verl,有相关开发经验;
2.熟悉Docker、Kubernetes等容器和容器编排技术;
3.熟悉编译器相关技术,了解MLIR/XLA/TVM等AI编译器者优先考虑;
4.熟悉CPU/GPU硬件架构,有扎实的CUDA/OpenMP编程基础;
5.良好的团队协作能力和沟通能力,具有较强的自我驱动能力。
招聘城市:北京
…DiT模型训练性能优化经验者优先;
4.熟练掌握CUDA性能优化手段,有算子编写优化项目经验者优先;
5.对大模型前沿技术比较敏锐者优先;
6.有实际大模型的训练调参和效果评测项目经验的优先;
7.良好的沟通能力、解决问题能力。
部门介绍:
机器学习平台部负责腾讯“太极”机器学习平台的建设,构建面向搜索、广告、推荐的稀疏大模型、大语言模型及稠密大模型和通用机器学习的平台能力,为腾讯广告,微信搜索、社交、游戏、金融、云等多个业务提供易用、高效的一站式机器学习平台服务。我们的技术包括但不限于预训练大模型框架、高性能参数服务器、CPU/GPU 训练和推理加速、图神经网络、NLP自然语言处理、搜索工程与…
招聘城市:深圳
…参与后训练流程(如多模态SFT、RLHF)的搭建、优化与效果评测。关注训练稳定性、效率及泛化能力,特别是针对跨模态对齐、奖励函数设计及策略优化等环节提出系统性改进方案;
3.技术调研与瓶颈攻关:主动跟踪学术界与工业界在多模态强化学习后训练领域的前沿进展。针对训练中出现的瓶颈(如OOD泛化不足;
4.模态融合冲突等),进行根因分析,并与框架团队协作制定解决方案;
5.跨团队支持与知识沉淀:高效协同框架开发、硬件优化及业务算法团队,确保技术方案落地。撰写高质量的技术文档、设计稿与实验报告,并组织内部分享,推动团队整体技术认知提升。
岗位要求:
1.学历与技术背景:拥有计算机科学、人工智能、电子工程…
招聘城市:北京
…日志 Trace 和结果评估等核心链路;
3.熟悉 Kubernetes 和容器化技术,具备在集群环境下进行开发、部署、排障或性能优化的经验;
4.了解大模型训练流程和基本原理,包括预训练、SFT、RLHF、强化学习训练或自动化评估中的至少一类;
5.具备良好的软件工程能力,重视模块化设计、测试、日志、性能和稳定性治理;
6.具备良好的问题分析及解决能力、沟通合作能力和 owner 意识,能高频承接算法团队需求并持续迭代。
加分项:
1.熟练使用 AI 编程工具,并理解其工作原理、适用边界和工程落地方式;
2.有 Agent 框架、AI Coding CLI、强化学习环境或评测框架经验;
3.有研发效能平台、Review / Debug / Monitor、实验结果分析、问题追踪或知识库工具建设经验;
4…
招聘城市:深圳
…结构设计,并联合业务进行模型训练效率和效果验证;
3.参与文生图、文生视频、文生3D等业务的训练性能加速;
4.参与低精度训练性能优化和业务推广、参与大窗口训练性能优化。
岗位要求:
1.熟练使用主流大模型训练框架DeepSpeed、Megatron,掌握3D并行、ZeRO机制、Flash-Attn等的原理、使用场景、优劣势以及可优化方向;
2.有ViT、SD、DiT模型训练性能优化经验者优先;
3.熟练掌握CUDA性能优化手段,有算子编写优化项目经验者优先;
4.对大模型前沿技术比较敏锐者优先;
5.有实际大模型的训练调参和效果评测项目经验的优先;
6.良好的沟通能力、解决问题能力。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳…
招聘城市:北京
岗位职责:
1.负责大语言模型(LLM)强化学习场景的智能体交互环境接入与平台化:对接自研/第三方/开源环境,制定接口与数据规范,建设验证与回归机制,保障可用性、兼容性与可复现性;
2.负责智能体环境数据自动生成与流水线自动化:建设模板化/参数化生成、依赖解析、镜像构建与发布、自动化评测与回归等端到端流水线,提升交付效率与稳定性;
3.负责智能体标注能力相关研发:围绕标注任务建模、标注数据/元数据规范、版本管理与可追溯、质检与一致性校验等能力建设,并打通训练/评测链路。
岗位要求:
1.精通 Python,具备扎实的软件工程能力与系统设计能力,能在复杂系统中推进架构落地(模块化、测试、日志、性能…
招聘城市:深圳
岗位职责:
1.针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架;
2.设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题;
3.探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。
岗位要求:
1.本科及以上学历,计算机科学或相关专业;
2.具备出色的科研能力,在ICML、NeurIPS、ICLR、CVPR、ICCV、ECCV、SIGGRAPH等顶级会议发表过论文;
3.扎实的工程与编程能力,具备深度学习系统实现、模型训练与推理优化、CPU/GPU 加速、分布式训练与推理经验;
4.有扩散模型、自回归模型、文生…
招聘城市:北京
岗位职责:
1.负责TTS、ASR、声学前处理、自然语言处理、多模态大模型等AI系统的工程开发(包括训练工具和推理引擎的开发、优化、交付等);
2.负责AI系统最新算法的集成、工程化、实际场景效果验证、优化、上线;
3.负责AI相关业务、产品的工程支持,在效果和性能上更好的落地。
岗位要求:
1.本科及以上学历,计算机相关专业,本科毕业后有5年以上工作+学习的经验;
2.全面的计算机体系相关知识、基础扎实,有较好的数据结构基&算法基础,具备良好的思维逻辑;
3.精通c/c++/python语言,熟悉golang语言更佳;
4.优秀的分析与解决问题的能力,良好的沟通与团队合作能力;
5.具备一定的分布式系统、微服务架构、数据库…
招聘城市:上海,北京
…训练框架(基于PyTorch等)的研发与优化,重点解决千卡乃至万卡级别集群的扩展性、容错与性能瓶颈问题;
2、负责训练系统中关键组件的设计与开发,包括但不限于大规模分布式参数服务器、高性能嵌入向量(Embedding)训练与推理、高效的优化器实现等;
3、深入系统底层,利用高性能网络(如RoCE v2, InfiniBand)、RDMA技术以及NVMe SSD存储,优化数据读取、通信和Checkpoint存储等关键路径,实现极致的端到端训练性能;
4、与算法团队紧密合作,理解前沿模型(如大语言模型、推荐系统、多模态模型)对训练基础设施的需求,并将其转化为系统级的创新与优化;
5、负责GPU/XPU计算资源的精细调度与性能优化,深入挖掘硬件潜力,降低训练…
招聘城市:北京
…负责混元平台核心架构设计与迭代开发,聚焦大模型训练、推理、评估、数据多个核心场景,解决大规模训练、数据处理、评测等场景问题,持续提升大模型训练稳定性与平台整体性能上限;
2.LLMOps工程体系迭代与研发效能升级:持续深耕并跟进业界AIGC、大模型工程化前沿技术与落地实践,结合内部模型预训练、后训练、迭代、部署全流程诉求,持续优化平台技术方案与产品形态。聚焦平台易用性、自动化、标准化建设,降低大模型研发与落地门槛,持续完善、升级、落地全链路LLMOps研发体系。
岗位要求:
1.本科及以上学历,具备扎实的AI工程化、大模型研发底座技术功底,熟练掌握 PyTorch/TensorFlow/DeepSpeed 等主流深度学习框架,拥有真实落地的模型训练优化、分布式训练…
招聘城市:北京
岗位职责:
1.负责混元大模型 Post-training 研发与应用,根据落地场景优化混元模型能力和 AI PaaS效果,包括 Agent 构建与强化、多轮对话、翻译等;
2.负责混元在公司内相关业务场景落地,根据业务需求优化混元模型,提升业务效果;
3.跟踪和探索大模型的前沿问题,结合实际场景,提供全面的技术解决方案,参与前沿算法与应用的研究。
岗位要求:
1.硕士或博士学位,机器学习、人工智能、自然语言处理或相关领域的专业背景;
2.3年以上相关工作经验,有大型语言模型算法研究或落地经验者优先;
3.高质量相关论文NeurIPS、ACL、ICML、EMNLP作者优先;
4.良好的团队协作和沟通能力,能够与不同背景的团队成员有效合作;
5.热爱探索AI…
招聘城市:深圳
…探索AI原生的创新产品,实践并落地最新的模型能力;
4.研发内部工具,提升团队工作效率和团队协同效率。
岗位要求:
1.计算机或相关专业本科及以上学历;
2.3年及以上Linux后台开发经验,熟悉系统运维的基础知识,能够排查实际问题;
3.精通GO,C++,JAVA和Python开发语言中的一种或多种,熟悉常见rpc框架;
4.熟悉Mysql,Redis等常见开源组件,Flink,Hadoop,Kafka等大数据套件,掌握适用场景;
5.具备owner意识,能主动推进项目进展,承担更多责任,具备团队协作意识,和良好的沟通能力。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的…
招聘城市:深圳
…的技术研究,提升大模型的代码基础能力;
2.跟进大模型代码领域的前沿技术,将其应用于研发生产中,持续提升大模型的代码能力;
3.负责大模型的代码相关的数据构建、训练调优及评测迭代,推进大模型技术在代码补全,Text2SQL,代码问答,代码Agent等业务场景落地。
岗位要求:
1.自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
2.在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验;
3.较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如tensorflow,pytorch等);
4…
招聘城市:深圳
岗位职责:
1.负责混元大模型高难后训练精标数据研发,包括通用Agent、知识Agent、代码Agent、复杂指令等;
2.构建后训练数据合成/挖掘体系,人机协同智能标注建设,设计数据价值验证流程,探索数据扩充路径,提升高难任务及Agent能力。
岗位要求:
1.熟练掌握Python,熟悉Linux环境开发,精通深度学习框架PyTorch;
2.具备分析问题定义问题和解决问题能力,具备持续的自驱力来面对挑战,有较强的算法实验能力;
3.持续跟进前沿的大模型技术,了解前沿的大模型相关算法,熟悉Transformer等模型结构;
4.在大模型领域顶会发表过高质量论文者优先,有LLM Agent相关经验优先。
招聘城市:深圳
…领域的应用;
2.结合3D/2D生成技术,研发新一代世界模型,实现实时交互、精准可控、符合物理规律的世界交互。
岗位要求:
1.计算机、人工智能、数学等相关专业硕士及以上学历,有AIGC方向顶级论文者优先;
2.满足以下任意一种技术栈要求:
1)生成式模型 :深入理解DiT、self- forcing等模型原理,有3D生成、图像生成或者可控视频生成经验,对世界模型有深入理解;
2)三维重建:熟悉Gaussian Splatting、3R、VGGT、MVS、SLAM等方法,对3D重建任务有深入理解;
3)后训练及加速技术:深入理解RL算法或者DMD等模型蒸馏算法,有3D、图像、视频等生成模型后训练经验或者蒸馏加速经验;
3.代码能力强,能快速实现idea, 有扎实工程能力;数理功底扎实…
招聘城市:北京
…职责:
1.深度参与混元大模型后训练(包括 SFT、RL )及模型合版的研发和相关算法策略研究,提升模型泛化性、能力边界和上限;
2.后训练策略和生产范式的研究,探索更加敏捷、普适和可扩展的训练范式,提升训练和生产效率;
3.相关前沿后训练技术方向探索,包括但不限于 Reasoning/Agentic 能力增强和 Scaling, RL/OPD 等收敛性和可扩展性研究;
4.将研究成果转化为实际的模型能力或生产效率,并撰写高水平技术报告或论文,提升技术影响力。
岗位要求:
1.计算机科学、数学、人工智能等相关专业硕士及以上学历,具备良好的数理基础;
2.具备良好的工程实现能力,熟练使用 PyTroch、Megatraon、vLLM 等常见大模型训练和推理框架…
招聘城市:深圳
…等相关专业的全球高校博士学位;
2.具有在全球领先企业从事大模型前沿技术工作的经验;
3.精通Python编程语言,并具有基于PyTorch或TensorFlow等深度学习工具的技术开发经验;
4.拥有丰富的学术研究经验,在世界顶尖会议如NeurIPS、ICLR、ICML、ACL、EMNLP等发表过文章,具备深度学习学术或工程项目经验;
5.具备良好的沟通能力和团队协作精神,能够有效推进项目进展并与跨职能团队合作。
岗位介绍:
渴望为世界带来新意的人,早已对描绘未来的“热词”不陌生——人工智能、机器学习、数据科学等等。腾讯始终在业界前沿不断探索,积极布局,并为优秀的你提供无限广阔的舞台。我们坚信科技的不断革新,最终能带来美好的、撼动人心的改变…
招聘城市:北京
岗位职责:
1.分布式 Dataloader:多源数据加载框架研发,优化预处理流水线、IO 瓶颈与数据倾斜,对接对象存储 / 分布式文件系统,支持动态采样与增量更新;;
2.Checkpoint 管理:设计高吞吐存储 / 加载方案,优化压缩、分片与冷热分层,实现版本管理、备份恢复与分布式训练框架兼容;;
3.系统优化:监控吞吐 / 延迟 / 显存指标,定位性能瓶颈,保障极端场景下训练连续性;;
4.跨团队协作:对齐业务需求,沉淀技术最佳实践。。
岗位要求:
1.本科及以上学历,3 年 + AI Infra / 分布式系统 / HPC 经验;;
2.精通 Python/C++,深入理解 Linux 内核、IO 模型,熟悉 PyTorch(优先)及分布式训练原理;;
3.有分布式 Dataloader 研发与 IO 密集型任务优化相关经验;;
4.有 checkpoint 存储 / 加载 / 压缩…