招聘城市:深圳
岗位职责:
1.负责混元大模型高难后训练精标数据研发,包括通用Agent、知识Agent、代码Agent、复杂指令等;
2.构建后训练数据合成/挖掘体系,人机协同智能标注建设,设计数据价值验证流程,探索数据扩充路径,提升高难任务及Agent能力。
岗位要求:
1.熟练掌握Python,熟悉Linux环境开发,精通深度学习框架PyTorch;
2.具备分析问题定义问题和解决问题能力,具备持续的自驱力来面对挑战,有较强的算法实验能力;
3.持续跟进前沿的大模型技术,了解前沿的大模型相关算法,熟悉Transformer等模型结构;
4.在大模型领域顶会发表过高质量论文者优先,有LLM Agent相关经验优先。
招聘城市:北京
…建设大模型数据回流管线,负责数据的清洗和标准化;
2.负责混元大模型数据飞轮体系产品的落地,挖掘模型使用短板与业务痛点,搭建「使用-回流-迭代升级」的正向数据闭环;
3.开发数据透视、管理和交付平台,提升数据交付过程中的效率和质量;
4.与算法、训练和数据采购团队协作,提高各链路流程的效率。
岗位要求:
1.熟练使用 Python、Go 或 Java,具备后端或数据平台开发经验;
2.熟悉大规模日志处理、数据清洗、任务调度和常见存储组件;
3.熟悉网关、认证、RBAC 权限控制及企业内部系统开发;
4.了解大语言模型训练流程及训练数据特点;
5.熟悉腾讯内部基础设施、网关和权限配置者优先;
6.有大模型数据、Agent 轨迹或数据交付平台…
招聘城市:深圳
岗位职责:
1.对于互联网抓取数据、提供给大模型训练/搜索等场景预料进行清洗,提升语料纯度。
岗位要求:
1.计算机相关专业优先,熟悉 python/c++编程语言;
2.有数据工程或相关领域的工作经验,具备一定的机器学习算法基础,了解NLP 类似bert等模型;
3.熟练掌握大数据技术栈,包括Hadoop、Spark等,有使用数据库(如SQL)和数据仓库的经验;
4.熟悉网页结构、有网页低质问题挖掘、或者大模型数据清洗有经验者优先。
招聘城市:深圳
…,质量检测(低质识别检测、优质美学评价等),去重/聚类分析,数据合成等算法;
2.数据pipeline建设:负责数据采集、筛选清洗、标注与质量评估pipeline的建设。与模型业务团队紧密配合,充分分析挖掘数据资源,建立自动化数据处理流程与机制,支持模型持续迭代;
3.数据实验分析:对模型训练数据进行详细分析,建立科学数据实验机制,识别样本不足、质量问题、配比不均衡等潜在问题,驱动数据优化提升数据覆盖、质量、多样性需求,最终带来大模型生成效果的持续提升。
岗位要求:
1.硕士及以上学历,计算机视觉、自然语言处理或多模态方向背景优先;
2.熟练掌握深度学习框架(如PyTorch、TensorFlow),熟悉模型训练及数据处理经验,具备优秀的独立开发与分析调研能力;
3.具备良好的…
招聘城市:北京
…类专业数据源的挖掘、对接、测评与采买落地,覆盖预训练、SFT、多模态、代码、长文本等核心数据类型;
2.建立海外数据技术准入标准,从数据质量、稀缺性、重复噪声、场景适配性做专业评估,筛选真正对模型有效增益的高价值数据;
3.对齐预训练算法团队,根据模型能力短板,制定海外数据采买、补充、配比策略,精准支撑模型迭代;
4.负责外购数据的格式适配、清洗去重、质检、版本管理,无缝对接内部预训练数据工作流,实现规模化复用;
5.把控海外数据版权、隐私、跨境合规风险,搭建标准化海外数据准入与风控体系;
6.沉淀海外供应商资源池与数据资产体系,持续优化数据采买、测评、治理流程,构建长期数据壁垒。
岗位要求:
1.计算机、人工智能、大数据…
招聘城市:北京
岗位职责:
1.负责腾讯混元大模型数据飞轮整体规划与落地,设计自动化、可自生长的数据迭代闭环,形成模型数据正向增长飞轮;
2.负责大模型数据平台、智能采样、难例挖掘、数据质检、正负样本管理等数据基建产品的需求设计与迭代落地;
3.联动算法、训练、评测、业务团队,针对推理、代码、长文本、Agent调用等核心场景,制定数据迭代策略,定向产出高质量增量数据,驱动模型效果迭代升级;
4.建立统一的大模型数据质量标准、流程规范与效率指标体系,优化数据清洗、蒸馏、精标全链路,提升模型迭代效率、降低迭代成本;
5.搭建模型幻觉、事实错误、逻辑偏差、安全风险等负样本数据闭环,持续优化模型对齐效果、稳定性与安全性;
6.结合腾讯元宝、行业解决…
招聘城市:深圳
…关系挖掘、泛知识挖掘算法;
3.数据应用探索:将各模态大模型训练数据挂载到知识图谱体系中,结合模型评测/实验下钻分析模型训练数据在数量、质量、配比上的问题,驱动知识图谱持续迭代,最终带来大模型生成效果的持续提升。
岗位要求:
1.熟练掌握图片、视频、音频、3D、文本的跨模态数据理解与知识挖掘能力,持续关注行业动态和最新技术;
2.具备良好的编程能力,熟练掌握Python、Java等至少—种编程语言;
3.具备优秀的数据洞察力、逻辑思维和沟通表达能力,自我驱动、目标导向、抗压能力强;
4.计算机科学、机器学习、数据科学、统计学、应用数学等领域硕士及以上学位。
加分项:
1.有多模态知识图谱构建、跨模态数据检索等相关工作…
招聘城市:北京
岗位职责:
1.主导 Visual2Code 能力建设:负责多模态大语言模型在 Visual2Code 方向的核心算法研发,围绕“视觉输入—代码理解—代码生成—执行验证”完整链路,持续提升模型从界面、图表、文档、图像等视觉信息中理解结构并生成高质量代码的能力;
2.建设高质量数据体系:负责 Visual2Code 训练数据的设计、构建与迭代,包括真实数据挖掘、自动化数据合成、难度分层、质量过滤及数据配比等,建立覆盖多场景、多语言、多任务形态的数据生产与数据飞轮体系;
3.推进模型与算法创新:深入探索 Visual2Code 场景下的 SFT、强化学习、代码执行反馈、Verifier/Reward Model 等后训练方法,研究视觉理解、代码推理与执行反馈之间的协同机制,持续提升模型在复杂任务中的正确率、泛化能力与稳定性…