牛大妈在社招职位搜索混元数据算法工程师北京 有 54 条结果

招聘城市:深圳
…,质量检测(低质识别检测、优质美学评价等),去重/聚类分析,数据合成等算法
2.数据pipeline建设:负责数据采集、筛选清洗、标注与质量评估pipeline的建设。与模型业务团队紧密配合,充分分析挖掘数据资源,建立自动化数据处理流程与机制,支持模型持续迭代;
3.数据实验分析:对模型训练数据进行详细分析,建立科学数据实验机制,识别样本不足、质量问题、配比不均衡等潜在问题,驱动数据优化提升数据覆盖、质量、多样性需求,最终带来大模型生成效果的持续提升。
岗位要求:
1.硕士及以上学历,计算机视觉、自然语言处理或多模态方向背景优先;
2.熟练掌握深度学习框架(如PyTorch、TensorFlow),熟悉模型训练及数据处理经验,具备优秀的独立开发与分析调研能力;
3.具备良好的…
招聘城市:深圳
…质量控制:
-组建并管理数据团队(包括数据工程、3D技术美术TA、标注专员);
-建立自动化与人工相结合的数据质量评估体系(QA),制定SOP,确保持续向算法团队输送High-Quality Token。
岗位要求:
1. 专业背景:
计算机、图形学、数学或相关专业本科及以上学历,3年以上相关技术开发经验;
2. 核心技能(必须):
3D数据处理能力: 深刻理解3D数据格式(如 glTF, OBJ, USD, PLY)及表征形式(Mesh, Point Cloud, Voxel, NeRF, Gaussian Splatting);
编程能力: 精通 Python,熟练掌握 Blender Python API (bpy) 或其他3D软件脚本开发,具备自动化处理海量3D模型的能力;
图形学基础: 熟悉渲染管线,了解PBR材质、光照、相机参数对数据的影响;
3. 大模型认知:
熟悉AIGC主流算法原理(如Diffusion Model…
招聘城市:北京
…跟踪 VLM 领域数据相关前沿研究(如预训练数据设计、模态融合策略),主导技术攻关与专利申请;输出可复用的数据处理算法组件与技术文档,建立团队数据算法基准体系。
岗位要求:
1.计算机科学、人工智能、自动化等相关专业硕士及以上学历,1年以上多模态大模型或计算机视觉领域研发经验。​;
2.扎实的算法基础:精通深度学习、计算机视觉与自然语言处理核心理论,深入理解 Transformer 架构、模态对齐原理及多模态预训练机制。​;
3.工程能力突出:熟练掌握 Python 编程语言,精通 PyTorch 框架及 HuggingFace 生态,具备大规模数据处理(Spark/Flink)与分布式训练(DDP/FSDP/DeepSpeed)经验。​;
4.数据处理实战经验:具备 VLM 预训练数据构建全流程经验,熟悉图像去重…
招聘城市:深圳
岗位职责:
1.负责大模型高难后训练精标数据研发,包括通用Agent、知识Agent、代码Agent、复杂指令等;
2.构建后训练数据合成/挖掘体系,人机协同智能标注建设,设计数据价值验证流程,探索数据扩充路径,提升高难任务及Agent能力。
岗位要求:
1.熟练掌握Python,熟悉Linux环境开发,精通深度学习框架PyTorch;
2.具备分析问题定义问题和解决问题能力,具备持续的自驱力来面对挑战,有较强的算法实验能力;
3.持续跟进前沿的大模型技术,了解前沿的大模型相关算法,熟悉Transformer等模型结构;
4.在大模型领域顶会发表过高质量论文者优先,有LLM Agent相关经验优先。
招聘城市:深圳
…ASR/音频caption)、音频生成(TTS/视频配音)等模型研发;
2.负责语音/音频大模型的预训练、后训练、强化学习(文本和音频强化)相关的数据算法工作;
3.负责语音对话/音频理解/音频生成的模型开源以及产品落地(比如语音对话产品全链路端到端优化、音频理解在噪音/口音/远场/音效音乐场景的优化、语音合成在播报/闲聊/游戏/社交等场景的优化)。
岗位要求:
1.有语音对话、语音合成、语音识别、音视频多模态、大语言模型(预训练、微调、强化学习)等相关经验者优先;
2.优秀的代码能力、数据结构和算法功底,熟练掌握Python或C/C++,熟悉Pytorch/Megatron/DeepSpeed等模型训练框架,有ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
3.在相关顶级会议…
招聘城市:深圳
岗位职责:
1.负责语音/音频大模型研发,包括音频理解(ASR/音频caption)、音视频理解等模型研发;
2.负责预训练、后训练、强化学习(文本和音频强化)相关的数据算法、评测工作;
3.负责音频理解/ASR模型开源以及产品落地(比如产品全链路端到端优化、音频理解在噪音/口音/远场/音效音乐场景的优化)。
岗位要求:
1.有语音识别、音频理解、音乐理解等相关经验者优先;
2.有音视频多模态、大语言模型(预训练、微调、强化学习)等相关经验者优先;
3.优秀的代码能力、数据结构和算法功底,熟练掌握Python,熟悉Pytorch/Megatron/FSDP等模型训练框架、熟悉SLIME/VERL等RL框架优先;
4.有ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
5.在相关顶级会议…
招聘城市:深圳
…模型压缩优化工具,实现一站式模型压缩-部署的高速推理方案;
8.参与前沿的模型压缩加速算法研究,追踪领域前沿工作,撰写并发表顶会论文。
岗位要求:
1.熟悉深度学习算法基本原理,熟练掌握PyTorch,具备扎实的Python编程能力与工程实现能力;
2.熟悉主流LLM模型压缩算法体系,并且了解硬件及推理库上对于模型压缩的支持方案;
3.具有扎实的数理基础,熟悉常见的算法数据结构,具有良好的编程习惯;
4.了解大模型算法基本原理,熟悉常见LLM大模型,有顶会论文发表者优先。
岗位介绍:
在腾讯,后台开发工程不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产…
招聘城市:深圳
岗位职责:
1.对于互联网抓取数据、提供给大模型训练/搜索等场景预料进行清洗,提升语料纯度。
岗位要求:
1.计算机相关专业优先,熟悉 python/c++编程语言;
2.有数据工程或相关领域的工作经验,具备一定的机器学习算法基础,了解NLP 类似bert等模型;
3.熟练掌握大数据技术栈,包括Hadoop、Spark等,有使用数据库(如SQL)和数据仓库的经验;
4.熟悉网页结构、有网页低质问题挖掘、或者大模型数据清洗有经验者优先。
招聘城市:北京
岗位职责:
1.负责大模型游戏生成与理解能力的提升,从零到一构建高质量、可运行、可玩的游戏,持续探索大模型在游戏创作场景的能力边界;
2.主导多轮长程游戏迭代、程序化游戏内容生成(PCG)、游戏资产调度等关键技术的攻坚,沉淀可扩展、可复用的游戏生成技术体系;
3.覆盖从游戏生成 → 代码调优 → 交互优化的游戏开发全周期,端到端提升生成游戏的质量、可玩性与稳定性,充分释放基础模型的生成力;
4.搭建游戏生成的评测体系与数据闭环,以量化指标驱动模型与生成流水线的持续迭代;
5.与算法工程、产品等团队紧密协作,推动游戏生成能力的产品化落地与应用验证。
岗位要求:
1…
招聘城市:北京
…工作经验,有大模型实际项目落地经验者优先;
2.算法深度:深入理解 Transformer 架构,熟悉 LLM 的全生命周期(预训练、SFT、RLHF/DPO);精通 RAG 技术栈,对索引构建、检索策略、上下文压缩有深入研究;
3.推理与 Agent 能力:熟悉推理类模型的训练或微调方法,了解如何通过数据工程提升模型的逻辑推理与长链条思考能力;熟悉主流的 Agent 框架(如 LangChain, LlamaIndex, AutoGPT 等)及其在复杂调研任务中的应用;
4.底层技术功底:熟练掌握 PyTorch 等深度学习框架;了解分布式训练与高效推理优化技术;
5.综合素质:具备优秀的数据敏感度与逻辑思维能力,能够从复杂的业务需求中抽象出核心技术挑战,对 AI 搜索的未来演进(如思考型搜索)有独到见解;
6…
招聘城市:北京
…高高效后训练流水线,支持大规模数据并行处理、分布式训练(DDP/FSDP)与模型压缩部署;与产品、工程团队协作,打通 “后训练 - 评测 - 迭代” 闭环,适配不同场景下的 Agent 产品需求。​;
5.技术创新与沉淀:跟踪大模型 Agent 领域前沿技术(如 LLM+Planning、Tool Learning、Multi-Agent Interaction),主导核心技术攻关与专利申请;输出可复用的后训练算法组件、技术文档与评测基准,推动团队技术能力沉淀。
岗位要求:
1.计算机科学、人工智能、机器学习等相关专业硕士及以上学历,1年以上大模型后训练或 Agent 相关研发经验。​;
2.扎实的算法基础:精通深度学习、强化学习、自然语言处理核心理论,深入理解大模型训练原理、Transformer 架构及 Agent 决策机制。​;
3.工程能力扎实:熟练掌握…
招聘城市:深圳

4.数据资产化与标准化建设:推动多模态数据结构的标准化设计,建设数据信息、版本管理与可追溯机制,提升数据的可复用性与长期资产价值;
5.跨团队协作与需求落地:与算法、模型、平台等团队深度协作,将模型需求与业务目标转化为可落地的数据工程方案,参与复杂数据问题的拆解、方案设计与推进落地。
岗位要求:
1.全日制本科及以上学历,硕士优先,计算机或相关专业,工作经验1年及以上;
2.具备扎实的 Python 工程能力,熟悉模块化设计、异常处理、工程化代码结构,熟悉 Linux 环境,具备基本的 Shell 使用与问题定位能力,具备良好的代码质量意识(可维护性、可读性、可测试性);
3.具备大规模数据处理经验,有 TB…
招聘城市:深圳
岗位职责:
1.负责大模型全量数据的向量化检索和向量化排重服务,实现实时向量化排重系统;
2.通过向量化检索性能的优化,提升文本排重的准确率和性能;
3.建立大模型数据清洗的反馈机制和反馈系统,提升全网数据抓取效率;
4.参与大模型的数据工程开发,为大模型提供基础数据
岗位要求:
1.计算机相关专业,本科以上学历,3年以上架构经验;
2.精通C++/Go/Java中至少一门开发语言,熟悉常见的数据结构和算法
3.熟悉分布式系统架构和实现,参与过大规模系统的设计研发工作,能承担大规模数据的架构设计;
4.有大模型经验者优先,对大模型和AGI充满激情。
招聘城市:深圳
岗位职责:
1.负责大规模网页数据的抓取、清洗及结构化存储,保障数据质量和时效性;
2.设计并优化分布式爬虫架构,提升系统并发能力和容错性,提升系统性能;
3.维护数据采集链路,协同系统数据分析团队完成数据交付与应用。
岗位要求:
1.计算机相关专业,本科以上学历,2年以上架构经验;
2.精通C++/Go/Java中至少一门开发语言,熟悉常见的数据结构和算法
3.熟悉任务调度与性能优化,深入理解HTTP协议,能独立分析动态网页结构;
4.有分布式爬虫开发经验者优先。
招聘城市:深圳
…Post-Training)阶段的核心技术研发,构建和优化高质量的奖励系统(Reward System),通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力;
2.深入研究和优化 RLHF等后训练算法,提升模型训练的稳定性和最终效果;
3.负责后训练阶段的数据合成与管理,设计高效的数据飞轮机制,利用SFT、Self-Instruct等技术合成高质量训练数据,并负责建立从用户反馈(User Feedback)到模型迭代的闭环信号建模体系;
4.负责后训练模型的全维度评测与分析,制定科学的评价指标,跟进前沿技术动态,将最新研究成果快速转化为业务价值。
岗位要求:
1.计算机科学/软件工程/人工智能等相关专业硕士及以上学历…
招聘城市:北京
…提升数据使用的可追踪性、可复现性和交付效率。
岗位要求:
1.精通 Python,具备扎实的软件工程能力与系统设计能力,能在复杂系统中推进架构落地;
2.熟练掌握 Docker 容器化交付体系,理解镜像构建优化、依赖隔离、网络/存储、制品/镜像仓库等能力,并能设计可复现的环境交付流程;
3.熟悉 Kubernetes 使用与排障,能在集群环境下完成部署治理、资源配置和稳定性问题定位;
4.有后端服务、数据平台、任务平台、机器学习平台或评测平台相关研发经验;
5.理解数据集管理中的版本、信息、质量校验、权限、可追踪性和自动化流程,具备良好的数据建模能力;
6.具备强问题分析与闭环能力,能高效利用 AI 工具提升研发效率,并能与算法
招聘城市:深圳
岗位职责:
1.负责多模态AI数据管线的设计与开发,覆盖语音、图像、视频、3D等数据类型;
2.搭建高效的数据预处理pipeline,设计高吞吐的数据存储与索引系统,支撑大规模训练数据集生产;
3.与算法/研究员协作,实现离在线一致的数据构造与对齐流程;
4.负责管线服务的稳定性、性能优化与可观测性建设,支撑 AI数据全天高效生产;
5.探索自动化数据质量评估、数据合成、AIGC辅助数据生产等方向。
岗位要求:
1.本科及以上学历,计算机相关专业;
2.3年以上后台开发经验,1年大数据/数据管线相关经验以上优先;
3.熟练掌握 Python/Go/C++ 至少一门,熟悉 Linux 开发环境;
4.熟悉至少一种主流消息队列(Kafka/Pulsar/RocketMQ)、任务调度(Airflow/Celery…
招聘城市:北京
算法功底,有 OI、ACM 等信息学 / 算法竞赛经历者优先;
2.熟练掌握 Python,具备扎实的工程编程能力与良好的代码品味,能稳定输出可读、可维护、可测试的高质量代码,有大模型(LLM)数据、训练、评测相关工程经验者优先;
3.具备任务调度、服务运维或工具链开发相关经验,理解分布式训练与大规模数据处理的流程与挑战,有大型复杂系统设计与开发经验者优先;
4.责任心强,对质量与稳定性有执念,具备批判性思维,习惯主动挑战与质疑既有方案;
5.有 CTF 安全竞赛、红队测试或对抗性测试背景者优先。
岗位介绍:
渴望为世界带来新意的人,早已对描绘未来的“热词”不陌生——人工智能、机器学习、数据科学…
招聘城市:深圳
…的技术研究,提升大模型的代码基础能力;
2.跟进大模型代码领域的前沿技术,将其应用于研发生产中,持续提升大模型的代码能力;
3.负责大模型的代码相关的数据构建、训练调优及评测迭代,推进大模型技术在代码补全,Text2SQL,代码问答,代码Agent等业务场景落地。
岗位要求:
1.自然语言处理/机器学习/模式识别/人工智能/计算机等相关专业硕士以上学历;
2.在NLP、LLM、深度学习、强化学习方面有一定研究基础,熟悉主流模型和算法,并有一定的实践经验;
3.较强的工程实现能力,熟练掌握C/C++,Python等至少一种语言,有实际编程项目经验,熟悉DeepSpeed、Megatron等分布式训练框架,熟练使用至少一种深度学习框架(如tensorflow,pytorch等);
4…
招聘城市:北京
岗位职责:
1.深度参与大模型后训练(包括 SFT、RL )及模型合版的研发和相关算法策略研究,提升模型泛化性、能力边界和上限;
2.后训练策略和生产范式的研究,探索更加敏捷、普适和可扩展的训练范式,提升训练和生产效率;
3.相关前沿后训练技术方向探索,包括但不限于 Reasoning/Agentic 能力增强和 Scaling, RL/OPD 等收敛性和可扩展性研究;
4.将研究成果转化为实际的模型能力或生产效率,并撰写高水平技术报告或论文,提升技术影响力。
岗位要求:
1.计算机科学、数学、人工智能等相关专业硕士及以上学历,具备良好的数理基础;
2.具备良好的工程实现能力,熟练使用 PyTroch、Megatraon、vLLM 等常见大模型训练和推理…