招聘城市:深圳
…可复用的评测方法和评估标准;
3.推动评测数据与自动化能力建设,建设高质量评测集、标准答案、链路 Trace 标注规范和评测流水线,支持人工评测、规则评测及自动化评测任务落地;
4.跟进线上 Badcase 分析与问题闭环,针对医疗安全、内容安全、隐私合规、诊疗建议边界等高风险问题,协助定位问题原因,并推动产品、算法、研发侧跟进修复。
岗位要求:
1.计算机或相关专业本科及以上学历,具备基本的软件测试与质量保障知识,理解测试用例设计、缺陷跟踪等基础测试流程;
2.熟悉 LLM、Agent、RAG、工具调用等大模型应用的核心概念及其基本技术实现方式,对 AI 产品质量评测、Agent 链路评测等工作方向有兴趣,愿意长期投入 AI 评测与质量保障领域…
招聘城市:深圳
…器,提升评测效率并保持与人工评价的高一致性;
3.AIGC 专项评测:建立图像/视频生成的质量评估体系,涵盖视觉效果、语义遵循、物理规律等维度,并解决生成内容的主观评价量化难题。
岗位要求:
1.教育背景:计算机、数学、数据科学等相关专业硕士及以上学历;
2.方法论深度:熟悉各类评测技术(如 A/B Testing, Elo Rating, LLM-as-a-Judge),能独立设计复杂的评测实验。了解 LLM、CV 及多模态模型的基本原理,知道模型在哪些地方容易“翻车”;
3.实战经验:有 Benchmark 构建经验(如构建过公司内部的行业测试集、Prompt 库或高质量标注集)。熟悉多模态评测维度(如 OCR、视觉推理、属性对齐)及 AIGC 评估指标(如 CLIP Score, Aesthetic Score, LPIPS 等);
4.工程能力…
招聘城市:北京
…工程化和无人化。
岗位要求:
1.大学本科及以上学历,计算机科学与技术、软件工程、大数据技术、人工智能、智能科学与技术等专业;
2.精通Python程序开发,有良好的编码风格及创新优化意识,具备较强的程序开发能力;
3.有大模型训练或模型评估经验,熟悉大模型评测方法 , 有大模型Bench数据接入经验优先;
4.对预训练语言模型、精调、PE、RAG等大模型技术有一定理解;
5.有责任心和较强的团队意识,对人工智能有较强的兴趣;
6.具备优秀的沟通协调能力和团队协作意识,有项目管理或团队负责人经验优先;
7.大模型产品深度用户,PE(提示工程)实践经验者优先。
岗位介绍:
在腾讯,测试开发工程师…
招聘城市:武汉
岗位职责:
1.负责计算机视觉、深度学习领域的专项技术测试工作;
2.负责算法评测的方案设计,技术指标选型,数据集构建,保证算法效果评估的正确性和合理性;
3.负责算法质量的跟进,对算法落地情况进行追踪,协助研发对算法问题进行分析和定位;
4.负责测试相关工具的设计实现与维护。
岗位要求:
1.计算机/软件工程/数学相关专业本科及以上学历;
2.熟悉软件测试理论及测试流程,具备3年以上测试开发或算法测试经验;
3.熟练使用C++/python中的一种,熟悉常用的数据结构、算法和设计模式;
4.有图像处理、机器学习等技术背景优先;
5.良好的沟通表达能力和团队协作能力,优秀的分析和解决问题能力,强烈的求知欲和…
招聘城市:北京
…场景进行适配与创新;
4.从无到有参与产品AI评测算法、评测标准和评测流程制定,构建评测集、评测执行器,推进评测刚才体系建设。
岗位要求:
1.本科及以上学历,计算机科学、软件工程、人工智能或相关专业;
2.熟练掌握 Python,具备脚本开发与数据处理能力;熟悉业界主流LLM评测基准与方法论(HumanEval、SWE-bench、MMLU、GSM8K等);
3.了解大语言模型的基本原理(Transformer架构、预训练、微调、RLHF、推理优化等)。有主流深度学习框架(PyTorch / TensorFlow / JAX)的实践经验者优先;
4.具备Agen开发或测试经验,了解ReAct、Function Calling、Tool Use、Planning等核心概念;
5.有评测平台或自动化测试框架的开发经验者优先;具备数据分析能力,能从评测数据中提炼有价值的洞察。…
招聘城市:深圳
…人工智能、数学或软件工程等相关专业;
2.精通 Python,熟练使用 Pandas、NumPy、Matplotlib 等数据分析库。 具备扎实的工程实现能力,有自动化测试框架或评测工具开发经验;
3.2年以上游戏智能体或机器人模型评测、数据分析或强化学习相关经验;
4.具备优秀的问题分析能力与结果呈现能力,工作积极主动,能推动技术方案闭环落地。
加分项:
1.有 Lumine、Nitrogen 等 VLA 相关项目背景,或具备多模态数据(视觉、文本、动作)分析经验;
2.熟悉 Unity/Unreal 引擎接口开发,能够定制化采集游戏内底层数据(如 Hitbox 判定、内存状态等);
3.参与过知名开源评测集建设,或在 CVPR、NeurIPS、ICLR 等顶会发表过 AI相关论文;
4.资深游戏玩家,对 FPS/RPG 等游戏的机制…
招聘城市:北京
…可扩展的评测工具链,支持模型快速迭代验证。探索前沿评测方法,包括但不限于 LLM-as-a-Judge、动态评测、Arena 对战、复杂推理评估等;
3.模型能力诊断与优化协同:通过量化分析定位模型短板,与算法团队紧密协作,推动模型能力持续提升。
岗位要求:
1.计算机科学、人工智能、数学、统计学等相关专业硕士及以上学历;
2.精通 Python,熟悉 PyTorch/HuggingFace 生态。深入理解 Transformer 架构及大模型训练流程(预训练、SFT、RLHF/DPO);
3.熟悉主流评测框架(如 OpenCompass、lm-evaluation-harness、HF Evaluate 等)及常用指标(BLEU、ROUGE、Pass@k、ELO 等);
4.具备优秀的数据分析能力和系统化思维。良好的跨团队沟通协作能力,能清晰表达复杂评测结论。对 AI 评测方法论有热情,关注行业最新…
招聘城市:深圳
…具备创新精神,善于用新技术、新方法来解决问题,提升工作效率;
7.掌握常见 AI 漏洞原理与 RASP 原理,具备相关挖掘经验。
加分项:
1.CTF 比赛:包括但不限于 DEFCON、网鼎杯、强网杯等获奖经历;
2.破解类比赛:包括但不限于天府杯、天网杯等参赛/获奖经历;
3.实战经验:具备HW(护网)行动实战经验;
4.安全顶会论文:在 CCF-A 类会议(如 S&P、USENIX Security、CCS、NDSS 等)发表过安全方向论文。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者。你将与技术团队一同沉淀优质代码,让它成为我们共有的宝贵资产。在不同的业务场景和技术发展阶段,你的架构思维也将帮助更…
招聘城市:广州
…人工智能、软件工程等相关专业,3 年以上开发经验;
2.熟悉 Python/Nextjs,熟悉至少一门后端语言(Go/Java/C++),熟悉 Linux 环境及常用中间件(MySQL/Redis/消息队列等);
3.热衷于 AI 技术,具备极强的 AI Coding 能力;
4.具备 AI Agent / LLM 应用的评测或开发经验,熟悉主流 LLM 的 API 调用与 Prompt Engineering;
5.了解常见评测方法论(自动评测、人工评测、A/B Test、Model-as-Judge 等),有评测模型训练经验者优先;
6.具备良好的系统设计能力,有平台类产品或工具链开发经验;
7.有多模态模型或 ASR/TTS 系统评测经验者优先,熟悉 WER、MOS 等指标;
8.熟悉开源评测框架者优先;
9.良好的沟通协作能力,能与产品经理、算法工程师高效配合。
岗位介绍…
招聘城市:深圳
…流程;
4.深入理解软件开发生命周期,能够站在开发者视角设计贴合实际需求的评测场景;有大型系统质量保障或自动化测试平台开发经验者优先;
5.具备优秀的问题分析、归因及解决能力,能独立承担技术方案设计并推动落地;
6.对AI技术有浓厚兴趣,了解大模型、RAG、智能体(Agent)等基本原理,有AI产品评测或工程化相关经验者优先。
加分项:
1.具备全栈开发能力,熟悉现代前端技术栈(如React、Vue等),能独立完成前后端联调开发;
2.是深度开发者工具用户,对IDE、代码版本管理、持续集成等开发工具链有深刻理解和实践经验。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者…
招聘城市:北京
…流程;
4.深入理解软件开发生命周期,能够站在开发者视角设计贴合实际需求的评测场景;有大型系统质量保障或自动化测试平台开发经验者优先;
5.具备优秀的问题分析、归因及解决能力,能独立承担技术方案设计并推动落地;
6.对AI技术有浓厚兴趣,了解大模型、RAG、智能体(Agent)等基本原理,有AI产品评测或工程化相关经验者优先。
加分项:
1.具备全栈开发能力,熟悉现代前端技术栈(如React、Vue等),能独立完成前后端联调开发;
2.是深度开发者工具用户,对IDE、代码版本管理、持续集成等开发工具链有深刻理解和实践经验。
岗位介绍:
在腾讯,后台开发工程师不仅是“又快又稳”的问题解决专家,更是生态共创者…
招聘城市:杭州
…构建科学高效的AI产品评测体系,持续优化方法、指标与数据集;4. 熟悉主流评测工具链,能独立搭建评测平台并执行方案;5. 具备AI模型与产品能力分析及迭代优化能力,驱动优化落地;6. 关注业界前沿AI模型与评测方法发展,并转化为内部实践。任职要求:1. 计算机、人工智能、统计学、数学或相关专业,本科及以上学历,3年(工程师)或5年(专家)以上相关工作经验;2. 熟悉业界主流评测工具集和评测集,有独立设计执行评测经验;3. 熟练掌握Python语言,有实际开发、测试开发或评测工具开发经验;4. 具备优秀团队合作精神与沟通表达能力,具备敏锐感知与持续学习能力。工作城市:杭州投递方式:请访问:AI Data岗位详情 或 AI Evaluation…
招聘城市:北京,上海
…为可验证、可交付、可复用的成果。
加分项:
做过 AI Agent、AI 助手、知识库问答、自动化工作流、数据分析 Copilot、运营 Copilot、企业内部工具等项目。
熟悉 RAG、Function Calling、Tool Use、多 Agent 协作、工作流编排、模型评测、A/B 实验或数据分析。
有 AI 产品从 0 到 1 的原型设计、MVP 搭建、复杂Skill设计和落地、效果验证经验。
具备较强的业务 sense,能理解小红书在社区、内容、商业化等场景中的复杂业务问题。
有 FDE、解决方案工程师、业务分析、数据分析、产品经理、策略运营等复合型经历优先。
你将获得:
参与小红书 AI-native 组织建设的核心机会,直接接触真实业务场景和复杂组织协同问题。
完整经历从研究、产品原型到业务落地的全过程。…
招聘城市:北京
…前沿AI测试领域能力(包括但不限于AI测试工具开发、AI自动化体系建设等);
3.结合云测试现状,开展AI测试实践,依托AI工程化能力,帮助腾讯云提升研发效能和质量;
4.参与质量效率相关工具开发,推进研发流程、发布变更等持续改进优化。
岗位要求:
1.本科以上学历,计算机、软件工程、人工智能等相关专业;
2.具备AIGC、AI评测方向实践经验,熟练掌握Go/Python/Java其中一门语言,编程基础扎实;
3.对测试领域、质量保障体系建设、测试工程化建设有不错的思考,了解行业现状和前瞻性方向;
4.有较强的学习及探索能力,良好的逻辑思维、沟通协调能力;
5.通过腾讯云从业资格证或同等资格认证的优先录取。
加分项:
1.有AI应用…
招聘城市:北京
…3年以上自动驾驶或无人机的算法评测工作经验,5年以上质量或平台开发相关经验
3、对无人机或智驾算法有深入的理解,有过全流程评价体系和研发闭环的建设经验
4、熟练掌握C++/Python等至少一种编程语言,具备良好的代码能力
5、精通分布式系统、微服务架构,熟悉云原生技术栈
6、学习适应能力强,良好的思维逻辑和沟通能力
7、对无人机或智驾的测试和评价有浓厚的兴趣,有很强的问题分析能力、定位能力和项目推动能力
8、熟练运用AI辅助工具(如代码生成、数据分析、模型调优等)进行算法开发与优化;
9、具备利用AI技术解决复杂工程问题的能力,并能评估其在实际…
招聘城市:西安
…参与AI平台及后端工具开发,推进研发流程、发布变更等持续改进优化。
岗位要求:
1.本科以上学历,计算机、软件工程、人工智能等相关专业;
2.具备AIGC、AI评测方向实践经验,熟练掌握Python/Java/Go其中一门语言,编程基础扎实;
3.对测试领域、质量保障体系建设、测试工程化建设有不错的思考,了解行业现状和前瞻性方向;
4.有较强的学习及探索能力,良好的逻辑思维、沟通协调能力;
5.通过腾讯云从业资格证或同等资格认证的优先录取;
6.备注:此岗位为腾讯集团旗下子公司编制。
加分项:
1.有AI应用测试经验者优先;有AI测试实践或AI效果评测经验者优先。
岗位介绍:
在腾讯,测试开发工程师的工作是项目质量保证的…
招聘城市:北京,上海
…伙伴关系的持续健康发展。团队秉持务实、自驱、开放以及追求卓越的工程师文化,一方面通过系统和技术体系的持续迭代升级,帮助业务高质量增长;另一方面,密切关注前沿技术趋势变化,积极创新技术能力,为业务未来发展创造新的可能性。期待优秀的你加入我们,在夯实专业、深耕平台的基础上与业务携手同行,一起用技术 “帮大家吃得更好,生活更好”。
岗位职责:
1. 团队建设与管理
- 组建并管理点评 AI Builder 团队;
- 明确团队能力模型,建立 Agent 工程、AI 工具集成、Prompt 工程、AI 评测等方向的梯队建设;
- 推动团队文化建设,打造务实、自驱、开放、追求卓越的工程师团队。
2. 面向业务的 Agent 工具建设
- 深入了解点评各业务团队的工作流程和痛点;…
招聘城市:广州
岗位职责:
1.针对企业微信AI模型的特点,持续构建完善的评测基准,包括但不限于NLP、ASR、MLLM等领域,有效指导算法优化方向;
2.负责评测数据的自动化生产能力构建:基于数据泛化等能力,构建领域增强型评测数据集生产链路,支持多模态场景的自动化数据扩增与效果验证;
3.负责自动化评测与归因分析:探索并实现自动化评测与模型缺陷归因机制。
岗位要求:
1.计算机或者相关专业硕士或者以上学历,2年以上推荐/CV/NLP/RL相关工作经验,有大模型调优化应用、评测经历者优先;
2.扎实的机器学习基础,能够熟练应用常用的机器学习模型解决实际的业务问题,有主流深度学习模型的项目(CV/NLP/推荐/RL等均…
招聘城市:广州
岗位职责:
1、负责企业微信AI算法的评测标准和评测流程制定,构建评测集,并推进评测执行,分析评测结果,对模型质量给予充分评估。
2、负责NLP、ASR、MLLM等相关领域产品的交付品质,制定合理的验收机制,来评估模型品质,指导模型优化方向。
3、建设相关评测体系和流程,推动AI算法评测高效高质落地。
岗位要求:
1、计算机或者人工智能等相关专业,本科学历及以上;
2、有大模型训练或模型评估经验,熟悉大模型评测方法 , 有大模型Bench数据接入经验优先;
3、对预训练语言模型、精调、PE、RAG等大模型技术有一定理解;
招聘城市:上海
…与管理经验,熟悉NLP/对话数据处理流程,了解数据质量评估方法与统计分析手段,有复杂数据管线或数据系统建设经验者优先;
3.熟悉评测方法学,了解评测指标设计、统计显著性分析、评分一致性校验(如Kappa系数、ICC)等方法,有构建完整评测体系的经验;
4.熟练使用Python/PyTorch,具备扎实的工程实现能力,熟悉数据工程相关工具链(如Airflow、Spark、SQL等);
5.对游戏行业有浓厚兴趣,熟悉至少一种主流游戏品类,理解游戏NPC的设计逻辑与玩家体验诉求。
加分项:
1.有大模型(LLM/VLM)在游戏、虚拟角色、对话系统等方向的评测或数据工程经验;
2.有强化学习、模仿学习、多智能体系统在NPC行为决策中的应用经验;
3.有游戏AI、叙事生成…