牛大妈在校招职位搜索"评测" 有 20 条结果

招聘城市:深圳,其它
…应用或 Agent 评测的实战经验,深刻理解 LLM as Judge 的局限性、Prompt 设计与一致性校准方法;
2、熟悉视频 / 图像质量评估指标(CLIPScore、光流分析、无参考图像质量评估),有多模态内容评测经验优先;
3、能独立设计评测数据集,对数据泄露与过拟合风险敏感;
4、扎实的工程能力:Python / TypeScript,熟悉数据管道、任务调度、评测平台工程化落地;
5、有从 0 到 1 建设评测或标注平台的经验;熟悉 Langfuse、Weights & Biases 等 LLM 可观测工具加分;
6、强数据思维,能用统计方法(Spearman 相关系数、线性回归)量化评测质量,驱动权重校准;
7、对 C 端产品有热情,能将用户真实偏好转化为可量化的评测信号,而不仅仅是追求自动指标的数字好看…
招聘城市:北京
…大模型人才校招】基座评测与认知分析-基础模型及Agent能力研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
当前,我们正处在大模型从Chat Bot进化为自主智能体(Agent)的关键阶段。Agent 已深度融入代码生产、办公、搜索等场高价值景,其核心能力从单轮对话拓展到复杂任务规划、工具编排、长程记忆与多步推理。如何系统、科学地衡量这些前沿能力,已成为决定大模型能力天花板的核心挑战。我们诚邀对 Agent 评测有信念感的你,一同定义下一代 Agent 能力的标尺。
本岗位涉及的具体方向包括:
1.构建 Agent 全维度评测体系:设计横跨感知-规划-执行-反思完整闭环的评测维度框架,重点覆盖代码…

美团 基座评测与认知分析

全职 北京
招聘城市:北京
…大模型人才校招】基座评测与认知分析-具身与开放物理世界探索
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测
招聘城市:北京
【LongCat大模型人才校招】基座评测与认知分析-多模态与前沿交互研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
多模态大模型能力在近年飞速发展,模态的统一、任务的统一、多种模态联合生成和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于
1.多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力…

小红书 音视频画质评测实习生

兼职 北京
招聘城市:北京
岗位职责:
1、负责视频 & 图片画质评测,输出主客观画质评测报告
2、负责竞品调研分析,指导音视频策略优化改进
3、参与图像算法的开发与优化,建立画质评测规范以及验收标准
任职要求:
1、本科以上学历,了解图像效果相关的基础知识
2、对画质评测感兴趣,能够主观判断画质效果问题
3、具备良好的团队沟通和协作能力、自我驱动和创新能力
4、熟悉imatest、IE、DXO等图像相关评测指标以及摄影爱好者优先

美团 大模型评测研究与模型研究实习生

兼职 上海,北京
招聘城市:上海,北京
…职业生涯的非线性成长。
真诚地邀请你,和我们一起驱动技术发展,创造行业价值。
岗位职责:
1.参与面向AGI的大模型评测研究,包括模型性能评估、数据处理等工作;
2.参与面向AGI的模型训练范式研究,包括算法策略设计、模型调优等工作;
3.协助团队完成相关项目,按时保质保量完成工作任务。
任职要求:
1.大学本科及以上学历,计算机、数学、统计学等相关专业优先;
2.对机器学习、深度学习等领域有一定了解,有相关实习经验者优先考虑;
3.具备良好的团队合作能力、沟通能力和学习能力;
4.熟练掌握Python、C++等编程语言者优先。
岗位亮点:
1.参与大型模型评测研究项目,接触前沿技术和算法;
2.获得专业团队的指导和培训,提升自身技能和能力;…

小红书(xiaohongshu) AI Agent 安全评测实习生

兼职 北京,上海
招聘城市:北京,上海
岗位职责:
1、构建 Agent 系统的离线评测基准,覆盖意图理解、工具调用、回复质量等维度
2、构建 Prompt Injection 攻击测试集并设计防御方案
3、实现 LLM-as-Judge 自动评测 pipeline
4、设计在线质量监控体系(用户行为 + 显式反馈融合)
任职要求:
1、计算机/信息安全/NLP 相关硕士及以上在读
2、对 LLM 安全(Prompt Injection、Jailbreak)有兴趣
3、Python 扎实,了解 LLM 评测方法
4、加分:CTF/渗透测试经验、安全顶会论文
招聘城市:深圳
…板级运行等软硬件评测环境,编写测试脚本,实现评测流程自动化。
4. 整理环境手册、问题台账,定期输出评测报告,反馈各平台性能短板与适配问题。
5. 配合算法、硬件团队,协助完成算子优化与硬件迭代相关工作。
任职要求:
1. 本科及以上学历,电子信息、自动化、计算机、微电子等相关专业,在读学生,可长期稳定实习。
2. 了解数值计算、离散控制、信号处理等基础算法,熟悉常见算子逻辑。
3. 熟练使用Python,具备脚本编写、数据处理能力。
4. 熟悉Linux环境,了解交叉编译,能够独立完成环境部署与问题排查。
5. 掌握C/C++基础,可阅读、调试算法代码。
6. 工作严谨细致,逻辑清晰,具备良好的总结与执行力。
岗位亮点:
1. 掌握算法算子从编译部署到性能评测的全流程,熟悉…
招聘城市:北京,上海
…在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成;
3.探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代智能提升的关键途径;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.LARYBench 行业首个具身动作表征评测基准,揭示了动作表征的data-scaling潜力…
招聘城市:北京,上海
…模型架构、训练策略等选型;
3.多模交互方向:包括通用世界模型、音视频交互等,研究动态多轮交互中的一致性、真实性和长程记忆等关键能力的自动化度量,指引基座模型的迭代;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.UNOBench 行业首个考察全模态协作能力,并得出全模态和单模态能力Compositional Law,指引1+1+1>3的全模态能力发展。
2.EvalTalker 行业首个多人、多姿态、全景覆盖的数字人评测基准,指引自研Longcat-Avatar模型稳居业界前沿。
3.UniHetero 行业首个验证生成能促进理解的unified model,以简洁的结构在大规模数据上得到更好的data-scaling。
任职要求:
1. 硕士及以上学历,计算机、数学、统计学…
招聘城市:北京
…复现的回归测试用例,建立基于回流问题的评测看板,以数据驱动方式量化模型版本迭代的真实收益。
4.探索下一代评测范式:研究人-智能体协同评估、自进化能力评估、Agentic Evaluation、Auto Research等前沿课题,推动评测范式和模型优化范式演进,产出高水平技术报告与顶会论文。
【为什么是我们】
1.美团拥有世界级的业务难题,从POC到大规模场景,充满机遇与挑战,兼顾学习和成长。
2.业界前列的NV GPU和非GPU算力规模,协同算法,AI框架,网络,计算,芯片等多个团队共同建设大模型软、硬件技术底座。
3.团队拥有同行TOP级别的评测基础能力和相应资源投入,在大模型评测研究领域具备国内领先的竞争力,团队近年产出了PRDBench…

美团(meituan) AI Agent评测实习生

兼职 北京
招聘城市:北京
…工具的使用,提升评测效率;
4. 跟踪和研究行业内大语言模型技术和评测方法,为团队提供前沿的知识和见解。
任职要求:
1. 大学本科及以上学历,计算机、人工智能、数据科学、语言学、心理学等相关专业优先;
2. 对AI Agent、大模型及其应用场景有浓厚兴趣,具备良好的逻辑思维与分析能力;
2. 具备一定的分析能力,能够理解用户需求和产品需求,将模糊需求转化为可执行的标准;
3. 具备快速学习能力和敏锐的业务洞察力,能够迅速适应并推动业务场景的探索与迭代;
4.工作细致认真,具备强烈的责任心与团队合作精神,善于沟通协调,能高效支持团队推进任务。
岗位亮点:
1. 深度参与AI Agent前沿技术的评测与优化,了解大…

美团(meituan) AI Agent评测实习生

兼职 上海
招聘城市:上海
…大语言模型技术和评测方法,为团队提供前沿的知识和见解
任职要求:
1.学历要求:高校优先,软件工程、计算机、数学、心理学等相关专业优先
2.具备一定的编程能力,熟悉Python、Java等语言者优先,且对AI技术和产品评测有浓厚兴趣
3.具备一定的分析能力,能够理解用户需求和产品需求,将模糊需求转化为可执行的标准
4.具备快速学习能力和敏锐的业务洞察力,能够迅速适应并推动业务场景的探索与迭代。
5.强烈的责任心和团队合作精神,具备较强的沟通能力,能够高效支持团队快速推进工作
6.每周至少能够保证3-4天的实习时间,长期实习者优先
岗位亮点:
1.深度参与AI Agent前沿技术的评测与优化…

美团(meituan) AI算法评测实习生

兼职 北京
招聘城市:北京
…进行常态化巡检,主动挖掘数字人画面、语音、互动等维度的体验问题;
任职要求:
1. 本科及以上学历在读,计算机、统计学、心理学或传媒类相关专业优先,有过模型评测实习经验优先;
2. 具备极强的耐心和责任心,对数据敏感,能从数据中总结规律、敏锐发现异常;
3. 学习及适应能力强,主观能动性强,逻辑清晰,具备良好的书面表达能力;
4. 沟通协作能力强,敢于推动问题解决;
5. 每周出勤至少4天,实习期不少于6个月(长期实习者优先);
岗位亮点:
前沿视野: 深入接触AIGC、数字人、大模型等最前沿技术在直播场景的落地全流程。
专业指导: 资深运营、产品经理、算法专家日常指导,学习科学的评测方法论与数据分析思维。

美团(meituan) 大模型评测实习生

兼职 北京
招聘城市:北京
…创造行业价值。
岗位职责:
1. 参与大模型评测体系的设计与优化,协助制定评测指标和测试方案。
2. 执行大模型在多个任务场景下的评测,并收集并分析评测数据,输出结构化报告,为模型优化提供数据支持。
3. 协助搭建和维护评测工具链,提升评测效率与自动化水平。
任职要求:
1. 大学本科及以上学历,应用统计、数据科学、计算机、人工智能等相关专业优先。
2. 熟悉自然语言处理基础知识,了解主流大模型架构与应用场景。
3. 具备良好的逻辑分析能力和数据敏感度,熟练使用Python进行数据处理。
4. 工作认真负责,具备良好的沟通能力和团队协作精神。
岗位亮点:
1. 深入接触前沿大模型技术,积累AI评测实战经验。
2. 与资深算法工程师紧密…
招聘城市:北京
岗位职责:
负责AI模型评测与分析工作,与模型训练团队配合不断优化提升AI模型效果。具体工作内容包括:
1. 深入理解大规模预训练语言模型,参与模型评测方案的制定与评测数据集的建设;
2. 通过对模型进行全方面细致的评测,明确模型能力边界,对模型能力进行深入分析,产出围绕大模型的客观认知,从而为模型训练迭代提供指导意见;
3. 追踪大模型方向前沿进展,积极主动地学习和探索新的评测及分析的方法和技术;
4. 与各相关部门保持良好沟通,深度参与大模型训练及应用,为各大模型相关方提供评测及相关的模型分析支持,共同推动大模型的训练与应用。
任职要求:
1. 硕士及以上学历,计算机、数学、统计学或…

美团 大模型评测算法工程师

全职 北京
招聘城市:北京
大模型评测算法工程师
更新时间:2026-03-06
工作地点:北京市
事业群:核心本地商业-平台及职能部门
岗位职责
负责AI模型评测与分析工作,与模型训练团队配合不断优化提升AI模型效果。具体工作内容包括:
1.深入理解大规模预训练语言模型,参与模型评测方案的制定与评测数据集的建设;
2.通过对模型进行全方面细致的评测,明确模型能力边界,对模型能力进行深入分析,产出围绕大模型的客观认知,从而为模型训练迭代提供指导意见;
3.追踪大模型方向前沿进展,积极主动地学习和探索新的评测及分析的方法和技术;
4.与各相关部门保持良好沟通,深度参与大模型训练及应用,为各大模型相关方提供评测及相关的…
招聘城市:北京
岗位职责:
负责AI模型评测与分析工作,与模型训练团队配合不断优化提升AI模型效果。具体工作内容包括:
1. 深入理解大规模预训练语言模型,参与模型评测方案的制定与评测数据集的建设;
2. 通过对模型进行全方面细致的评测,明确模型能力边界,对模型能力进行深入分析,产出围绕大模型的客观认知,从而为模型训练迭代提供指导意见;
3. 追踪大模型方向前沿进展,积极主动地学习和探索新的评测及分析的方法和技术;
4. 与各相关部门保持良好沟通,深度参与大模型训练及应用,为各大模型相关方提供评测及相关的模型分析支持,共同推动大模型的训练与应用。
任职要求:
1. 硕士及以上学历,计算机、数学、统计学或…

美团(meituan) AI Agent评测实习生

兼职 上海
招聘城市:上海
…大语言模型技术和评测方法,为团队提供前沿的知识和见解
任职要求:
1.学历要求:高校优先,软件工程、计算机、数学、心理学等相关专业优先
2.具备一定的编程能力,熟悉Python、Java等语言者优先,且对AI技术和产品评测有浓厚兴趣
3.具备一定的分析能力,能够理解用户需求和产品需求,将模糊需求转化为可执行的标准
4.具备快速学习能力和敏锐的业务洞察力,能够迅速适应并推动业务场景的探索与迭代。
5.强烈的责任心和团队合作精神,具备较强的沟通能力,能够高效支持团队快速推进工作
6.每周至少能够保证3-4天的实习时间,长期实习者优先
岗位亮点:
1.深度参与AI Agent前沿技术的评测与优化…

美团(meituan) 大模型评测实习生

兼职 北京
招聘城市:北京
…高品质的住宿、交通、游玩等服务矩阵。
这里有多元的业务布局、持续的成长空间,无论是向往的远方还是眼前的工作,一路都是风景相伴。加入我们,共同为用户创造旅游旅行中的高光时刻!
岗位职责:
1. 参与大模型评测相关工作,协助制定和维护评测标准。
2. 负责评测数据的收集、整理与分析,输出评测报告并提出改进建议。
4. 跟进评测任务管理,评测标准培训等
任职要求:
1. 大学本科及以上学历
2. 具备良好的逻辑思维与表达能力,熟练使用AI工具者优先。
3. 对大模型技术及应用场景有浓厚兴趣,具备快速学习能力。
4. 工作细致认真,具备良好的沟通能力和团队协作意识。
岗位亮点:
深度参与前沿大模型评测工作,积累AI领域实践经验。