牛大妈在校招职位搜索基座评测与认知分析 有 12 条结果

美团 基座评测认知分析

全职 北京
招聘城市:北京
…大模型人才校招】基座评测认知分析-具身开放物理世界探索
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测
招聘城市:北京
…大模型人才校招】基座评测认知分析-基础模型及Agent能力研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
当前,我们正处在大模型从Chat Bot进化为自主智能体(Agent)的关键阶段。Agent 已深度融入代码生产、办公、搜索等场高价值景,其核心能力从单轮对话拓展到复杂任务规划、工具编排、长程记忆多步推理。如何系统、科学地衡量这些前沿能力,已成为决定大模型能力天花板的核心挑战。我们诚邀对 Agent 评测有信念感的你,一同定义下一代 Agent 能力的标尺。
本岗位涉及的具体方向包括:
1.构建 Agent 全维度评测体系:设计横跨感知-规划-执行-反思完整闭环的评测维度框架,重点覆盖代码…
招聘城市:北京
基座评测认知分析-多模态前沿交互研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
多模态大模型能力在近年飞速发展,模态的统一、任务的统一、多种模态联合生成和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于
1.多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力角度分析其中的关键影响…
招聘城市:北京,上海
岗位职责:
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成;
3.探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代智能…
招聘城市:北京,上海
基座模型的迭代;
2.多模态统一方向:包括全模态统一模型、音视频联合生成等,思考在模态统一、任务统一和多种模态联合生成过程带来新的能力跃迁并进行度量,分析模态和任务间的相互关联,指引模型架构、训练策略等选型;
3.多模交互方向:包括通用世界模型、音视频交互等,研究动态多轮交互中的一致性、真实性和长程记忆等关键能力的自动化度量,指引基座模型的迭代;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.UNOBench 行业首个考察全模态协作能力,并得出全模态和单模态能力Compositional Law,指引1+1+1>3的全模态能力发展。
2.EvalTalker 行业首个多人、多姿态、全景覆盖的数字人评测
招聘城市:北京
…价值场景。
2.面向真实用户体验的评测方案建设:当前许多Agent应用领域出现了Benchmark指标相对饱和,无法准确链接真实用户使用体验等问题,我们希望从用户实际使用场景出发,构建高度拟真的交互式评测方案,设计体现用户使用体验的评测指标,对齐训练优化方向提升用户体验的目标。
3.基于线上回流日志的模型问题分析评测验收:利用线上真实交互日志,系统化挖掘 Agent 在复杂链路中的典型失效模式,如工具幻觉、目标偏离等。将发现的 Badcase 自动归因并转化为可复现的回归测试用例,建立基于回流问题的评测看板,以数据驱动方式量化模型版本迭代的真实收益。
4.探索下一代评测范式:研究人-智能体协同评估、自进化…
招聘城市:深圳,其它
…基于评测结果定位问题、推动迭代。
8. 熟悉多轮对话、长上下文、记忆机制、RAG、工具调用或 Agent 等相关技术。
9. 具备良好的问题分析、实验设计和跨团队沟通能力,能够推动模型能力从实验走向线上应用。
10. 了解 Docker、Kubernetes/K3s 等容器化和服务部署技术。 综合素养:具备较强问题拆解攻坚能力,乐于攻克复杂技术难题;拥有优秀沟通表达、跨角色协作能力,具备良好团队意识。
【加分项】
1. 具有心理咨询、心理健康或情感陪伴等垂直领域模型训练经验。
2. 具有心理学、认知科学、临床心理或咨询心理相关学习、研究或项目背景。
3. 熟悉心理咨询常见理论技术,对共情、倾听、澄清、反映、提问及咨询边界有基本理解。
4. 具备心理安全评测、危机识别干预…

美团(meituan) 基座大模型研究分析实习生

兼职 上海,北京
招聘城市:上海,北京
…挑战高复杂业务场景,有机会业界一流的工程师一起并肩前行。
在这里,我们有超强的技术氛围,持续向社区贡献业界实践,加速行业技术发展;我们有完善的互联网学习生态圈,重视底层逻辑和方法论,助力职业生涯的非线性成长。
真诚地邀请你,和我们一起驱动技术发展,创造行业价值。
岗位职责:
负责LLM大模型评测算法的研究以及评测模型的训练、优化,具体工作内容包括但不限于:
1. 深入理解大规模语言模型的模型结构、训练过程以及评测方案,根据模型的训练过程以及评测结果,对大语言模型存在的问题和评测存在的问题进行研究,根据研究结果进行优化落地。
2. 深入分析模型评测结果中不符合认知的异常,根据具体的异常…
招聘城市:北京,上海
…智能方向的模型能力分析和训练策略优化,并且对训练数据、训练策略和模型能力之间的关系进行研究分析,产出可行的模型评测方案和训练策略,具体工作内容包括但不限于:
1. 追踪多模态大模型在具身智能方向的前沿进展,积极学习新的模型结构、前沿模型认知,并进行深入分析
2. 建设验证具身智能的GPT时刻的评测方案和度量分析方法,指引行业的技术迭代;
3. 探索VLA的data-scaling方案,通过VLM的基座能力提升来推进具身任务泛化,实现zero-shot/few-shot的跨任务、跨本体的泛化;
4. 积极探索多模态大模型同环境交互的学习方法,研究通过强化学习的下一代智能提升的关键途径。
5. 各相关部门保持…
招聘城市:上海
…人工智能研究院等单位共建医学人工智能创新中心,自主研发出面向医疗一线的通用医学基座模型Med-Go,该模型已在多项评测中取得优异成绩;同时还以Med-Go为基础,积极探索“医学人工智能+临床诊疗+教学培训+科研支持+医院管理” 的一体化新范式,致力于推动医学人工智能的研发临床落地应用。
2025年11月面向全球正式开源Med-Go-32B通用医学基座模型。该模型为各类专科模型、专病模型及临床智能体搭建起统一的“可插拔”技术底座,既能赋能三甲医院实现高质量发展,亦能保障基层医疗机构“用得起、用得稳”,进而驱动医疗、教学、科研、管理全链条的智能化升级。
临床场景需求梳理:结合专科领域…
招聘城市:北京
…传播应用创新;人工智能技术的传播公众对人工智能技术的认知
2.AI古文字:使用计算科学的方法技术(尤其是人工智能)来加速及增进古文字学研究;通过古文字大模型智能科研平台,实现古文字科研全过程智能化。
3.AI教育:基于大模型多模态、多智能体技术构建下一代自适应教学/训练/研究系统;使用智能体等先进研究方法,完成教育创新研究。
4.AI法律:基于博弈论和强化学习的法律多智能体系统;法律推理的计算化建模;法律场景RAG技术的研究和应用;法律智能现实应用中的伦理问题。
5.AI安全:探索前沿人工智能模型的机制可解释性;研究人工智能内生安全的可靠可推广量化评测方法、安全对齐…
招聘城市:北京
…隐空间物理预测,探索面向真实物理世界的下一代基座模型训练体系
uD83DuDD39 具身智能 ——专注VLA/WAM模型设计、具身世界模型构建及机器人运动控制,打造下一代通用具身智能系统
uD83DuDD39 Agent ——专注智能体基础设施多智能体协作,涵盖自主科研、智能体自进化、搜索智能体及强化学习
uD83DuDD39 AI安全 ——聚焦大模型AI系统的安全治理,围绕安全边界认知、红蓝对抗演练对齐技术
uD83DuDD39 模型&智能体评测 ——专注于世界模型智能体的评测方法研究,探索面向物理世界感知理解、交互执行、未来推演、自我进化及安全可靠的下一代评测体系
uD83DuDD39 编译器&算子 ——深耕AI编译栈GPU内核优化,打通从算法模型到底层硬件的执行链路,实现大模型…