牛大妈在校招职位搜索基座评测与认知分析基础模型及Agent能力研究 有 11 条结果

招聘城市:北京
【LongCat大模型人才校招】基座评测认知分析-基础模型Agent能力研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
当前,我们正处在大模型从Chat Bot进化为自主智能体(Agent)的关键阶段。Agent 已深度融入代码生产、办公、搜索等场高价值景,其核心能力从单轮对话拓展到复杂任务规划、工具编排、长程记忆多步推理。如何系统、科学地衡量这些前沿能力,已成为决定大模型能力天花板的核心挑战。我们诚邀对 Agent 评测有信念感的你,一同定义下一代 Agent 能力的标尺。
本岗位涉及的具体方向包括:
1.构建 Agent 全维度评测体系:设计横跨感知-规划-执行-反思完整闭环的评测维度框架,重点覆盖…
招聘城市:北京
挑战,兼顾学习和成长。
2.业界前列的NV GPU和非GPU算力规模,协同算法,AI框架,网络,计算,芯片等多个团队共同建设大模型软、硬件技术底座。
3.团队拥有同行TOP级别的评测基础能力和相应资源投入,在大模型评测研究领域具备国内领先的竞争力,团队近年产出了PRDBench、AMemGym、CATArena等数十篇高质量论文研究工作。
任职要求:
1.硕士以上学历,计算机或相关专业,博士优先。
2.在 ML / NLP / RL / CV / Speech 等相关方向有扎实的研究基础,在 ACL / EMNLP / NAACL / NeurIPS / ICML / ICLR / CVPR / ICCV / ICASSP 等顶级会议发表论文者优先。
3.优秀的代码和算法功底,具备工匠精神,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先。
4.在大模型
招聘城市:北京
模型人才校招】基座评测认知分析-多模态前沿交互研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
多模态大模型能力在近年飞速发展,模态的统一、任务的统一、多种模态联合生成和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于
1.多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力角度分析
招聘城市:北京,上海
…化度量,指引基座模型的迭代;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.UNOBench 行业首个考察全模态协作能力,并得出全模态和单模态能力Compositional Law,指引1+1+1>3的全模态能力发展。
2.EvalTalker 行业首个多人、多姿态、全景覆盖的数字人评测基准,指引自研Longcat-Avatar模型稳居业界前沿。
3.UniHetero 行业首个验证生成能促进理解的unified model,以简洁的结构在大规模数据上得到更好的data-scaling。
任职要求:
1. 硕士以上学历,计算机、数学、统计学或相关专业。
2. 熟悉Java/Python/C++等编程语言,良好的编码习惯和一定的工程能力
3. 具有深度学习和大模型原理的基础知识,具有多模态大模型
招聘城市:深圳,其它
…基于评测结果定位问题、推动迭代。
8. 熟悉多轮对话、长上下文、记忆机制、RAG、工具调用或 Agent 等相关技术。
9. 具备良好的问题分析、实验设计和跨团队沟通能力,能够推动模型能力从实验走向线上应用。
10. 了解 Docker、Kubernetes/K3s 等容器化和服务部署技术。 综合素养:具备较强问题拆解攻坚能力,乐于攻克复杂技术难题;拥有优秀沟通表达、跨角色协作能力,具备良好团队意识。
【加分项】
1. 具有心理咨询、心理健康或情感陪伴等垂直领域模型训练经验。
2. 具有心理学、认知科学、临床心理或咨询心理相关学习、研究或项目背景。
3. 熟悉心理咨询常见理论技术,对共情、倾听、澄清、反映、提问咨询边界有基本理解。
4. 具备心理安全评测、危机识别干预…

美团 基座评测认知分析

全职 北京
招聘城市:北京
…大模型人才校招】基座评测认知分析-具身开放物理世界探索
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测
招聘城市:北京,上海
…途径;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.LARYBench 行业首个具身动作表征评测基准,揭示了动作表征的data-scaling潜力和迭代路径。
2.WBench 行业首个统一多轮交互世界模型评测基准,将广义世界模型拉到同一参考空间进行维度全面的度量。
3.UniHetero 行业首个验证生成能促进理解的unified model,以简洁的结构在大规模数据上得到更好的data-scaling趋势。
任职要求:
1. 硕士以上学历,计算机、数学、统计学或相关专业。
2. 熟悉Java/Python/C++等编程语言,良好的编码习惯和一定的工程能力
3. 具有深度学习和大模型原理的基础知识,具有多模态大模型、具身智能之一的研究经验。
4. 良好的沟通能力、团队…
招聘城市:上海
…医疗一线的通用医学基座模型Med-Go,该模型已在多项评测中取得优异成绩;同时还以Med-Go为基础,积极探索“医学人工智能+临床诊疗+教学培训+科研支持+医院管理” 的一体化新范式,致力于推动医学人工智能的研发临床落地应用。
2025年11月面向全球正式开源Med-Go-32B通用医学基座模型。该模型为各类专科模型、专病模型临床智能体搭建起统一的“可插拔”技术底座,既能赋能三甲医院实现高质量发展,亦能保障基层医疗机构“用得起、用得稳”,进而驱动医疗、教学、科研、管理全链条的智能化升级。
临床场景需求梳理:结合专科领域,总结、提炼适合医学人工智能介入的临床应用场景。
医学模型数据治理…
招聘城市:北京
…多模态大模型的感知基础构建,包括高清图建模、长视频建模、语音编解码架构等。
3.多模态强化学习,包括多模态强化学习的高效性、拓展性、普适性等,实现多模态大模型的深度思考。
(三)具身智能
1.通用具身基础模型:构建通用泛化的具身大模型,研究内容包括具身大模型模型架构、数据构造治理、学习方法等。
2.垂直领域具身模型:探索面向无人机的具身智能算法,包括无人机场景下的环境感知认知推理、基于多模态大模型的自主导航规划等。
(四)智能体
1.智能体长程任务解决能力构建:旨在提升智能体在复杂任务中的长程思维能力,涵盖多步推理、任务规划目标分解等关键能力

美团(meituan) 基座模型研究分析实习生

兼职 上海,北京
招聘城市:上海,北京
…3. 构建Data-Centric的数据-训练-评测闭环,探索研究大模型的数据、模型结构、评测策略、评测数据等对模型评测效果的影响,得出有效认知,指导模型训练和评测方案的建设。
4. 追踪大模型方向的前沿进展,积极主动地学习和探索新数据分析模型训练以及模型评测方法。
5. 各相关部门保持良好沟通,深度参与大模型预训练、SFT、RLHF和评测等阶段,共同推动大模型持续优化。
任职要求:
1. 硕士以上学历,计算机、数学、统计学或相关专业;
2. 熟悉Java/Python/C++等编程语言,良好的编码习惯和一定的工程能力
3. 具有机器学习或深度学习算法的基础知识,熟练掌握自然语言处理、多模态或大模型相关算法和模型
4. 良好的沟通能力、团队…
招聘城市:北京,上海
…前沿模型认知,并进行深入分析
2. 建设验证具身智能的GPT时刻的评测方案和度量分析方法,指引行业的技术迭代;
3. 探索VLA的data-scaling方案,通过VLM的基座能力提升来推进具身任务泛化,实现zero-shot/few-shot的跨任务、跨本体的泛化;
4. 积极探索多模态大模型同环境交互的学习方法,研究通过强化学习的下一代智能提升的关键途径。
5. 各相关部门保持良好沟通,深度参与多模态模型的训练过程,共同推动多模态大模型持续优化。
任职要求:
1. 硕士以上学历,计算机、数学、统计学或相关专业。
2. 熟悉Java/Python/C++等编程语言,良好的编码习惯和一定的工程能力
3. 具有深度学习和大模型原理的基础知识…