招聘城市:北京
…基座评测与认知分析-多模态与前沿交互研究
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
多模态大模型能力在近年飞速发展,模态的统一、任务的统一、多种模态联合生成和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于
1.多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力角度分析其中的关键影响…
招聘城市:北京,上海
…全模态统一模型、音视频联合生成等,思考在模态统一、任务统一和多种模态联合生成过程带来新的能力跃迁并进行度量,分析模态和任务间的相互关联,指引模型架构、训练策略等选型;
3.多模交互方向:包括通用世界模型、音视频交互等,研究动态多轮交互中的一致性、真实性和长程记忆等关键能力的自动化度量,指引基座模型的迭代;
【为什么是我们】
一起建立行业评测标杆,推动行业认知进展,代表工作包括:
1.UNOBench 行业首个考察全模态协作能力,并得出全模态和单模态能力Compositional Law,指引1+1+1>3的全模态能力发展。
2.EvalTalker 行业首个多人、多姿态、全景覆盖的数字人评测基准,指引自研Longcat-Avatar模型稳居业界前沿…
招聘城市:北京,上海
…和实时交互带来了崭新的应用体验和生产力提升。在这个过程中,我们需要脚踏实地的同时仰望星空,发挥想象力预判新模型能力带来的应用场景革新,研究达到理想态的关键演进路径并进行度量分析,指引长期有潜力的模型迭代方向。方向包括但不限于:
1、多模Agent方向:包括在多模态的工具调用和GUI/CUA,探索结合多模原生能力的OpenClaw展现出的生产力提升潜力,从基座模型能力角度分析其中的关键影响因素并进行自动化度量,指引基座模型的迭代。
2、多模态统一方向:包括全模态统一模型、音视频联合生成等,思考在模态统一、任务统一和多种模态联合生成过程带来新的能力跃迁并进行度量,分析模态和…
招聘城市:北京,上海,深圳
…负责多模态理解与生成的前沿探索与研究,包括但不限于视觉表征统一训练、多模态统一架构探索、理解与生成任务关系研究。
任职要求:
1、硕士及以上学历,计算机、人工智能、自动化、数学、自然语言处理等相关专业,博士优先;
2、在以下一个或多个领域有较深入的研究或实践经验:多模态大模型(MLLM)、全模态融合大模型(Omni-LLM),视觉基座(Vision-Model)、理解生成统一(Unified-MM)、强化学习(RL);
3、具备扎实的算法和数学理论基础及良好的编程基础,熟悉PyTorch等深度学习框架;
4、在大模型领域有研究基础,或参与过有影响力的开源项目,在ICLR/NeurIPS/ICML/ACL等顶会发表论文者优先;
5、有良好的沟通协作能力,对追求前沿…
招聘城市:北京,上海
岗位职责:
简介:我们聚焦于多模态推理的前沿探索。你将参与具有前瞻性的研究,并可根据个人背景与兴趣,选择以下任一方向进行深入:
1、下一代多模态推理架构: 定义并实现复杂/统一多模态模型的高效推理框架。
2、实时交互演进: 针对多模态语音视频流,探索极致的系统级优化。
3、长文本/长视频突破: 深入研究长序列下的创新压缩算法与高性能推理加速方案。
任职要求:
1、熟悉大模型推理原理及主流优化技术,拥有扎实的编程能力;
2、对多模态技术发展趋势有独立见解与思考;
3、具备极强的自驱力、创新意识与执行闭环能力;
加分项:
1、在相关领域有研究或项目实践经验;
2、对系统性能优化、压缩算法、实时…
招聘城市:北京,上海
…基座模型在长上下文上的表现
架构优化: 探索并验证MoE(混合专家)、稀疏注意力(Sparse Attention)、线性注意力等模型结构;结合剪枝与稀疏化技术,协同优化训练与推理效率,提升超长上下文场景下的效率
上下文管理: 探索逐轮次和跨多轮次的上下文管理方法,并建立对应评测体系,从而减少冗余信息堆叠,实现高效思考和性能提升
3. 多模态能力融合与 Agent 赋能
模态融合:探索多模态预训练新范式,突破模态融合瓶颈。利用多模态扩展定律指导数据与训练方案,提升模型在多模态交互场景下的原生能力
复杂场景落地:面向 Agent、具身智能等前沿场景,提升模型的多模态指令遵循与复杂任务规划能力
4. 下一代训练范式与…
招聘城市:北京,上海,深圳
…能力上限。
2、多模态强化学习方案设计,实现视觉感知与多模态理解场景下的高性能可信输出与幻觉抑制。
3、视觉推理能力增强研究(Visual CoT、PRM 等),提升模型在复杂视觉任务上的推理深度。
4、工具调用与 Agent 能力构建,探索多模态模型在规划决策场景中的综合表现。
5、长上下文视觉理解与 GUI 能力研究,提升模型在长程复杂任务上的综合能力。
6、其他你坚信路线正确的多模态大模型前沿方向。
任职要求:
1、具备视觉多模态大模型的预训练或后训练研究经历;
2、熟悉PyTorch,有充分的动手实践经验。
加分项:
1、社区影响力:在多模态大模型领域有影响力的开源项目中做出过核心贡献;
2、学术影响…
招聘城市:北京,上海,深圳
岗位职责:
简介:参与虚拟人交互方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、基于多模态大模型构建端到端交互虚拟人模型,实现智能双工交互能力。
2、人、物、场景多模态感知与推理,探索高度拟人化的虚拟人交互体验。
3、Human Video Model 研究:高质量人脸、人体及人物交互的视频生成基座构建。
4、虚拟人语音、表情、动作的多模态对齐与同步生成方法研究。
5、其他你坚信路线正确的虚拟人交互前沿方向。
任职要求:
1、熟悉多模态大模型、2D虚拟人、视频生成等相关研究进展;
2、熟悉PyTorch,有充分的动手实践经验。
加分项:
1、社区影响力:有多模态大模型、视频生成、虚拟人相关研究和…
招聘城市:北京,上海,深圳
…奖励建模与过程奖励设计、GUI交互轨迹的大规模RL Scaling、基于环境反馈的自进化与持续学习机制,以及多模态推理与行动的联合优化策略。
任职要求:
1、本科及以上学历,计算机、人工智能、自动化、数学等相关专业在读;
2、在以下一个或多个领域有较深入的研究或实践经验:多模态大模型(MLLM)、强化学习(RL)、Agent系统、GUI Agent / Computer Use、视觉-语言模型、跨模态融合;
3、熟悉Python,具备较强的工程实现能力,有大模型训练或推理实践经验者优先;
4、好奇心驱动,具备出色的问题分析与自主探索能力,能够在前沿不确定性较高的方向中持续推进;
5、具有良好的沟通协作能力,对追求前沿技术有强烈热情,能够与团队…
招聘城市:北京,上海
…模态,而且在整个搜索过程以及最后的结果呈现上都需要支持全模态。该方向主要研究怎么将已经比较成熟的搜索智能体从单一的文本模态扩展成同时支持文本、语音、图像等多种形式的全模态智能体,要解决全模态规划、深度推理、上下文管理和记忆带来的挑战。
3、主动交互深度研究智能体:智能体时代,所有的智能体都应该是一个具有自主意识的个体,能够主动提供服务。而当前的深度研究智能体,还处于被动给人提供信息的状态,基本不具有自主意识。该方向主要研究怎么让深度研究智能体具有自主意识、能够主动挖掘人类的真实意图、主动引导人类进行多轮互动,最终给人伙伴式体验并提升人的认知…
招聘城市:北京,上海
岗位职责:
简介:原生多模态旨在以统一的范式处理文本、视觉、语音等各个模态的数据,从而更加自然地进行模态融合,以及通过scaling友好的训练范式,解锁模型智能的新维度。
研究课题包括但不限于:
1、探索early fusion阶段,引入图文交错/audio等多模态序列数据自监督预训练带来的scaling价值。
2、原生全模态预训练的training dynamic探究,模态之间的关系建模。
3、通过SFT / RL等手段,借助多模态token解锁模型新的智能维度,提升模型解决Robot/Gaming等物理世界问题的能力。
任职要求:
岗位要求:
1、熟悉NLP、LLM、MLLM、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验;
2、熟悉Python、C++等至少一门编程语言,熟悉…
招聘城市:北京
…大模型人才校招】基座评测与认知分析-具身与开放物理世界探索
更新时间:2026-06-03
工作地点:北京市
事业群:核心本地商业-基础研发平台
岗位职责
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测…
招聘城市:北京,上海,杭州
…有效的“多模态理解与生成”统一大模型基座方案,打破公司内部当前“模态隔离”与“任务隔离”的双重技术壁垒。目前在实际业务中,系统高度碎片化:一方面,我们维护着多套用于提取图文Embedding和标签的vlm理解类模型,以支持搜索和推荐的端到端建模;另一方面,我们独立部署了大量图像生成式大模型,包含用于社区封面生成、商品图修图、营销海报生成的图像生成模型(如基于Diffusion的文生图/图生图模型)。
这种“理解与生成分离、文本与视觉割裂”的基建现状导致了极高的算力消耗、部署成本及维护代价。更关键的是,模型间存在“知识壁垒”——图像生成模型无法直接复用理解模型对业务商品逻辑的深刻认知,而…
招聘城市:北京,上海
岗位职责:
从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于
1.探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向;
2.探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成;
3.探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代智能…
招聘城市:北京,上海
岗位职责:
简介:从多模态大模型基座延伸到具身智能,我们的目标是做到具身智能的“GPT时刻”,具备test-time zero-shot/few-shot的跨本体、跨任务泛化。在这个过程中,我们进行具身智能在泛化能力评测分析和关键迭代路径的探索,包括但不限于:
1、探索激发多模态大模型Training-Free泛化能力的Data-Scaling方案(包括VLA和VA),迁移人类数据到具身本体,包括latent action和unified model等方向。
2、探索通过世界模型作为物理仿真引擎的进阶,兼顾仿真和真机的优点,实现泛化评测、强化学习和多样性数据合成。
3、探索通过环境交互的在线强化学习,涉及仿真环境的搭建、数据合成和真机实验,研究通过自我进化的下一代…
招聘城市:北京
…快速完成技术预研与可行性验证,形成可落地的训练方案并推动模型迭代。
1、面向复杂业务场景(如多轮交互、长序列推理、跨模态 Agent 决策等),进行针对性的垂域数据建设与指令微调,持续提升模型在垂直场景下的表现上限。
2、建设后训练评估体系与数据飞轮,设计面向垂域场景的自动化评测基准,驱动"评测→数据→训练→评测"的闭环迭代。
3、探索多模态大模型与新一代Agent框架(Claude Code、OpenClaw 等)的深度结合,研究模型在工具调用、环境感知、多步规划等场景下的能力边界,推动多模态模型从"被调用"向"自主交互"演进,拓展智能体在真实复杂环境中的落地路径。
任职要求:
1、对前沿技术有强烈的探索…
招聘城市:北京,上海,深圳
…语音交互轨迹的大规模构建、针对“对话自然度”与“任务完成率”的多目标奖励建模,以及基于环境反馈的语音Agent自进化机制。
任职要求:
1、本科及以上学历,计算机、人工智能、自动化、信号处理、数学等相关专业在读;
2、在以下一个或多个领域有较深入的研究或实践经验:音频/语音大模型(Audio-LLM / Speech Language Models)、端到端语音对话系统、大语言模型(LLM)、Agent系统、语音识别/合成(ASR/TTS)、强化学习;
3、熟悉Python,熟练使用PyTorch等深度学习框架,具备较强的工程实现能力,有大规模分布式训练或流式推理优化实践经验者优先;
4、好奇心驱动,具备出色的问题分析与自主探索能力,能够在前沿不确定性较高的方向中持续推进…
招聘城市:北京,上海
…前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、具身智能相关的仿真环境、资产、场景、任务自动化生成与重建(3D生成/场景理解)。
2、仿真环境内的轨迹自动化生成方法(数据引擎/合成数据)。
3、基于多模态大模型的泛化具身智能 Agent 系统研究。
4、Training-free的基于few-shot的具身智能大模型研究。
5、多模态大模型的多视角空间感知与主动探索能力研究。
6、其他你坚信路线正确的具身智能前沿方向。
任职要求:
1、计算机科学、自动化、机器人或相关领域在读硕士/博士研究生;
2、具备扎实编程能力,熟练掌握 Python 及 PyTorch;熟悉 C++ 者优先;
3、对具身智能、机器人、计算机图形学或多…
招聘城市:北京,上海
岗位职责:
简介:探索下一代大模型训练范式,从模型结构、训练策略、数据策略、算力利用率等角度切入,打造具有更强能力和更高潜力的基座模型
1、设计更高效的模型结构,提高给定数据量、计算量、硬件资源、输出序列长度等约束下的模型能力,如长序列能力、记忆能力等。
2、探索更科学和前沿的训练策略,对影响training dynamic的关键变量(如学习率、batchsize、初始化等)形成更科学的认知,探索diffusion LLM,test-time scaling等技术。
3、研究模型结构和数据的耦合关系,优化分阶段训练范式。
4、结合MLsys解决大规模训练中遇到的卡点问题,实现算法和工程联合设计。
任职要求:
1、熟悉NLP、LLM、MLsys、Optimization、OR、Control、RL等相关领域,对其中…
招聘城市:北京,上海,杭州
…线上业务中,推理速度限定了线上可用的模型大小以及可达效果,当前的基于transformer架构的大模型基座在推理速度上存在系统性瓶颈。本课题探索基于创新框架,如diffusion LLM和linear attention model的大模型基座范式,从数据、模型预训练、后训练、AI Infra、评测等方向探索模型效果极限。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、扎实的编程能力和算法功底,熟练掌握Python/C++/Java等至少一种编程语言;
3、扎实的机器学习/深度学习理论基础,有大规模推荐系统、计算广告、搜索引擎等核心算法项目经验;
3、有LLM/MLLM等多模态理解技术背景,或大规模模型训练实际项目经验者优先…