牛大妈在校招职位搜索大模型北斗实习大模型复杂推理前沿研究 有 35 条结果

招聘城市:北京,上海
岗位职责:
简介:Reasoning(推理)是模型理解和处理信息的核心能力,是通用智能水平逼近的重要观测维度。本课题聚焦于探究生成式模型的高级推理发生机制,提升模型复杂任务上的推理表现。
研究内容包括但不限于:
1、复杂任务推理应用效果优化,诸如逻辑推理、数学推理、代码推理、跨模态推理、多模型决策等。
2、RL scaling,通过大规模强化学习持续提升模型推理能力。
3、Test time scaling,通过增加inference时消耗的算力持续提升模型推理能力。
任职要求:
1、熟悉NLP、LLM、RL等相关领域,对其中一个或多个方向有深入的研究经历,且有相关实际项目经验;
2、熟悉Python、C++等至少一门编程语言,熟悉LINUX环境;
3、熟悉 Megatron、DeepSpeed 等开源训练…
招聘城市:北京,上海
岗位职责:
简介:语言模型后训练前沿算法研究包括但不限于:
1、对齐算法研发:包括 SFT 数据建设,指令微调等。构建高质量的训练数据,包括自动化数据清洗、合成数据生产、高质量 Prompt Engineering 等。优化模型复杂指令遵循、逻辑推理、创作写作、代码生成以及工具调用等能力,提升模型综合能力和用户体验。
2、人类偏好对齐:包括奖励模型、人类偏好对齐等前沿强化算法的探索和实践,提升模型在包括创意写作、对话风格以及模型内生安全对齐等人类偏好上的可控性,生成更符合人类价值观、逻辑习惯和审美偏好的内容。
3、跟踪并实现最新的后训练技术(如数据领域自动化配比、后训练机制设计和优化等)。
任职要求:
1、硕士及以上学历,计算机…
招聘城市:北京,上海
岗位职责:
简介:我们聚焦于多模态推理前沿探索。你将参与具有前瞻性的研究,并可根据个人背景与兴趣,选择以下任一方向进行深入:
1、下一代多模态推理架构: 定义并实现复杂/统一多模态模型的高效推理框架。
2、实时交互演进: 针对多模态语音视频流,探索极致的系统级优化。
3、长文本/长视频突破: 深入研究长序列下的创新压缩算法与高性能推理加速方案。
任职要求:
1、熟悉模型推理原理及主流优化技术,拥有扎实的编程能力;
2、对多模态技术发展趋势有独立见解与思考;
3、具备极强的自驱力、创新意识与执行闭环能力;
加分项:
1、在相关领域有研究或项目实践经验;
2、对系统性能优化、压缩算法、实时…
招聘城市:北京,上海,深圳
…以下方向之一深入推进:
1、多模态预训练与后训练技术创新,提升模型在 OCR、文档图表解析、Visual Grounding、细粒度感知、视觉问答等核心任务上的能力上限。
2、多模态强化学习方案设计,实现视觉感知与多模态理解场景下的高性能可信输出与幻觉抑制。
3、视觉推理能力增强研究(Visual CoT、PRM 等),提升模型复杂视觉任务上的推理深度。
4、工具调用与 Agent 能力构建,探索多模态模型在规划决策场景中的综合表现。
5、长上下文视觉理解与 GUI 能力研究,提升模型在长程复杂任务上的综合能力。
6、其他你坚信路线正确的多模态模型前沿方向。
任职要求:
1、具备视觉多模态模型的预训练或后训练研究经历;
2…
招聘城市:北京,上海
…一是模型对于工具/Skill 调用的指令遵循能力;二是模型对于复杂总结指令的遵循能力。
2、全模态深度搜索智能体:最真实的物理世界都是全模态的,所以搜索智能体不仅在输入上需要支持全模态,而且在整个搜索过程以及最后的结果呈现上都需要支持全模态。该方向主要研究怎么将已经比较成熟的搜索智能体从单一的文本模态扩展成同时支持文本、语音、图像等多种形式的全模态智能体,要解决全模态规划、深度推理、上下文管理和记忆带来的挑战。
3、主动交互深度研究智能体:智能体时代,所有的智能体都应该是一个具有自主意识的个体,能够主动提供服务。而当前的深度研究智能体…
招聘城市:北京,上海
…提升模型在多模态交互场景下的原生能力
复杂场景落地:面向 Agent、具身智能等前沿场景,提升模型的多模态指令遵循与复杂任务规划能力
4. 下一代训练范式与前沿技术探索
自进化机制:协同上下游团队,探索模型自进化(Self-evolution)机制,研究RL在Mid-training阶段的应用
能力扩展:研究推理阶段扩展(Test-time Scaling)及全模态链式思维(Omni-modal CoT),推动模型从单纯的“知识记忆”向“深度推理与问题解决”演进
任职要求:
1. 硕士及以上学历,计算机、人工智能、数学、自然语言处理等相关专业,博士优先;
2. 具备扎实的算法和数学理论基础及良好的编程基础,熟悉Python、Java等至少一种编程语言,熟悉PyTorch等深度学习框架;
3. 在模型领域有研究
招聘城市:北京,上海
…方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、Skill 体系建设与演化:探索 Skill 的表示、组织、调度与自进化机制,提升复用性与泛化能力。
2、模型训练与调优:包括 Agentic RL、模型自适应推理等,提升智能体在复杂任务中的规划、工具调用与执行能力。
3、OpenClaw C 端社区探索:用 AI Agent 重新定义人与信息的连接方式,从 0 到 1 构建产品与技术全链路。
4、Agent 框架能力建设:智能体架构优化、推理成本控制、上下文治理、长期记忆与执行效率提升等方向研究
5、其他你坚信路线正确的下一代 Agent 前沿方向。
任职要求:
1、有好奇心,敢想敢做,学习能力强,能在复杂问题的深度思考与…
招聘城市:北京,上海,深圳
…交互轨迹的大规模RL Scaling、基于环境反馈的自进化与持续学习机制,以及多模态推理与行动的联合优化策略。
任职要求:
1、本科及以上学历,计算机、人工智能、自动化、数学等相关专业在读;
2、在以下一个或多个领域有较深入的研究或实践经验:多模态模型(MLLM)、强化学习(RL)、Agent系统、GUI Agent / Computer Use、视觉-语言模型、跨模态融合;
3、熟悉Python,具备较强的工程实现能力,有模型训练或推理实践经验者优先;
4、好奇心驱动,具备出色的问题分析与自主探索能力,能够在前沿不确定性较高的方向中持续推进;
5、具有良好的沟通协作能力,对追求前沿技术有强烈热情,能够与团队融洽合作,快速试验想法。
加分项…
招聘城市:北京,上海,深圳
…学习;
3、熟悉Python,熟练使用PyTorch等深度学习框架,具备较强的工程实现能力,有大规模分布式训练或流式推理优化实践经验者优先;
4、好奇心驱动,具备出色的问题分析与自主探索能力,能够在前沿不确定性较高的方向中持续推进;
5、具有良好的沟通协作能力,对追求前沿技术有强烈热情,能够与团队融洽合作,快速试验想法。
加分项:
1、在ICASSP、Interspeech、ACL、ICLR、NeurIPS、ICML等顶会发表过相关论文者优先;
2、在有影响力的开源项目(如模型、语音处理框架、Agent框架等)中做出过核心贡献者优先;
3、有AudioLM、VALL-E、Qwen-Audio等语音/音频模型相关研究经验,或有Voice Agent、Tool-use模型实战经验者优先。
招聘城市:北京,上海
…感知复杂环境并执行精准操作的能力。
本课题致力于打造世界一流的具身智能团队,构建统一的感知-决策-控制底层架构。我们探索将视觉、语言与动作指令深度耦合,赋予机器人像人类一样“看懂世界、预判未来、灵活操作、自然交互”的原生能力,挑战物理世界中的复杂长程任务,推动具身智能从实验室走向千家万户。
具体地,我们关注如下研究方向:
1、具身模型感知与决策:探索构建端到端(End-to-End)的Vision-Language-Action(VLA)模型研究如何将海量互联网多模态数据与机器人异构动作数据进行统一表征预训练,提升模型在开放场景下的零样本任务泛化能力,实现从高层逻辑推理到底层电机控制指令的平滑…
招聘城市:北京
…与可行性验证,形成可落地的训练方案并推动模型迭代。
1、面向复杂业务场景(如多轮交互、长序列推理、跨模态 Agent 决策等),进行针对性的垂域数据建设与指令微调,持续提升模型在垂直场景下的表现上限。
2、建设后训练评估体系与数据飞轮,设计面向垂域场景的自动化评测基准,驱动"评测→数据→训练→评测"的闭环迭代。
3、探索多模态模型与新一代Agent框架(Claude Code、OpenClaw 等)的深度结合,研究模型在工具调用、环境感知、多步规划等场景下的能力边界,推动多模态模型从"被调用"向"自主交互"演进,拓展智能体在真实复杂环境中的落地路径。
任职要求:
1、对前沿技术有强烈的探索欲,有出色的…
招聘城市:北京
…职责:
【课题说明】
致力于探索多模态模型与强化学习的前沿技术。研究方向包括多模态表征与理解、强化学习增强的生成与对齐、智能体(Agent)决策与规划等,业务影响覆盖美团外卖每天数千万的订单,核心工作是为用户及商家实现地理空间的智能规划,包括商家配送范围(决策用户是否能在该商家下单)、Area of Interest边框挖掘(AOI,即用户所处地理社区边界,保证用户下单体验的一致性)、用户拼单范围、骑手取件区域的建模与优化。目标是构建能够理解复杂业务需求、驱动范围智能调整的Agent系统,实现“技术驱动业务范式”的升级转变,最终促进平台供给繁荣与用户的供需匹配优化。
【建议研究方向】
1.多模态感知与表征建模…
招聘城市:北京,上海
…包括Agentic RL相关前沿领域与业务的结合,拥有独特的垂直领域高质量数据(本地生活场景),获得在业内最前沿的模型认知和技术积累,既能做前沿 Research,也有直接的落地场景。
研究方向】
1. 探索模型通过 RL Scaling 等方式使用成套工具解决复杂问题的行动和规划能力,包括 Human in the Loop 多轮交互下 Agent 基础建模的新方案、以及与复杂环境的交互学习能力。
2. 探索模型在 Non-Rule Based Outcome 场景下利用复杂信息进行有效 Reasoning 推理的范式,包括 Proactive Agent 的建模方案 。
3. 探索研究更多内在奖励的机制,从而激发模型主动学习和自我更新的能力。
4. 探索构建长期记忆机制,为下一代高效的推理模型、长序列推理及建模提供基础…
招聘城市:北京
…Carryover Effects)等挑战,研究基于表示学习、工具变量或双重鲁棒(DR)的因果推断算法。探索无偏RCT数据与大规模观测数据的融合训练机制,解决特定Logit先验依赖问题,提升弹性模型在小样本和复杂混淆环境下的泛化能力与准确性。
2. LLM增强因果推断(LLM4Causal): 高价值特征挖掘与标签挖掘(Label Mining) ,针对业务数据中标签稀疏或含噪的问题,利用 LLM 的语义理解能力进行 Label Mining,推断缺失的转化标签或修正错误标签。因果去偏与反事实数据生成,研究利用 LLM 生成反事实样本或辅助识别未观测混淆变量,设计新的因果去偏机制。探索将LLM在因果推理和特征理解上的“模型”能力,通过模型蒸馏(Model Distillation)技术迁移至…
招聘城市:北京
…核心决策问题,探索因果推断与前沿人工智能技术融合的下一代决策科学范式。本研究直面高维、动态、充满混杂的商业环境中的根本性挑战:商家间复杂的替代与互补关系、多干预下的交叉混杂效应、以及决策影响的延迟传导与长期因果效应。目标是构建能够表征长程因果、进行反事实推演与前瞻性预估的智能决策系统,实现从“数据相关性分析”到“因果性决策”的根本性跨越,为定价策略提供可解释、可预估的科学依据。
【建议研究方向】
1.List-wise替代效应的因果效应建模:传统point-wise的因果模型无法刻画在外卖平台多商家同时曝光、用户主动比价场景下复杂的替代与竞争关系。本研究需攻克两核心问题:一是曝光…
招聘城市:北京,上海
…本方向聚焦于基座模型的 Post-training,致力于突破数值处理天花板,赋予机器像顶尖数据科学家一样的洞察力。
【核心探索】
1、异构数据理解与数值推理: 突破模型在 Table + 文本混合形态下的信息丢失与幻觉瓶颈。探索基于真实商业数据(如百万级复杂 CSV/Excel 结构)的表征优化与微调,大幅提升模型对数值规律的敏感度与跨表关联推理能力。
2、Agentic RL 与数据环境交互: 摒弃传统 RLHF,构建基于“代码执行沙盒”与“真实数据计算结果反馈”的强化学习闭环。让模型在与海量数据的反复试错中,实现代码编写与数据清洗能力的自我进化。
3、复杂推理与过程奖励(PRM): 针对多步业务分析任务,构建细粒度的过程奖励模型研究
招聘城市:北京,上海
…自动化研究场景下的模型能力建设,提升模型复杂任务分解、长程推理研究规划、工具使用、代码生成与执行、证据整合与研究写作等方面的能力。
2、长程任务中的上下文组织与记忆管理,设计优化 context scaling、context compression、memory selection、状态追踪与长期依赖建模,提升模型复杂研究任务中的上下文利用效率与稳定性。
3、自主研究任务相关环境与自动实验闭环建设,构建 search、browser、retrieval、code execution、verifier 等训练与评测环境,打通训练脚本迭代、实验编排、结果比对、版本保留/回滚与复现验证流程。
4、训练策略、数据配方与反馈信号设计,围绕 SFT、RLVR等方法,结合数据构造、数据清洗、超参数优化以及 outcome-level / process-level 信号设计,提升模型在开放研究任务…
招聘城市:北京,上海
…训练智能体系统的核心在于训练对任意复杂的环境进行合理交互、并在复合guidance 信号下充分进行系统级长程任务解决。这里,环境向真实物理世界演化是一个可以预见的方向,从而依赖模型在动态的、存在时序自变化的多模态环境下的探索与交互能力。为了激发这样的能力,一方面,我们认为游戏是一个高度可验证、同时充满训练潜力的场景;另一方面,如 minecraft / 原神 以至更复杂的开放世界环境更可以作为智能体系统在进行真实物理世界训练之前的一个练兵场。
具体的,我们关注如下研究目标:
1、探索通过在高度多样、丰富的游戏任务下进行大规模智能体训练,提高模型面对一般多模态场景的交互与融合模态推理能力…
招聘城市:北京,上海
…商业分析、精准营销与广告投放、个人助理与智能服务三场景,致力于用 AI Agent 重构人与数据、人与服务的交互方式。
【技术方向】
1、DataAgent 核心基建:攻坚复杂长周期任务的调度架构,解决大规模数据流转下的上下文治理、长期记忆与状态流控难题。
2、BA 场景工具链:构建高扩展性数据处理 Skill 体系与安全高效的代码执行沙盒,支持 Agent 智能调度高并发数据流处理工具。
3、精准营销 Agent:基于海量用户行为数据的宏观统计与微观推理,探索精细化需求理解与大小模型协同的高效系统设计。
4、Skill 体系与模型优化:探索 Skill 的表示、调度与自进化机制;推进 Agentic RL、自适应推理模型训练与调优工作。
5、智能…
招聘城市:北京,上海
…使模型能主动在重复性任务或封闭任务域中总结、提炼认知与经验,并进行有效复用,达到不断自进化 / 自迭代 / 持续学习的效果。
3、训练智能体系统的系统性长程任务高效处理能力,可以自主进行合理的任务拆解、分工;探索通过 agent swarm 或其他先进的 multi-agent system 进行系统性长程任务的并行执行和提效。
4、探索多模态推理和多模态环境交互的范式,并基于此进行增强智能体系统在复杂全模态环境下的任务完成能力。
任职要求:
1、本科及以上学历,计算机、人工智能、自动化、数学、物理等相关专业在读;
2、在强化学习、文本 / 多模态模型训练、Agent、世界模型等一个或多个领域有较深入的研究和实践经验…