牛大妈在校招职位搜索大模型北斗实习基于原生语音大模型的情感陪伴智能体 有 2 条结果

招聘城市:北京,上海,深圳
…感知语气、情绪与环境音,并基于这些多维度的语音信息直接进行思考、规划与行动。本课题聚焦于构建端到端(End-to-End)的语音原生模型,并将其深度融入Agentic工作流,打造“边听、边想、边说、边做”的新一代语音智能体,推动AI从传统的“级联式语音助手(ASR+LLM+TTS)”走向具备极低延迟、全双工交互与复杂任务执行能力的真实世界数字伙伴。
具体地,我们关注如下研究方向:
1、端到端语音-语言统一建模与理解: 摒弃传统的级联架构,探索将连续的音频流(包含语音、副语言特征、环境音)与离散的文本Token在统一的自回归/非自回归架构下进行联合建模。使Agent能够无损保留语音中的情绪、重音…
招聘城市:北京,上海,深圳
…超越纯文本交互,在屏幕、软件乃至物理世界中运作——这要求模型具备将图像、视频、音频、文本等多模态感知与可靠的实时行动能力统一融合的底层能力。本课题聚焦于将全模态(Omni-modal)理解能力深度融入Computer Use Agent(CUA),构建"边看、边听、边想、边做"的原生全模态智能体系统,推动智能体从单一文本工具调用走向真实数字环境中的多模态自主操作。
具体地,我们关注如下研究方向:
1、全模态感知与GUI交互的统一建模:探索将视觉(屏幕截图、视频流)、听觉(语音指令、系统音频)、文本等多模态信号在统一架构下进行融合理解,使Agent能够基于多模态上下文进行精准的GUI元素定位、状态识别与操作决策,提升在复杂…