美团(meituan) 【基座大模型北斗实习】面向Agentic场景的语音交互大模型前沿研究
兼职 北京,上海,深圳
招聘城市:北京,上海,深圳
…感知语气、情绪与环境音,并基于这些多维度的语音信息直接进行思考、规划与行动。本课题聚焦于构建端到端(End-to-End)的语音原生大模型,并将其深度融入Agentic工作流,打造“边听、边想、边说、边做”的新一代语音智能体,推动AI从传统的“级联式语音助手(ASR+LLM+TTS)”走向具备极低延迟、全双工交互与复杂任务执行能力的真实世界数字伙伴。
具体地,我们关注如下研究方向:
1、端到端语音-语言统一建模与理解: 摒弃传统的级联架构,探索将连续的音频流(包含语音、副语言特征、环境音)与离散的文本Token在统一的自回归/非自回归架构下进行联合建模。使Agent能够无损保留语音中的情绪、重音…
…感知语气、情绪与环境音,并基于这些多维度的语音信息直接进行思考、规划与行动。本课题聚焦于构建端到端(End-to-End)的语音原生大模型,并将其深度融入Agentic工作流,打造“边听、边想、边说、边做”的新一代语音智能体,推动AI从传统的“级联式语音助手(ASR+LLM+TTS)”走向具备极低延迟、全双工交互与复杂任务执行能力的真实世界数字伙伴。
具体地,我们关注如下研究方向:
1、端到端语音-语言统一建模与理解: 摒弃传统的级联架构,探索将连续的音频流(包含语音、副语言特征、环境音)与离散的文本Token在统一的自回归/非自回归架构下进行联合建模。使Agent能够无损保留语音中的情绪、重音…