牛大妈在校招职位搜索Dots-Ace顶尖实习生大模型预训练算法与训练策略研究 有 1 条结果

招聘城市:北京,上海,杭州
…RL 训练环境,现有环境难以模拟长程任务中工具调用、状态变迁与多步依赖的真实分布;稀疏的结果奖励无法为上百步的中间过程提供有效训练信号,如何设计面向长程任务的 Reward Signal 与 Credit Assignment 机制是关键瓶颈;在推理侧,模型在长时执行中面临目标漂移、错误累积与上下文认知负载持续增长等问题,缺乏有效的自我监控与恢复能力。研究将围绕复杂真实多样的 RL 训练环境合成、特定场景下长程稀疏奖励下关键决策步骤的信用归因,以及主动规划与长程目标对齐等核心问题展开。
任职要求:
1、不限年级,本科及以上在读,计算机/人工智能/软件工程等相关专业优先;
2、优秀的代码能力、数据结构和基础算法功底,熟练掌握…