牛大妈在社招职位搜索Dots-Posttrain算法工程师-General Ag 有 3 条结果

小红书(xiaohongshu) Dots-Posttrain算法工程-General Agent

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…效果、稳定性、Reward Hacking 等问题;
探索 RL 阶段 computaiton scaling 对模型能力提升的方法;
研究 Multi-Agent、Long-term Objective、Scalable Oversight 等方向下基于强化学习的对齐方法;
基于前沿方法对幻觉、推理、工具使用、安全等场景问题进行针对性优化,提升大模型的应用价值。
任职要求:
1. 具备扎实的机器学习基础,能熟练使用至少一种深度学习框架(e.g. PyTorch、Jax、TensorFlow、MindSpore、PaddlePaddle)。
2. 对监督学习、强化学习、表示学习等机器学习方法有深入理解并具备相关的实践经验。
3. 在 NLP/CV/RL 等至少一个 AI 领域中有过深入的研究经历,或通过机器学习算法解决过复杂业务场景问题。
4. 具备卓越的实验分析与问题解决能力,有创新思维,能够良好沟通、与团队成员高效协作…

小红书(xiaohongshu) 【dots】applied posttrain算法工程

全职 上海,北京,杭州
招聘城市:上海,北京,杭州
…关键问题。
3、跨职能协作:与产品、工程、安全团队紧密合作,将研究成果有效落地,确保模型应用符合实际需求,并在关键技术上做到行业顶尖水平。
任职要求:
1、扎实的机器学习基础:具备扎实的机器学习理论基础,能够熟练使用至少一种深度学习框架(如 PyTorch、Jax、TensorFlow、MindSpore、PaddlePaddle),并具备在复杂应用场景下应用这些工具的实践经验。
2、对齐技术研究经验:深入理解监督学习、强化学习、表示学习等方法,并在至少一个 AI 领域有过研究经历或通过机器学习算法成功解决过复杂问题。
3、卓越的实验设计与问题解决能力:具备设计复杂实验和分析实验结果的能力,能够识别并解决模型在真实应用中的关键技术挑战,具备创新思维,并能够有效沟通、与…
招聘城市:北京,上海,杭州
…现有 Attention、NTP 等范式保持批判性思考,例如探索全新的
探索新架构、新目标函数、新训练范式在 Post-Training 中的可能性
参与从模型 → 推理过程 → 自学习环境(System-level Scaling)的演进
任职要求:
基础要求
扎实的机器学习 / 深度学习基础,对模型训练全流程有深入理解
熟悉至少一个方向:
强化学习(RL Scaling / RLAIF / Online RL 等)
多模态学习(尤其是视频、时序、感知建模)
Agent / 多智能体系统
良好的工程能力,能将研究想法落地为稳定系统
加分项
有大模型 Post-Training 或 MOE RL Scaling 实战经验
RL Algo & Infra co-design
对 Token 效率、推理效率、多尺度学习 等问题有深入思考
参与过 Agent 系统或复杂训练闭环的设计
有“系统思维”,不满足于单点指标提升