牛大妈在社招职位搜索hi labPosttrain算法工程师-RLHF 有 4 条结果

小红书 【hi lab】Posttrain算法工程-RLHF

全职 北京,上海
招聘城市:北京,上海
…方法对多模态大模型进行对齐:
解决优化现有多模态大模型 RLHF 中的训练效果、稳定性、Reward Hacking 等问题;
探索 RL 阶段 computaiton scaling 对模型能力提升的方法;
研究 Multi-Agent、Long-term Objective、Scalable Oversight 等方向下基于强化学习的对齐方法;
基于前沿方法对幻觉、推理、工具使用、安全等场景问题进行针对性优化,提升大模型的应用价值。
任职要求:
岗位要求
1. 具备扎实的机器学习基础,能熟练使用至少一种深度学习框架(e.g. PyTorch、Jax、TensorFlow、MindSpore、PaddlePaddle)。
2. 对监督学习、强化学习、表示学习等机器学习方法有深入理解并具备相关的实践经验。
3. 在 NLP/CV/RL 等至少一个 AI 领域中有过深入的研究经历,或通过机器学习算法解决过复杂业务场景问题…
招聘城市:北京,上海
…多模态大模型进行对齐:
2.解决优化现有多模态大模型 RLHF 中的训练效果、稳定性、Reward Hacking 等问题;
3.探索 RL 阶段 computaiton scaling 对模型能力提升的方法;
4.研究 Multi-Agent、Long-term Objective、Scalable Oversight 等方向下基于强化学习的对齐方法;
5.基于前沿方法对幻觉、推理、工具使用、安全等场景问题进行针对性优化,提升大模型的应用价值。
任职要求:
1. 具备扎实的机器学习基础,能熟练使用至少一种深度学习框架(e.g. PyTorch、Jax、TensorFlow、MindSpore、PaddlePaddle)。
2. 对监督学习、强化学习、表示学习等机器学习方法有深入理解并具备相关的实践经验。
3. 在 NLP/CV/RL 等至少一个 AI 领域中有过深入的研究经历,或通过机器学习算法解决过复杂业务场景问题…
招聘城市:北京,上海
…能力。
2、基于 SOTA omni 基座模型,在语音、视觉、文本长序列混合后训练中,通过多种训练方法保证语音能力充分发挥的同时,又不削弱模型智商与图文表现。
3、构建语音质量与语义一致性的 Reward 模型;通过 RLHF/RLAIF/Self-Rewarding 以及 Session level RL 技术提升模型在实时对话中的语义、情绪理解能力,语音表达的自然度、逻辑一致性。
4、与工程、产品团队协同,把实验成果快速迁移到线上服务,并探索基于线上用户的语音交互反馈实现在线 RL 迭代提升。
任职要求:
1、有极强的问题分析和解决能力,开放心态,善于学习;
2、有语音领域相关经验,在某一方向有过较深入的研究和一线经验;对大模型后训练技术有一定认知…
招聘城市:上海,北京
…4、研究Self-Rewarding、Self-Crituqing、Scalable Oversight等方向下的对齐技术,探索LLM booststrap的技术路径。
任职要求:
1. 具备扎实的机器学习基础,能熟练使用至少一种深度学习框架(e.g. PyTorch、Jax、TensorFlow、MindSpore、PaddlePaddle)。
2. 对监督学习、强化学习、表示学习等机器学习方法有深入理解并具备相关的实践经验。
3. 在 NLP/CV/RL 等至少一个 AI 领域中有过深入的研究经历,或通过机器学习算法解决过复杂业务场景问题。
4. 具备卓越的实验分析与问题解决能力,有创新思维,能够良好沟通、与团队成员高效协作。
加分项:
1. 有 ICML、ICLR、NeurIPS、ACL、CVPR、AAAI 等顶级学术会议发表过有影响力研究成果的优先。
2. 在 ACM/ICPC、NOI/IOI、Kaggle 等比赛获奖者优先。
3…