牛大妈在社招职位搜索大模型评测专家 有 1000+ 条结果

小红书 模型标注-AI应用评测专家

全职 北京,上海
招聘城市:北京,上海
…负责模型效果的全生命周期的评测产品工作,与算法、工程、前端产品协同;
2、效果标准的制定,基于业务场景研究及语料分析,定义特定场景下的理想效果,同时对问题下钻分析,持续挖掘和特征提炼,推动专项的解决,形成数据飞轮;
3、搭建内外部体验视角下的效果量化指标,从用户视角定义高质量优质语料和体验问题,通过科学置信的量化指标,协同算法、数据持续推动效果迭代;
4、评估体系的设计与专业评估报告输出,建立系统、科学、完善的评估体系,从用户视角出发,形成模型效果有效的驱动力。
任职要求:
1、具备3-5年搜索、模型相关评测产运工作经验,对模型技术应用具有热情;
2、对PE、精调、RAG等模型技术有…
招聘城市:北京
岗位职责:
1、 主导模型平台及工具系统的设计:涵盖评测集、案例库系统、可视化等核心操作等模块,构建高效易用的全流程产品基础设施;
2、 承担多系统间架构串联工作:具备策略产品视野,设计灵活可靠的集成方案,实现模型平台与知识库、审核系统、数据中台等的无缝对接,保障系统兼容性与可扩展性;
3、 深入挖掘业务需求与行业痛点,通过行业经验积累结合核心角色调研输出痛点解决方案,完成产品规划、PRD文档及原型设计,推动算法、工程、业务等跨部门团队高效协作,确保项目按计划落地交付;
4、 持续跟踪模型领域技术趋势与行业动态,研究合规治理、风险控制等前沿方案,保持学习热情为企业内部持续输入前沿观点;
5、 通过数据…

小红书(xiaohongshu) 基础模型算法专家

全职 上海,北京,杭州
招聘城市:上海,北京,杭州
模型架构设计和实现,持续打磨多阶段预训练技巧,结合自动化和人工筛选,持续迭代化数据配比方案(质量、类别分布、难度等),训练全尺寸Dense和MoE模型,以及探索Hybrid架构、Diffusion训练/推理等新一代模型范式;
2、后训练:SFT数据合成、拒绝采样、数据配比、模型训练,样本级标签体系建设,RL数据合成、Reward Model设计、router replay、RL算法创新,显著提升alignment阶段模型生成能力;
3、数据&评测:持续改进数据体系pipeline,包括:数据收集、清洗、去重和配比等,合成各种高质量agentic/reasoning训练数据,提升模型通用能力;持续完善模型评估体系和Bench,能有效评估STEM、math、code、知识、指令跟随、多语言等维度能力。
任职要求:
1、背景: 计算机、电子、数学等相关专业硕士/博士;深入理解

小红书(xiaohongshu) 社区安全模型策略高级专家

全职 北京,上海,武汉
招聘城市:北京,上海,武汉
…推理和处置。
3、探索模型及Multi-Agent领域前沿技术,进行技术调研、原型搭建和效果验证,并推动其在业务场景中的规模化应用。
4、作为模型技术在安全领域的专家,强目标导向地协同算法、研发、治理、产品等团队,明确技术路径,统筹项目资源,共同实现安全目标。
5、具备产品意识,不仅满足于解决单点问题,更致力于优化产品工具、提升整体安全运营的效率和智能化水平。
任职要求:
1、具备2年及以上模型相关项目的实践经验,有安全风控经验优先。
2、熟悉模型的算法原理,精通至少一种主流模型应用开发框架,有构建Agent的经验。能够独立完成Workflow或Agent的搭建、评测和部署。
3、具备比较好的业务理解能力…
招聘城市:深圳
岗位职责:
负责通用AI模型相关的评测与应用的规划、落地以及平台化能力建设,包括但不限于:
1.通用AI模型评测基准的构建:建立覆盖文生文、多模态理解、多模态(音视频/3D/图/视频生成)生成等多模态的评测基准,设计全面、准确的多维度指标,构建自动化评测工具链,并随着模型能力的演进持续探索全模态的评测基准;
2.评测数据的自动化生产能力构建:基于数据泛化等能力,构建领域增强型评测数据集生产链路,支持多模态场景的自动化数据扩增与效果验证;
3.自动化评测与归因分析:探索并实现各个模态模型的自动化评测模型缺陷归因机制。
岗位要求:
1.计算机或者相关专业硕士…

小红书 交易审核模型运营高级专家

全职 北京,武汉,上海
招聘城市:北京,武汉,上海
…的核心痛点,并能够基于主流模型能力及AI平台能力,设计结合Prompt工程、RAG应用等能够解决场景问题/难度业务的应用方案,提升业务效率;
3、项目实施与效果把控:主导场景应用链路搭建,管理并行项目落地,把控从数据清洗、Prompt优化到模型调优、模型评估的全流程智能应用,建立对应用使用情况的核心指标监控体系,并确保应用投入与使用在项目中的ROI达标;
4、运营体系沉淀:构建可复用的prompt指令库、ai工具库,沉淀不同场景的应用解决方案,并推动方案在业务线规模化应用。
任职要求:
1、熟练使用SQL、Excel等数据分析工具,对数据和指标有清晰的认知,有较好的分析能力;
2、有模型相关标…
招聘城市:深圳
…AI模型评测体系的构建:通过紧跟先进模型及应用的前沿发展,设计全面、准确的多维度指标,建立覆盖文生文、多模态理解、多模态(音视频/3D/图/视频生成)生成等全面、多维度的评测体系;
2.行业动态洞察:持续完善快速评测体系构建、快速反馈行业动态及模型能力,发现行业模型以及应用的前进方向、亮点;
3.结果归因以及调优指导:通过各种数据分析方法,深度分析模型评测结果,为模型的更新调优提供精准的问题分析结论。
岗位要求:
1.计算机编程、数学、设计、3D(建模师、独立开发者等)、视频等相关专业硕士或以上学历,对该领域有深度了解,2年以上工作经验;
2.了解AI模型技术原理,对模型相关…
招聘城市:北京
…标注与管理经验,具备从训练数据到模型效果评估再到优化的完整闭环经验;
3.较强的数据处理能力,可以归拢、整合数据,透过数字分析推演出新的需求和目标;
4.具备优秀的沟通能力和团队协作精神,能够跨部门推动项目进展,擅长从数据与评估中发现有价值的产品改善建议并推动落地;
5.具有较强的逻辑思维能力,对GenAI领域怀有巨大的热情与热爱,具备出色的好奇心与学习能力,能适应快节奏的工作方式。
加分项:
1.有视频生成模型(T2V/R2V)或世界模型相关领域的实际从业经历;
2.拥有院线类电影、头部影视项目的相关实际从业经历;
3.具备良好的行业视野,能持续跟踪多模态模型技术趋势与市场动态…
招聘城市:深圳
…标注与管理经验,具备从训练数据到模型效果评估再到优化的完整闭环经验;
3.较强的数据处理能力,可以归拢、整合数据,透过数字分析推演出新的需求和目标;
4.具备优秀的沟通能力和团队协作精神,能够跨部门推动项目进展,擅长从数据与评估中发现有价值的产品改善建议并推动落地;
5.具有较强的逻辑思维能力,对GenAI领域怀有巨大的热情与热爱,具备出色的好奇心与学习能力,能适应快节奏的工作方式。
加分项:
1.有视频生成模型(T2V/R2V)或世界模型相关领域的实际从业经历;
2.拥有院线类电影、头部影视项目的相关实际从业经历;
3.具备良好的行业视野,能持续跟踪多模态模型技术趋势与市场动态…

小红书 模型压缩算法研发工程师/专家

全职 北京,上海
招聘城市:北京,上海
…化等;
2、参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持业务降本增效;
3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件,制定不同的模型压缩方案并在业务落地;
任职要求:
1、熟悉蒸馏、剪枝、量化等模型压缩常用方案,参与或主导过大型项目业务落地或有相关论文者优先;
2、熟悉至少一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现;
3、熟练使用Python/C++至少一种语言,并具备良好的代码质量和风格;
4、有强烈的工作责任心,较好的学习能力、沟通能力和技术规划能力;
5、有模型压缩或小型化模型设计经验者优先;
6、有优秀…
招聘城市:北京
…负责生成式模型预训练相关的工作,包括但不限于:大规模模型预训练,长文本预训练,线性模型结构探索;
2.探索与跟进前沿技术,寻求技术突破,推动机器在AIGC能力的提升和突破;
3.探索高效的模型知识嵌入方法以及模型知识在线学习更新;
4.探索文本模型预训练的scaling law,在小规模小成本下更精准地预测大规模训练后的表现。
岗位要求:
1.熟练掌握Python,熟悉Linux环境开发,精通应用深度学习框架TensorFlow或者PyTorch;
2.持续跟进前沿的深度学习技术,了解前沿的深度学习相关算法,熟悉Transformer等模型结构;
3.具备分析问题定义问题和解决问题能力,具备持续的自驱力来面对挑战;
4.有大规模模型预训练实践经验者…
招聘城市:杭州
…标注与管理经验,具备从训练数据到模型效果评估再到优化的完整闭环经验;
3.较强的数据处理能力,可以归拢、整合数据,透过数字分析推演出新的需求和目标;
4.具备优秀的沟通能力和团队协作精神,能够跨部门推动项目进展,擅长从数据与评估中发现有价值的产品改善建议并推动落地;
5.具有较强的逻辑思维能力,对GenAI领域怀有巨大的热情与热爱,具备出色的好奇心与学习能力,能适应快节奏的工作方式。
加分项:
1.有视频生成模型(T2V/R2V)或世界模型相关领域的实际从业经历;
2.拥有院线类电影、头部影视项目的相关实际从业经历;
3.具备良好的行业视野,能持续跟踪多模态模型技术趋势与市场动态…

小红书(xiaohongshu) 商业化审核模型运营高级专家

全职 北京,上海,武汉
招聘城市:北京,上海,武汉
…的核心痛点,并能够基于主流模型能力及AI平台能力,设计结合Prompt工程、RAG应用等能够解决场景问题/难度业务的应用方案,提升业务效率;
3、项目实施与效果把控:主导场景应用链路搭建,管理并行项目落地,把控从数据清洗、Prompt优化到模型调优、模型评估的全流程智能应用,建立对应用使用情况的核心指标监控体系,并确保应用投入与使用在项目中的ROI达标;
4、运营体系沉淀:构建可复用的prompt指令库、ai工具库,沉淀不同场景的应用解决方案,并推动方案在业务线规模化应用。
任职要求:
1、熟练使用SQL、Excel等数据分析工具,对数据和指标有清晰的认知,有较好的分析能力;
2、有模型相关标…

小红书 模型推理框架研发工程师/专家

全职 北京,上海
招聘城市:北京,上海
…工具、RedServing 推理部署引擎、DirectLLM 模型 API 服务、QuickSilver 模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
工作职责:
1、参与/负责研发面向语言模型(LLM)/多模态模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
4、参与/负责构建推理框架的系统容错能力,包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设;
5、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理、推理部署、日志…
招聘城市:北京
评测范式:设计并建立一套能系统性地衡量模型在开放、真实、复杂场景下的真实能力评测体系(包括不局限于Agent、Tool Use、Code、Search等),以科学地探索并定义模型的认知边界;
2.构建严谨、高效的评测数据体系:能将对模型能力的理解转化为科学、严谨的数据设计与rubrics标注规范,构建自动化评测数据合成算法,为整个评测体系提供高质量的数据基石;
3.评测算法研究:研究实现高效、精准的模型性能归因分析算法,准确定位模型薄弱区间。
岗位要求:
1.解决问题能力: 具备基于第一性原理的卓越问题解决能力,能自主应对模型评测与诊断中的核心挑战;
2.评测分析经验: 具备从评测体系构建到深度性能诊断、评测结果分析的评测
招聘城市:上海
评测数据处理效率和质量,进而提升模型迭代效率和效果;
4.紧跟业界和学术界智能评测前沿,发现其亮点和前进动态,借此不断完善现有智能评测体系。
岗位要求:
1.具备扎实的视频/NLP/多模态领域算法基础,能深刻理解模型的基本原理(transformer架构、预训练、后训练等);
2.熟练掌握并实践模型相关算法技术,包括但不限于SFT/LoRA/CPT/RL/PE等,参与过模型(视频/图文/音频/文本)智能评测实际开发;
3.熟练掌握Pytorch/TensorFlow等主流开发框架,代码熟练且动手能力强;
4.具备良好的逻辑思维能力和数据处理能力,善于发现问题并提出系统性解决方案,具备良好的团队协作精神。
加分项:
1.实际参与模型产品0到1智能评测
招聘城市:深圳
评测数据处理效率和质量,进而提升模型迭代效率和效果;
4.紧跟业界和学术界智能评测前沿,发现其亮点和前进动态,借此不断完善现有智能评测体系。
岗位要求:
1.具备扎实的视频/NLP/多模态领域算法基础,能深刻理解模型的基本原理(transformer架构、预训练、后训练等);
2.熟练掌握并实践模型相关算法技术,包括但不限于SFT/LoRA/CPT/RL/PE等,参与过模型(视频/图文/音频/文本)智能评测实际开发;
3.熟练掌握Pytorch/TensorFlow等主流开发框架,代码熟练且动手能力强;
4.具备良好的逻辑思维能力和数据处理能力,善于发现问题并提出系统性解决方案,具备良好的团队协作精神。
加分项:
1.实际参与模型产品0到1智能评测
招聘城市:深圳
评测任务调度、数据管理、结果分析等核心系统,保障平台稳定性与可扩展性;
3.构建自动化评测流水线,提升评测效率与研发迭代速度;
4.与算法、产品团队紧密协作,理解评测需求并转化为可落地的技术方案。
岗位要求:
1.本科及以上学历,计算机相关专业,5 年以上后端开发经验;
2.扎实的系统设计能力,有复杂业务系统或平台型产品的架构经验;
3.熟练掌握 Python/Go 等至少一门语言,熟悉常用框架与中间件;
4.熟悉分布式系统、任务调度、消息队列等技术,有高并发系统开发经验;
5.良好的沟通与协作能力,能够推动跨团队合作。
加分项:
1.有 MLOps/LLMOps 平台建设经验,熟悉模型训练、推理、评估等流程;
2.熟悉模型评测

小红书 模型训练框架研发工程师/专家

全职 上海,北京
招聘城市:上海,北京
…DirectLLM 模型 API 服务、QuickSilver 模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline;
2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决 RL 算法在超长时序下的显存/通信瓶刭
3、构建端到端后训练工具链,主导框架与 MLOps 平台集成,提供训练可视化、自动超参搜索等生产级能力
4、与公司各算法部门深度合作,参与语言模型LLM、多模态模型 MLLM等业务在 SFT/RL领域的…
招聘城市:深圳
…生成、多模态理解等全面、多维度的评测体系;
2.评测流程:熟悉模型评测流程的实际执行与落地,协同多方相关团队高效完成评测工作,定期监控模型效果,分析问题并提供优化方案;
3.行业动态洞察:持续完善快速评测体系构建、快速反馈行业动态及模型能力,发现行业模型以及应用的前进方向、亮点;
4.结果归因:通过各种数据分析方法,深度分析模型评测结果,为模型的更新调优提供精准的问题分析结论。
岗位要求:
1.计算机/数字媒体/影视平面(建模师、独立开发者等)等相关专业硕士或以上学历,对该领域有深度了解,1年以上工作经验;
2.了解AI模型技术原理,对模型相关产品有过深度体验;
3.拥有出色的沟通协调能力…