牛大妈在社招职位搜索AAA信用评级 有 729 条结果

小红书 模型标注-AI应用评测专家

全职 北京,上海
招聘城市:北京,上海
岗位职责:
1、负责大模型效果的全生命周期的评测产品工作,与算法、工程、前端产品协同;
2、效果标准的制定,基于业务场景研究及语料分析,定义特定场景下的理想效果,同时对问题下钻分析,持续挖掘和特征提炼,推动专项的解决,形成数据飞轮;
3、搭建内外部体验视角下的效果量化指标,从用户视角定义高质量优质语料和体验问题,通过科学置信的量化指标,协同算法、数据持续推动效果迭代;
4、评估体系的设计与专业评估报告输出,建立系统、科学、完善的评估体系,从用户视角出发,形成模型效果有效的驱动力。
任职要求:
1、具备3-5年搜索、大模型相关评测产运工作经验,对模型技术应用具有热情;
2、对PE、精调、RAG等大…

小红书(xiaohongshu) 商业体验与服务 - 智能体评估运营

全职 上海,北京,杭州,武汉
招聘城市:上海,北京,杭州,武汉
岗位职责:
1.建立完善的agent标注规范和质量评估标准体系
2.负责数据的标注、清洗和质量归因的日常管理
3.根据归因结果推动模型和知识库的持续迭代和优化
4.设计agent能力评估指标,能多维度评估模型能力
5.为评估质量和效果负责
任职要求:
1、本科及以上学历,AI数据标注或模型评估管理的相关工作经验
2、熟悉自然语言处理和对话系统评估方法
3、具备团队合作精神,能有效推进问题解决
4、强烈的ownership意识,能承受快速迭代的业务压力

小红书(xiaohongshu) 模型标注-海外搜索评测

全职 杭州,北京,上海
招聘城市:杭州,北京,上海
岗位职责:
1. 指标体系构建: 负责海外搜索(双列/AI Search)业务的评估体系搭建,定义和制定搜索相关性、内容质量、AI回答有用性等核心评测指标(Metrics);
2. 方向拟定与策略驱动: 基于评测数据和Badcase分析,洞察海外用户搜索意图与需求,制定产品迭代方向,并驱动算法和工程团队优化模型效果;
3. 评测标准制定: 制定并持续迭代评测SOP(标准作业程序),确保评测标准的客观性与一致性,解决评测过程中的边缘(Edge Case)争议;
4. 竞品分析: 监控海外主流竞品(如Google, Perplexity等)的动态与效果,输出对比评测报告,明确产品在行业中的优劣势。
任职要求:
1. 背景要求: 本科及以上学历,计算机、数学、统计学或相关专业优先;2年以上搜索、推荐或…

小红书(xiaohongshu) AI搜索评测产品经理

全职 北京,上海
招聘城市:北京,上海
岗位职责:
AI 正在重塑搜索的底层逻辑。从意图理解到 AIO 聚合生成,从图文到多模态——评测,是这一切发生的地基。我们需要把"搜得好不好"变成可量化、可迭代的评估体系。
1、负责 AI 搜索的评测产品设计,覆盖搜索大盘评估、策略迭代评估及 RL 训练数据支持,建立自动化评估能力
2、与模型、算法团队协作,将搜索质量问题拆解为可量化的评估指标和标注方案
3、探索多模态场景(语音、图片、视频)的评测方法,设计差异化评估框架
4、推动评测结果落地,影响策略方向和产品决策,而不只是出报告
任职要求:
1、5年以内工作经验,有评测体系设计经验,理解搜索产品逻辑
2、理解 LLM 基本能力边界,对 AI 评测(标注质量、自动化评估…

小红书(xiaohongshu) 点点AI评测产品经理

全职 北京,上海
招聘城市:北京,上海
岗位职责:
AI 正在重塑搜索的底层逻辑。从意图理解到 AIO 聚合生成,从图文到多模态——评测,是这一切发生的地基。我们需要把"搜得好不好"变成可量化、可迭代的评估体系。
1、负责 AI 搜索的评测产品设计,覆盖搜索大盘评估、策略迭代评估及 RL 训练数据支持,建立自动化评估能力
2、与模型、算法团队协作,将搜索质量问题拆解为可量化的评估指标和标注方案
3、探索多模态场景(语音、图片、视频)的评测方法,设计差异化评估框架
4、推动评测结果落地,影响策略方向和产品决策,而不只是出报告
任职要求:
1、5年以内工作经验,有评测体系设计经验,理解搜索产品逻辑
2、理解 LLM 基本能力边界,对 AI 评测(标注质量、自动化评估…
招聘城市:深圳
岗位职责:
1.Benchmark 构建与管理:负责高质量评测数据集的挖掘、清洗、标注与动态更新,设计长尾场景测试集,专门捕捉模型在极端或复杂指令下的失效点;
2.自动化评测流水线开发:搭建自动评测框架,集成主流开源评测工具(如 OpenCompass, VLMEvalKit 等)。开发基于模型的自动评分器,提升评测效率并保持与人工评价的高一致性;
3.AIGC 专项评测:建立图像/视频生成的质量评估体系,涵盖视觉效果、语义遵循、物理规律等维度,并解决生成内容的主观评价量化难题。
岗位要求:
1.教育背景:计算机、数学、数据科学等相关专业硕士及以上学历;
2.方法论深度:熟悉各类评测技术(如 A/B Testing, Elo Rating, LLM-as-a-Judge),能独立设计复杂的评测实验。了解 LLM…
招聘城市:北京,上海
岗位职责:
我们负责小红书 Agent 平台的评测建设,为基座大模型、多模态及各类 Agent 应用提供全生命周期的评测支撑。工作从平台架构、评测数据的挖掘采集与打标,到自动化评测引擎、Badcase 归因诊断,再到开发者工具链与生态建设,全程一手主导。我们相信评测是 AI 产品的生命线,直接影响全公司的 AI 迭代效率。我们期待工程能力扎实、能独立破局的人加入,一起把它做好。
工作职责
1、评测平台架构与建设:负责 LLM 及 AI 应用评测平台的架构设计与核心开发,构建对基座大模型、多模态(图/文/音/视)、Agent 及各类 Tools/Skills 的自动化评测能力
2、评测数据挖掘与生产:负责评测数据的挖掘、采集、清洗与…

腾讯(tencent) AI评测工程师

全职 深圳
招聘城市:深圳
岗位职责:
1.负责医疗 Agent 核心业务的质量评测工作,覆盖健康问问、AI 诊室、医保智能助手等场景,围绕意图理解、多轮交互、信息收集、工具调用、结果生成、异常兜底等关键环节,完成评测方案设计、落地、结果记录与问题反馈;
2.参与医疗复杂场景专项评测,包括 AI 问诊流程、科室/服务匹配、医保政策问答与办理指引、多模态报告解读等场景,沉淀可量化、可复用的评测方法和评估标准;
3.推动评测数据与自动化能力建设,建设高质量评测集、标准答案、链路 Trace 标注规范和评测流水线,支持人工评测、规则评测及自动化评测任务落地;
4.跟进线上 Badcase 分析与问题闭环,针对医疗安全、内容安全、隐私合规、诊疗建议边界等高风险问题,协助定位问题原因,并推动产品、算法…

小红书 模型标注-AI安全模型数据运营

全职 北京,上海,武汉
招聘城市:北京,上海,武汉
岗位职责:
1、 独立刻画出符合当前业务场景需求的安全数据体系,包括不限于常规的审核风险体系、生态风险体系等。
2、协同算法设计模型数据策略方案,涵盖专项、非专项安全场景下安全数据训练策略。
3、从模型的数据样本建设、评测体系设计、安全标注自动化升级等,能从模型底座能力上解决策略、模型在用户问题上带来的误伤,漏放。
4、有比较强的agent协同理解,同时具备一定PE技巧,推动安全在各类问题上以自动化形式解决,搭建安全PE-workflow,提升各团队工作效能。
5、能够和算法讨论出适配于不同场景下模型的安全能力(基于数据本身),需要协助算法做好问题分析、数据筛选、策略过滤、模型效果验证。
任职要求:
1、本科及以上学历…
招聘城市:深圳
岗位职责:
1.负责AI Agent全链路评测与质量保障工作,聚焦Agent能力基准测试、自动化评测基座建设及分级评测指标定义;
2.针对AI生成的非确定性与参数化特点,设计并量化评测标准,搭建科学的分级评测指标体系;
3.主导构建高质量的基准测试集(Benchmark),覆盖多轮交互、长短上下文等复杂场景,解决AI生成结果验证标准量化的核心难题;
4.参与设计和研发Agent自动化评测基座,通过构建自动化测试脚本和引入大模型交叉验证(LLM-as-a-Judge)机制,提升评测效率;
5.建立高效的缺陷定界机制,精准判断问题根因,输出多维度评测报告并协同开发团队推动问题解决。
岗位要求:
1.本科及以上学历,计算机、软件工程、人工智能等相关…
招聘城市:重庆
岗位职责:
1.负责AI社交对话能力相关数据的标注工作,确保标注数据准确、完整且符合项目要求;
2.对AI在情感陪伴、心理支持等社交场景下的回复质量进行全面评估;
3.精准判断AI回复是否具备同理心,准确识别AI对用户情感的判断情况;
4.从用户意图理解、情感共鸣等多个维度对AI回复进行细致的质量评分;
5.积极参与社交场景标注规范的制定工作,并根据实际情况对规范进行优化;
6.与团队成员保持良好沟通,及时反馈标注与评估过程中发现的问题。
岗位要求:
1.本科及以上学历,有1年以上团队管理经验,心理学、社会学、语言学等相关专业优先;
2.具备良好的文字理解能力和语言表达能力,能够准确理解和…

美团(meituan) 信贷风险策略专家

全职 上海
招聘城市:上海
部门介绍:
美团金融服务平台成立于2016年,以“场景+金融”模式,携手合作伙伴构建开放生态,为美团平台用户和商户提供底层账户、支付通道、信贷、保险和理财等金融解决方案。我们致力于以科技为核心,助力金融机构打通金融普惠“最后一公里”。我们期待与大家共同完成每一件平凡而卓越的事情,一起为用户提供优质的产品体验,守护用户的资金安全,让生活变得更美好。
岗位职责:
智能决策: 深度洞察美团生态业务,结合AI能力,主导信贷产品准入、额度、定价等核心风险策略的迭代优化,推动策略向“智能生成”转型。
模型共建: 与算法、模型团队紧密协作,参与从特征工程到模型选择的全过程,并重点负责推动AI/ML模型在风险策略中的应用…
招聘城市:深圳
岗位职责:
1.知识管理体系建设:负责平台知识库管理系统的架构设计与持续优化,主导多路检索融合方案(向量检索、图谱检索、文本检索等)的设计与落地,提升知识召回精度与效率;
2.Agent 评测体系搭建:主导 AI Agent 评测体系的设计与实施,包括评测基准构建、评测数据集建设、自动化评测工具链开发,形成从 Badcase 发现到效果闭环的系统化能力;
3.模型能力优化:针对知识库场景进行检索模型、排序模型的训练与调优,运用大模型微调(如 LoRA、数据合成等)手段提升垂直领域效果,推动模型轻量化与效果平衡;
4.技术带头人:带领技术团队进行核心技术攻关,制定技术路线与迭代计划,在有限资源下实现高 ROI 的技术产出;
5.业务落地推进…
招聘城市:重庆
岗位职责:
1.负责AI知识问答、记忆能力相关数据的标注与质量评估工作,确保标注结果准确可靠;
2.对AI生成回答的事实准确性进行系统性核查与验证,识别潜在错误或偏差;
3.评估AI模型的知识储备水平、信息检索效率及记忆提取能力表现;
4.专项识别AI回答中存在的知识性错误、过时信息或逻辑不通等问题;
5.系统整理典型标注案例,参与优化知识标注规范与评估标准体系。
岗位要求:
1.本科及以上学历,有1年以上团队管理经验,专业背景不限;
2.具备跨领域常识储备,对科技、历史、文化等常见领域有基础认知;
3.熟练运用搜索引擎等工具进行高效信息检索与交叉验证;
4.工作态度细致认真,对事实细节具有高度敏感…
招聘城市:广州
岗位职责:
1.评测体系设计:主导 AI 产品的评测体系搭建,定义评测维度、指标、标准和流程,确保评测的科学性和全面性;
2.评测方法论制定:设计适配不同场景(对话、工具调用、多轮交互、创意生成等)的评测方案,包括自动评测、人工评测、众包评测、竞品对比等;
3.评测平台产品设计:规划评测平台的产品架构和功能模块,输出 PRD,驱动研发团队落地;
4.评测洞察与决策支持:深度分析评测数据,发现产品体验问题和模型能力短板,输出有洞察力的评测报告,推动产品和算法团队优化;
5.竞品评测与行业跟踪:持续跟踪业界竞品的能力变化,建立常态化竞品评测机制;
6.标注体系管理:设计标注规范和质量控制流程,确保评测数据质量。
岗位要求…

腾讯(tencent) AI政策分析经理

全职 北京
招聘城市:北京
岗位职责:
1.敏锐把握有关部门关于AI的政策要求、监管动态,梳理制定因应方案,避免政策法律风险,助力公司AI业务合规运营;
2.深刻了解公司AI产品的发展规划和动态,及时解读传导政策要求,加强产品协同,服务产品发展;
3.密切关注AI领域的技术发展动态和行业趋势,结合本部门的工作内容,研发AI 应用工具,助力本部门和公司业务的提质增效。
岗位要求:
1.本科以上学历,具备计算机、人工智能、数据科学或相关领域技术背景者优先,五年以上相关工作经验;
2.具有敏锐的前瞻性视野,能够持续及时关注到AI行业的技术演进、应用创新、政策动向;
3.熟悉主管部门和行业机构的办事程序,具有较强的政策分析能力,能够深刻理解政策要求…
招聘城市:北京
岗位职责:
1.需求承接与规则制定:作为AI视频方向数据对接人,深入理解视频生成模型各阶段的数据需求,日常和算法/产品团队对接,主导将算法需求转化为可执行的标注规则与评测标准,并持续迭代优化;
2.项目全流程管理:独立负责AI视频方向多个并行标注/评测项目的全生命周期管理,包括需求拆解、排期规划、资源调度、进度管控、质量验收与交付复盘,确保项目按时保质交付;
3.交付质控体系搭建:主导各类项目交付和团队情况评估,部署团队,搭建视频标注与评测的质量管控体系,持续提升交付准确率,确保如期完成项目交付;
4.评测驱动迭代:对人工评测体系建设(含评测维度定义、评测集构建、评测报告撰写)有了解,基于评测结果进行bad case…
招聘城市:广州
岗位职责:
1、负责企业微信AI算法的评测标准和评测流程制定,构建评测集,并推进评测执行,分析评测结果,对模型质量给予充分评估。
2、负责NLP、ASR、MLLM等相关领域产品的交付品质,制定合理的验收机制,来评估模型品质,指导模型优化方向。
3、建设相关评测体系和流程,推动AI算法评测高效高质落地。
岗位要求:
1、计算机或者人工智能等相关专业,本科学历及以上;
2、有大模型训练或模型评估经验,熟悉大模型评测方法 , 有大模型Bench数据接入经验优先;
3、对预训练语言模型、精调、PE、RAG等大模型技术有一定理解;

小红书(xiaohongshu) AI评测平台架构师

全职 北京,上海
招聘城市:北京,上海
岗位职责:
1、主导 AI 评测平台总体架构设计,建设统一、可扩展的评测基础设施,支持大模型、Agent、RAG、Tool及端到端 AI 应用的质量评估。
2、建立分层评测体系,覆盖模型能力评测、Agent 推理过程评测、工具调用评测、上下文与记忆评测、RAG 评测及端到端体验评测。
3、设计评测数据资产体系,统一管理评测集、线上采样、Bad Case、人工标注、合成数据和竞品数据,支持数据清洗、去重、分层、版本、血缘及权限治理。
4、建设评测集持续演进机制,将新业务场景、线上问题、模型升级和产品变化转化为新增评测样本,保持评测覆盖度、区分度和时效性。
5、设计统一的评测指标与规则体系,支持客观指标、规则评测、模型评审和人工评审,并建立…
招聘城市:广州
岗位职责:
1.评测工具开发:设计并开发 AI Agent 评测工具和自动化评测流水线,支持对话质量、任务完成率、安全性等多维度评测;
2.评测模型开发:基于 LLM 构建自动评测模型(如 Model-as-Judge),实现对 Agent 输出质量的自动化打分与分析;
3.评测平台建设:参与评测平台的架构设计与开发,支持评测任务管理、数据管理、结果可视化等功能;
4.数据处理与分析:构建评测数据集,开发数据清洗、标注管理、统计分析等配套工具;
5.持续优化:跟踪业界前沿评测方法,持续优化评测效率和准确性。
岗位要求:
1.本科及以上学历,计算机科学、人工智能、软件工程等相关专业,3 年以上开发经验;
2.熟悉 Python/Nextjs,熟悉至少一门后端语言(Go/Java/C++),熟悉 Linux…