牛大妈在社招职位搜索模型压缩 有 111 条结果

小红书 大模型压缩算法研发工程师/专家

全职 北京,上海
招聘城市:北京,上海
…化等;
2、参与/负责多个业务场景中的模型压缩技术实现,对模型进行轻量化压缩,提高训练/推理效率,支持业务降本增效;
3、参与/负责针对英伟达GPU、华为昇腾NPU等不同的计算硬件,制定不同的模型压缩方案并在业务落地;
任职要求:
1、熟悉蒸馏、剪枝、量化等模型压缩常用方案,参与或主导过大型项目业务落地或有相关论文者优先;
2、熟悉至少一种主流的深度学习训练或推理框架(TensorFlow / PyTorch / Onnx / TensorRT等)的原理和实现;
3、熟练使用Python/C++至少一种语言,并具备良好的代码质量和风格;
4、有强烈的工作责任心,较好的学习能力、沟通能力和技术规划能力;
5、有大模型压缩或小型化模型设计经验者优先;
6、有优秀…
招聘城市:深圳
…参与LLM大模型压缩加速方案研究,包括不限于:;
2.投机采样:适配LLM模型架构特性,探索Prefill / RL等场景下优化加速方案;
3.稀疏化:Sparse Attention,KV-Cache压缩模型结构剪枝等优化技术,协同框架定制化稀疏方案,提升模型推理性能;
4.量化:优化Transformer中 Linear/KV-Cache/Attention量化算法,适配FP8/INT8/NVFP4等量化方案及不同硬件后端。探索极低bit量化训练方案,深度协同硬件联合优化,实现模型体积极致压缩和性能突破,并推动实际业务落地;
5.新技术:聚焦长上下文,多轮对话优化等压缩加速优化技术研究;
6.设计可落地的大模型压缩算法及成本优化方案,助力大模型的性能加速,不限于模型结构/软硬协同优化;
7.分析业务性能瓶颈和模型特点…
招聘城市:北京,上海
压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为其提供开箱即用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。
工作职责:
1、参与/负责大模型推理服务平台(MaaS)的架构设计、系统研发、产品研发等工作;
2、深入参与面向大模型场景的…

小红书 大模型推理框架研发工程师/专家

全职 北京,上海
招聘城市:北京,上海
…引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
工作职责:
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、参与/负责KV Router、PD分离/EPD分离、KVCache管理、动态PD调整等分布式推理能力建设;
3、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
4、参与/负责构建推理框架的系统容错能力,包括但不限于请求迁移、优雅退出、故障检测、自愈等能力建设;
5、深度参与周边深度学习系统多个子方向的工作,包括但不限于模型管理…

小红书 大模型训练框架研发工程师/专家

全职 上海,北京
招聘城市:上海,北京
…RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、参与设计实现支持RLHF/DPO等对齐技术的高效训练框架,优化强化学习阶段的Rollout、Reward Model集成、多阶段训练 Pipline;
2、研发支持多机多卡 RL 的分布式训练框架,开发TP/PP/ZeRO-3与RL流程的动态协同机制,解决 RL 算法在超长时序下的显存/通信瓶刭
3、构建端到端后训练工具链,主导框架与 MLOps 平台集成,提供训练可视化、自动超参搜索等生产级能力
4、与公司各算法部门深度合作,参与大语言模型LLM、多模态大模型 MLLM…

小红书(xiaohongshu) 大模型平台产品运营专家

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
岗位职责:
工作职责
1.大模型生产平台:负责大模型平台核心功能的需求分析与产品设计,覆盖数据集建设、模型训练、模型压缩/量化、推理部署、模型评估等全链路,持续提升算法工程师的模型迭代效率和产品体验;
2.Agent 应用平台:负责面向公司内部业务的 Agentic 能力产品规划,包括 Agent 编排框架、工具调用市场、Prompt 管理、多轮对话、一句话生产助手、训练异常诊断智能体等模块,推动平台 AI Native 转型落地;
3.GPU 资源管理:将 Quota 管理、故障机自动化处理、潮汐调度等底层能力产品化,让资源管理对用户透明、可控、易用;
产品交付与跨团队协作:组织需求评审,制定产品排期,与算法、工程等同学紧密配合,保障高质量交付。
4.用户运营与 NPS:建立平台用户…
招聘城市:北京,上海,杭州
…我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、负责大模型平台的架构设计和核心功能研发,构建云原生架构,设计高可用、高性能的微服务体系;
2、负责构建面向大模型全流程的DevOps,与下游云原生平台深度融合,支撑大模型在公司内各业务生产链路…
招聘城市:北京
岗位职责:
我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地!
1、参与/负责研发面向大语言模型(LLM)/多模态大模型(MLLM)等类型模型的推理服务框架;
2、通过并行计算优化、分布式架构优化、异构调度等多种框架技术,打造高效、易用、领先的AI推理框架;
2、深度参与周边深度学习…
招聘城市:北京,上海,杭州
…参与小红书大模型平台 QuickSilver 的全栈研发工作,借助 AI 编程工具高质量完成从前端交互界面到后端业务逻辑的端到端功能交付,构建覆盖全链路的监控告警与可观测数据体系。
2.AI Workflow 工程链路建设: 参与大模型数据管理、模型训练、模型压缩、推理部署等核心工具链的研发;协同算法与产品团队,优化云原生环境下的 AI 工作流范式,持续提升模型迭代效能。
3.分布式 GPU 调度与治理: 参与平台核心的 Quota 管理与资源调度模块开发,攻坚多机房、多集群、异构计算资源(GPU / NPU / PPU)下的多租户配额治理、弹性伸缩与碎片优化。
4.AI 前沿技术预研与落地: 持续追踪 AI 基础设施与大模型平台的前沿技术动态…

小红书(xiaohongshu) 大模型 Infra 全栈研发工程师/专家

全职 北京,上海,杭州
招聘城市:北京,上海,杭州
…操作系统底层知识,有深度学习相关框架的理解认知。
3.框架实战能力:深入理解并具备修改 PyTorch 等主流深度学习框架源码的能力,对前沿模型架构有敏锐嗅觉,熟悉 Transformer、ViT,并对 Mamba、Linear Attention 等新型架构的计算特性有了解。需在以下至少一个方向有实战经验:
(1)训练: 掌握 RLHF/DPO 全流程,精通 3D 并行(TP/PP/DP)、序列并行及 ZeRO 策略,熟悉大规模集群 GPU 调度容错机制。
(2)推理: 深入理解 vLLM、SGLang 等推理框架底层逻辑,精通 KV Cache 管理、PagedAttention、Chunked Prefill 等技术。
(3)压缩: 精通 SmoothQuant、AWQ、GPTQ 等量化算法,有大模型或多模态模型压缩落地的成功经验。
4.底层性能优化:具备面向大模型性能优化的底层认知,覆盖芯片架构、通信机制与 Kernel…
招聘城市:北京
…开发和应用模型压缩技术(包括但不限于量化、稀疏化等)
* 优化推理框架,支持多种硬件平台(GPU、专用AI芯片)
* 设计并实现高效、稳定、可扩展的推理服务架构
2. 性能分析与调优:
* 建立性能基准测试框架,持续监控和评估推理性能
* 分析性能瓶颈,提出并实施优化方案
* 针对不同应用场景(实时对话、批量处理等)定制优化策略
3. 技术创新与落地:
* 跟踪最新研究成果,将前沿优化技术应用到生产环境
* 与算法团队合作,参与模型架构的推理友好设计
* 编写高质量的技术文档和最佳实践指南
岗位要求:
1.必备条件:;
2.计算机、软件工程、人工智能等相关专业本科及以上学历;
3.扎实的 C++/Python 基础;
4.熟悉 PyTorch 或 JAX 等深度学习框架,了解模型训练与推理…
招聘城市:成都
岗位职责:
1.负责大模型(LLM/VLM)在企业微信客户端(iOS/Android/Windows/Mac)的端侧部署、推理优化和性能调优;
2.研究和应用模型压缩技术(如量化、剪枝、蒸馏等),实现大模型在端侧设备的高效运行;
3.与客户端开发团队紧密合作,设计并实现端侧AI推理框架,优化内存占用、计算效率和功耗表现;
4.探索端侧与云端协同的智能计算架构,在保证用户体验的前提下实现最佳的性能与效果平衡;
5.跟踪端侧AI技术的最新进展,并将创新技术应用于企业微信产品中。
岗位要求:
1.计算机科学、人工智能、电子工程或相关专业硕士及以上学历;
2.熟练掌握C++/Python,熟悉常见的深度学习框架(PyTorch/TensorFlow等…
招聘城市:广州
岗位职责:
1.负责大模型(LLM/VLM)在企业微信客户端(iOS/Android/Windows/Mac)的端侧部署、推理优化和性能调优;
2.研究和应用模型压缩技术(如量化、剪枝、蒸馏等),实现大模型在端侧设备的高效运行;
3.与客户端开发团队紧密合作,设计并实现端侧AI推理框架,优化内存占用、计算效率和功耗表现;
4.探索端侧与云端协同的智能计算架构,在保证用户体验的前提下实现最佳的性能与效果平衡;
5.跟踪端侧AI技术的最新进展,并将创新技术应用于企业微信产品中。
岗位要求:
1.计算机科学、人工智能、电子工程或相关专业硕士及以上学历;
2.熟练掌握C++/Python,熟悉常见的深度学习框架(PyTorch/TensorFlow等…
招聘城市:北京
…多模态大模型(eg: deepseek、lama、qwen)的工程化落地,设计数据清洗-训练-推理全链路优化方案‌;
2、构建可复用的工程模块(如自动标注系统、场景仿真工具、测评平台),支持算法快速迭代‌;
3、攻坚大模型系统优化技术(模型压缩、硬件加速),让大模型能顺利落地各个业务场景;
任职要求:
1、计算机相关专业,5年以上Java/python/c++开发经验;
2、熟练掌握Transformer架构及其优化技术‌
3、有ai知识库、agent平台优先;
4、熟悉大模型全流程工具链(如Hugging Face);
‌5、具备多模态数据处理能力(文本/图像/语音)
6、理解垂直领域需求(eg 对话机器人),能将生成式模型与业务逻辑结合‌,有企业级落地经验优先;
7、有一定英语读写能力,能无障碍阅读大模型相关paper…

美团(meituan) 大模型与智能体算法工程师

全职 北京,上海
招聘城市:北京,上海
…技术发展,创造行业价值。
1. 负责大模型在业务场景下关键能力的提升,包括但不限于知识和指令遵循、分析诊断、深度推理、反思和评估等能力的优化和落地。
2. 深入理解商家服务和经营分析等业务场景,通过任务抽象,能够提炼出这些核心场景的系统性优化方向,提升B端应用的核心价值和体验,赋能行业升级。
3. 研发和优化智能体的function call、多智能体间协调,使其能够高效、准确地调用内部和外部工具,扩展智能体的应用边界。
4. 结合自主Agent的理念,探索和优化模型的能力边界,推动模型在复杂任务上的表现。
5. 与工程团队紧密合作,推动算法模型的工程化落地,包括模型压缩、加速、部署和监控等环节…

小红书(xiaohongshu) 基础模型算法工程师

全职 北京,上海
招聘城市:北京,上海
…研发,也可以直接看到模型被部署到 AI Agent、AI 搜索、搜索、推荐、广告等真实业务场景,并服务海量用户。
你将参与经济高效的LLM model研发,具体工作包括
- 高效率模型架构探索: 面向核心业务能力需求和主流 GPU 架构,探索更高效的模型结构、参数规模与解码范式。
- Pre-training 与模型压缩: 研究预训练、Mid-training、剪枝、Pre-training Distillation 等技术,提升单位参数与单位算力的模型能力。
- Post-training 与能力蒸馏: 研究 SFT、RL、OPD 等后训练与蒸馏技术,在更小模型规模下最大化能力保持。
- 业务落地与规模化应用: 将高效率模型应用于小红书 Agent、AI 搜索、传统搜索、推荐、广告等真实用户场景,并持续优化效果与成本。
任职要求:
- 有大模型 Pre…
招聘城市:深圳
…投机解码、剪枝、KV Cache 压缩等等);
2.通过分析模型和任务性能瓶颈,设计创新的算法优化方案,提升多模态大模型的推理效率,显著降低端到端延迟;
3.作为算法与框架团队之间的技术桥梁,聚焦于图像理解、视频生成、音频理解生成、视觉多轮交互、实时对话等任务,提升模型在推理端的性能;
4.高效协同框架开发及业务算法团队,确保技术方案落地。撰写高质量的技术文档与实验报告,并组织内部分享,推动团队整体技术认知提升。
岗位要求:
1.拥有计算机科学、人工智能、电子工程、自动化等相关专业。具备扎实的机器学习/深度学习基础;
2.精通Python编程,熟练掌握PyTorch等深度学习框架。对Transformer、Diffusion等模型架构、计算瓶颈与优化方法论有深刻理解; 具…

腾讯 腾讯云-AI大模型SRE工程师

全职 深圳
招聘城市:深圳

1.本科及以上学历,3年以上工作经验,有机器学习平台相关开发或运维经验;
2.熟练使用 Go /Python/ Shell 等一种或多种编程语言,善于使用自动化/智能化方法让服务稳定高效;
3.熟悉容器技术,掌握K8s、 Docker 的技术原理,有实际使用和运维经验;
4.深入了解GPU架构与并行计算,掌握CUDA编程实践,熟悉RDMA网络通信技术、NCCL集合通讯,大模型分布式训练与推理架构及模型压缩技术;
5.对于AI大模型应用的构建、部署和维护过程有深入理解;
6.有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
7.具有良好的沟通协调能力,较好的团队合作精神、责任心和一定抗压能力。
岗位介绍:
在腾讯,优秀的技术…

小红书(xiaohongshu) AI平台资深技术专家

全职 北京,上海
招聘城市:北京,上海
…至少两门语言,有良好的架构设计与编码能力。
3、熟悉云原生技术栈(K8s、Docker、微服务体系),具备平台系统研发经验。
4、了解深度学习训练/推理框架(如 PyTorch/TensorRT/ONNX)及大模型研发流程。
5、有 MLOps/平台工具链/模型服务化等方面实践经验,理解 AI 工程体系。
6、具备优秀的沟通协作能力,能够推动复杂平台项目跨团队落地。
7、有 Owner 意识,具备产品思维,关注工程质量、可维护性与系统长期演进
加分项:
1、主导或深度参与过大模型平台、MLOps、AI Infra 相关系统建设。
2、有训练框架、推理引擎、压缩工具链或研发平台等产品化经验。
3、有大规模平台架构、云原生工程系统或开源社区贡献经验。
4、有平台智能化升级、Agent架构建设经验…
招聘城市:上海

5. Agentic AI训练。与已有Agent系统联动,构造高吞吐,可调用外部信息的,可训练的大模型系统。
任职要求:
1. 硕士及以上学历,计算机、人工智能、电子信息等相关专业优先;
2. 2年以上算法相关工作经验,具备多模态模型训练或大模型研发经验者优先;
3. 熟悉Python编程语言,掌握TensorFlow/PyTorch等主流深度学习框架之一;
4. 具备良好的算法基础和工程实现能力,熟悉图像、文本等多模态数据处理方法;
5. 对AI前沿技术有持续关注,具备较强的问题分析与解决能力;
6. 良好的沟通能力和团队协作意识,能够跨团队推动项目落地。
加分项:
1. 有大规模多模态模型训练经验者优先;
2. 熟悉模型压缩、推理加速等相关技术者优先;
3…