招聘城市:北京,上海
…与价值评估
任职要求:
【数据采集工程师】
任职资格
1、3年以上爬虫 或 数据解析开发经验,熟练掌握 python、java、go 之一的语言
2、熟悉分布式爬虫架构,熟悉常见的风控策略、JS混淆、浏览器引擎
3、熟悉chromium内核/js/dom/html/css 等网页相关语言,能够完成数据解析工作,有大模型解析经验者优先
4、熟悉Linux常用命令,独立完成日常部署更新等,熟悉SSH、redis、mongodb等工具的使用
【数据解析工程师】
能力要求
1、计算机相关专业,熟练掌握 Python/Go/Java 至少一种编程语言
2、深入理解网站架构和内容组织方式,具备网页结构分析能力
2、有全网万亿级优质内容采集和挖掘经验优先
3、有头部搜索引擎公司 或 大模型公司 数据解析工作经验优先
招聘城市:上海,北京,杭州
岗位职责:
1. 打造业内领先的PB级云原生OLAP引擎,提供海量数据上的交互式分析能力,支撑小红书内部核心业务线
2. 支持千亿级数据量上的秒级别的交互分析场景,高效支撑广告/实验平台/用户行为分析/Adhoc等业务场景
3. 和团队探索前沿技术,落地和推广实时湖上数据分析、流批统一、增量计算等场景
任职要求:
1. 熟悉StarRocks/Doris、Clickhouse、Presto等大数据系统原理及源码
2. 熟悉OLAP引擎的优化原理,主流的存储格式
3. 具备良好的c++编程基础,能够进行分布式系统的故障诊断和解决优化能力
4. 具备良好的沟通表达能力和团队合作能力
招聘城市:上海,北京,杭州
岗位职责:
1、基于 Spark 等核心计算引擎参与公司 AGI预训练 数据采集、去重等核心链路的重构,从引擎层设计适配方案支撑 AGI 数据处理;
2、负责 Spark、Celeborn、Hive 等离线计算引擎的维护、性能优化与稳定性保障;
任职要求:
任职资格
1、具备扎实大数据基础,熟悉 Spark 或其他分布式计算核心原理(RDD、DAG、Shuffle 等),能独立做任务调优与问题排查;
2、掌握 Java/C++/Python 至少一门编程语言,代码能力优秀;
3、对 AGI 数据处理领域有兴趣,学习能力强,具备良好沟通协作能力。
加分项
1、参与过 AGI / 大模型训练数据链路相关项目;
2、了解 Spark 等组件源码或有开源社区贡献经验。
招聘城市:北京,上海,杭州
岗位职责:
1. 打造业内领先的实时计算框架,支持小红书各业务场景的实时数据处理和分析需求。
2.构建混合云上的高可用架构,支持存算分离架构,提供分钟级别的引擎故障逃生能力。
3.基于实时湖仓架构,完善相关的生态和产品,提供更低成本、更高效率的数据开发范式;提供自动化、智能化的任务诊断调优能力,降低业务运维的成本。
4. 和开源社区保持沟通合作,提升团队和个人在业界的影响力。
任职要求:
1. 计算机或相关专业本科及以上学历;
2. 熟悉常见的分布式处理引擎(Flink/Spark/StarRocks),有海量数据业务场景下的系统架构设计和实践经验;
3. 具备良好的沟通和团队协作能力,做事主动积极负责…
招聘城市:北京,上海,杭州
岗位职责:
1.探索和落地大数据领域Agent和AIOps技术风险领域的前沿技术和应用场景,包括智能问答、推理分析、容量规划、数据治理、业务诊断、风险预测等,并将研究结果应用到数据平台和数据业务领域,不断推动服务能力升级。
2.整合多源异构数据来源,构建数据基座,结合传统AI算法和LLM,设计和实现Agent或传统AIOps架构。
3.解决算法工程化的问题,包括端到端应用算法解决方案、模型优化和在线模型更新、场景仿真实验和调优等。不断提升各应用场景的召回率和准确率。
任职要求:
1.计算机相关专业,研究生学历,本科211以上
2.有大数据和技术风险领域的经验,深入原理并有相关场景的大规模实践
3.熟悉机器…
招聘城市:上海,北京
…业务在稳定性、成本、效率等方向上做更好的架构设计,对生产问题进行诊断和优化,帮助不断提升数据+AI业务的价值。
任职要求:
1、计算机相关专业,本科211以上学历
2、熟练掌握java,有一定规模的PaaS平台,或大数据相关领域的管控类平台建设经验
3、完善的SRE和技术风险领域的基本功;有跨机房、多云的经验,擅长troubleshooting,对线上问题能深入追查;对大规模体量下的稳定性、成本、效率问题有体系化地实践经验
4、熟悉一种或多种大数据引擎,如Flink、Spark、Ray、Kafka、ClickHouse、Doris等。负责过大规模的数据体量场景,并能结合引擎原理和业务场景进行优化和治理
5、有一定体量的AIOps实践经验者优先
招聘城市:北京,上海,杭州
岗位职责:
1.负责模型预训练、微调、部署及推理过程中的数据准备、模型和数据加速、数据集存储及管理,为大模型提供高效稳定的多模态数据预处理能力,构建高质量的AI数据迭代链路。
2.探索AI Native的多模数据存储格式,支持AI数据高效存储、读取和分析,提升数据的使用价值。
3.跟进LLM、多模态大模型的前沿发展,探索数据如何更好驱动模型迭代。
任职要求:
1. 本科及以上学历,3年以上AI&Data引擎/数据/存储研发经验
2. 加分项:熟悉大模型技术和产品生态,如Data-Juicer/Ray/Daft/Pytorch/RAG等
3. 熟悉Python/Java,具备优秀的设计与编码能力,针对业务需求与问题,可快速设计与实现解决方案
4. 具备良好的沟通和团队协作…
招聘城市:北京,上海,杭州
岗位职责:
1. 协同AI平台与算法团队,面向AI大模型训练和多样化数据处理场景,研发云原生文件系统和缓存加速系统,为AI业务提供极致的存储解决方案并推动在业务侧落地。
2. 应对小红书超大规模多模态应用挑战,攻克单集群百亿级元信息、Tbps级高吞吐等行业技术难题,保障AI业务的安全、稳定和高效运行。
3. 持续进行系统架构优化与技术迭代,结合AI负载特征,实现数据智能调度、数据预取和缓存管理,不断优化I/O路径,有效提升GPU等算力资源利用率。
任职要求:
1. 本科及以上学历,3~5年AI&Data存储/引擎研发经验
2. 加分项:具备文件系统或高性能存储研发经验,如JuiceFS/Alluxio/CPFS/GPFS/Ceph/MinIO…
招聘城市:北京,上海,杭州
岗位职责:
1. 主导云原生数据湖架构设计与落地,参与公司湖仓链路建设,支撑BI+AI业务场景。
2. 基于湖仓架构,完善相关的生态和产品,提供更低成本、更高效率的数据开发范式。
3. 和开源社区保持沟通合作,提升团队和个人在业界的影响力。
任职要求:
1. 计算机或相关专业本科及以上学历,有扎实的计算机基础和算法数据结构功底,对技术有好奇心;
2. 熟悉开源数据湖存储原理(如Iceberg、Paimon、Hudi等),能够针对业务需求快速给出解决方案,有规模化应用经验者优先;
3. 熟悉 Flink、Spark 等大数据计算系统原理,有社区经验者优先;
4. 具备良好的沟通和团队协作能力,做事主动积极负责任,有技术热情和激情面对…
招聘城市:北京,上海,杭州
岗位职责:
1.基于开源项目 Ray,打造业内领先的通用分布式计算引擎;基于Ray框架支撑公司内AI业务的数据处理、模型训练和在离线推理场景。
2.参与Ray内核及相关生态的功能开发、性能优化工作。
3.完善Ray在混合云架构的产品化能力,提供高可用、高易用性、高效能的集群服务。
4.参与开源共建与合作,提升团队与个人在业界的影响力。
任职要求:
1.本科及以上学历,计算机相关专业;
2.精通 C++/Python/GO等编程语言;
3.熟悉常见的分布式计算框架,如Spark/Flink;有机器学习相关背景优先;
4.有Ray框架及业务应用开发经验者优先。
招聘城市:北京,上海,杭州
岗位职责:
1. 主导云原生数据湖架构设计与落地,参与公司湖仓链路建设,支撑BI+AI业务场景。
2. 基于湖仓架构,完善相关的生态和产品,提供更低成本、更高效率的数据开发范式。
3. 和开源社区保持沟通合作,提升团队和个人在业界的影响力。
任职要求:
1. 计算机或相关专业本科及以上学历,有扎实的计算机基础和算法数据结构功底,对技术有好奇心;
2. 熟悉开源数据湖存储原理(如Iceberg、Paimon、Hudi等),能够针对业务需求快速给出解决方案,有规模化应用经验者优先;
3. 熟悉 Flink、Spark 等大数据计算系统原理,有社区经验者优先;
4. 具备良好的沟通和团队协作能力,做事主动积极负责任,有技术热情和激情面对…
招聘城市:北京,上海,杭州
岗位职责:
1. 打造业内领先的实时计算框架,支持小红书各业务场景的实时数据处理和分析需求。
2. 构建混合云上的高可用架构,支持存算分离架构,提供分钟级别的引擎故障逃生能力。
3. 提供自动化、智能化的任务诊断调优能力,降低业务运维的成本。
4. 和开源社区保持沟通合作,提升团队和个人在业界的影响力。
任职要求:
1. 计算机或相关专业本科及以上学历,有扎实的计算机基础和算法数据结构功底,对技术有好奇心;
2. 熟悉常见的分布式处理引擎如 Flink、Spark,有开源项目开发经验者优先;
3. 有实时引擎落地经验者优先,有海量数据业务场景下的系统架构设计和实践经验者优先;
4…
招聘城市:北京,上海,杭州
岗位职责:
1. 协同AI平台与算法团队,面向AI大模型训练和多样化数据处理场景,研发云原生文件系统和缓存加速系统,为AI业务提供极致的存储解决方案并推动在业务侧落地。
2. 应对小红书超大规模多模态应用挑战,攻克单集群百亿级元信息、Tbps级高吞吐等行业技术难题,保障AI业务的安全、稳定和高效运行。
3. 持续进行系统架构优化与技术迭代,结合AI负载特征,实现数据智能调度、数据预取和缓存管理,不断优化I/O路径,有效提升GPU等算力资源利用率。
任职要求:
1. 本科及以上学历,3~5年AI&Data存储/引擎研发经验
2. 加分项:具备文件系统或高性能存储研发经验,如JuiceFS/Alluxio/CPFS/GPFS/Ceph/MinIO…
招聘城市:北京,上海,杭州
岗位职责:
1、主导流存储引擎的研发与优化工作,构建一流的数据基础设施,满足AI+BI对数据Infra不断增长的需求。
2、紧跟业界新思路,推动流存储技术选型与创新,落地具有行业影响力的业务成果。
3、和开源社区保持沟通合作,提升团队和个人在业界的影响力。
任职要求:
1、计算机或相关专业本科及以上学历,有扎实的计算机基础和算法数据结构功底,对技术有好奇心;
2、熟悉消息队列产品(RabbitMQ/RocketMQ/Pulsar/ActiveMQ/ZeroMQ/MetaMQ等)原理者优先;
3、熟悉主流的大数据存储产品(Kafka/HDFS/HBase/Alluxio/Fluss),有开源项目开发经验尤佳;
4、有 Kafka 大规模生产经验者优先;
5、具备良好的沟通和团队协作能力,做事主动积极负责任,有技术…
招聘城市:北京,上海,杭州
…落地大数据领域Agent和AIOps技术风险领域的前沿技术和应用场景,包括智能问答、推理分析、容量规划、数据治理、业务诊断、风险预测等,并将研究结果应用到数据平台和数据业务领域,不断推动服务能力升级。
2.整合多源异构数据来源,构建数据基座,结合传统AI算法和LLM,设计和实现Agent或传统AIOps架构。
3.解决算法工程化的问题,包括端到端应用算法解决方案、模型优化和在线模型更新、场景仿真实验和调优等。不断提升各应用场景的召回率和准确率。
任职要求:
1.有大数据和技术风险领域的经验,深入原理并有相关场景的大规模实践
2.熟悉机器学习/深度学习算法(如 LSTM、GNN、异常检测算法等),熟练掌握数据ETL流程…
招聘城市:深圳
…对象存储与消息队列、数据版本管理;
4.多模态/视觉能力:掌握检测/分割/跟踪/姿态估计/3D重建/事件分割等常见任务;能熟练使用与微调开源模型与工具(如OpenMMLab、Detectron2、SegmentAnything、LLaVA/InternVL/Qwen-VL等);
5.生成式模型应用:具备图像/视频生成与可控生成实践,熟悉Diffusion系模型及控制方法,能将其用于合成数据与难例增广;
6.大模型与API生态:能熟练调用和编排LLM/VLM及其API(本地推理与云端服务),具备Prompt工程、函数调用与工具链集成经验;
7.标注体系与质控:熟悉常见标注平台与流程,能制定标注规范、设计质检机制,实践主动学习与人机协同;
8.数据评估与选择:了解弱监督/半监督/自监督、伪标签、数据选择/采样、去偏与覆盖…
招聘城市:深圳
…理解生成统一模型、可控生成、模型压缩等方向,参与构建高效的多模态数据引擎、探索下一代生成模型架构、设计全流程训练策略、构建高质量的评测体系等,打造符合微信业务生态的多模态生成AI系统。
岗位要求:
1. 人工智能、计算机、自动化等相关相关专业,硕士及以上学历,有多模态理解、图片生成、视频生成等大模型项目经验;
2. 有扎实的技术基础和代码能力,熟悉linux和python,精通扩散模型、自回归模型、transform架构、模型蒸馏等,有大规模模型训练经验者优先;
3. 了解多模态理解及VLM后训练技术,有清洗和构建大规模数据集,开发高效的数据分析和检索系统经验者优先;
4. 有相关领域高水平学术会议论文和竞赛经历,参与…
招聘城市:南京,上海
…模型数据与训练系统科学家:负责把交互世界系统中的运行数据转化为高质量、可复用、可迭代的训练资产,重点是训练数据引擎;4. AI Agent 工程师(LLM + RAG + 向量语义系统):负责Agent系统开发、RAG与向量数据库工程、Lua玩法生成及系统集成;5. 技术策划:负责游戏技术性关卡定义与设计落地,运用AI智能体完成相关代码开发;6. 移动端开发工程师(AI Agent / AI 聊天方向):负责iOS/Android移动端APP的功能开发,涉及AI聊天、AI Agent相关模块的接入;7. APP 产品经理(社交 / 聊天类):负责公司社交/聊天类APP的整体产品规划、需求分析、功能设计与迭代;8. 3D 美术(UE5):独立完成游戏角色从概念转化、高精建模、贴图绘制到UE5引擎…
招聘城市:上海
岗位职责:
1.负责大数据相关计算引擎核心研发,为腾讯的智能湖仓打造领先业界的计算内核, 推进大数据业务的高效发展;
2.负责腾讯计算内核领域前沿技术调研,与开源社区保持交流,根据业务特性和需求,引入前沿技术。
岗位要求:
1.计算机相关专业硕士及以上学历为佳,具有扎实的数据库、分布式计算领域专业知识,关注学术和工业界的进展,关注新硬件,新架构,对某一细分方向有深入研究者更优;
2.熟悉主流大数据组件如spark、presto、flink、starrocks等,熟悉数据库/大数据标准模块、框架如substrait、calcite、arrow、velox、gluten等;
3.熟悉k8s、对云原生、混合多云有一定了解;
4.具有优秀的学习能力、创新能力、沟通能力、团队合作意识;强烈…
招聘城市:深圳
…模式的统一支持与灵活切换,有效降低存储与计算成本;
3.参与 C++ Native 执行引擎的核心算子开发与性能优化,通过向量化执行、异构计算加速等技术手段大幅提升引擎处理吞吐与资源效率;
4.探索并实现面向多模态数据(文本、图像、视频等)的统一处理能力,推动多模态算子、GPU/国产加速卡异构计算支持的落地。
岗位要求:
1.计算机科学、软件工程、人工智能、数据科学等相关专业本科及以上学历,具备 3 年以上大数据计算引擎、数据库内核或分布式系统研发经验;
2.扎实的编程基础,精通 Java 或 C++,熟悉现代 C++ 特性(C++17/20)者优先;具备 Python 开发能力;
3.深刻理解计算引擎执行模型、调度框架与状态管理机制,具备复杂系统架构设计与…