招聘城市:北京,上海,杭州
岗位职责:
负责互联网公开内容数据的自动化采集、清洗、结构化处理和质量治理,为业务情报分析、知识库建设及大模型训练提供稳定、高质量的数据支持。
任职要求:
1、本科及以上学历,计算机、软件工程、信息安全等相关专业;
2、具备 App 端逆向分析经验,熟悉移动端接口分析、协议分析、参数生成逻辑等;
3、或者具备 Web 端逆向分析经验,熟悉 JavaScript 逻辑分析、接口调用链、签名参数、加密传输等;
4、熟悉数据采集、清洗、去重、结构化处理及入库流程;
5、具备较强的问题定位和独立分析能力,能够完成数据源分析、任务开发和异常处理;
6、具备良好的合规意识,遵守数据安全、隐私保护及相关法律法规要求。
招聘城市:深圳
岗位职责:
1.负责大规模网页数据的抓取、清洗及结构化存储,保障数据质量和时效性;
2.设计并优化分布式爬虫架构,提升系统并发能力和容错性,提升系统性能;
3.维护数据采集链路,协同系统数据分析团队完成数据交付与应用。
岗位要求:
1.计算机相关专业,本科以上学历,2年以上架构经验;
2.精通C++/Go/Java中至少一门开发语言,熟悉常见的数据结构和算法;
3.熟悉任务调度与性能优化,深入理解HTTP协议,能独立分析动态网页结构;
4.有分布式爬虫开发经验者优先。
招聘城市:北京,上海
…网海量数据(网页、文档、富媒体等)的去重、清洗、结构化导入、分类、信息抽取与价值评估
任职要求:
【数据采集工程师】
任职资格
1、3年以上爬虫 或 数据解析开发经验,熟练掌握 python、java、go 之一的语言
2、熟悉分布式爬虫架构,熟悉常见的风控策略、JS混淆、浏览器引擎
3、熟悉chromium内核/js/dom/html/css 等网页相关语言,能够完成数据解析工作,有大模型解析经验者优先
4、熟悉Linux常用命令,独立完成日常部署更新等,熟悉SSH、redis、mongodb等工具的使用
【数据解析工程师】
能力要求
1、计算机相关专业,熟练掌握 Python/Go/Java 至少一种编程语言
2、深入理解网站架构和内容组织方式,具备网页结构分析能力
2、有全网万亿级优质内容采集和…
招聘城市:北京,上海
…解析能力。
2、URL 归一化:优化 URL 解析与去重策略,提升爬虫抓取效率、内容聚合能力,构建高质量索引库。
3、页面质量评估:基于机器学习(ML)+ 自然语言处理(NLP)+ 规则工程,构建高质量内容筛选算法,识别低质量/垃圾/重复页面,提高训练数据质量。
4、知识抽取与语义理解:基于BERT/GPT/LLM 等技术,解析网页、文档、视频等多模态内容,构建网页内容理解、网页分类、实体识别等模型,助力大模型训练数据优化。
5、搜索数据优化:结合大模型能力+外部索引库,优化爬虫抓取策略,提升数据覆盖率、时效性,服务于搜索与问答产品。
6、爬虫数据分析与反爬对抗:基于数据挖掘分析网页特征,优化反爬检测、爬虫模拟行为、动态渲染等策略,提高数据采集成功率。
7、网页知识…
招聘城市:上海
…技术攻坚,为基座模型训练、业务分析提供高质量国内外数据源,技术挑战与成长空间充足。
二、岗位职责
1.分布式爬虫系统研发设计、开发与维护高可用、高并发分布式爬虫系统,支撑国内外海量多媒体数据的稳定采集、解析与存储。
2.国内外风控对抗攻坚研究并突破 YouTube、Instagram、TikTok、Reddit、Bangumi 等国内外主流站点的反爬机制,解决 IP 封禁、账号限制、行为风控、地域限制等问题。
3.多媒体数据处理完成视频、音频、图片等非结构化数据的抓取、元数据提取、去重与质量校验,保障数据完整性与可用性。
4.全端逆向工程负责 Web 端 JS 逆向、安卓 /iOS 端 APP 逆向,破解加密算法、签名机制与接口校验逻辑,保障数据稳定获取。
5…
招聘城市:上海
…数据质量与实用价值;
5. 沟通协作能力强,具备BD思维,可主动搭建并维护长期合作
任职资格
1. 英语能力流利,可无障碍阅读海外资料、独立对接海外合作沟通;
2. 熟悉海内外主流内容、音视频、互联网平台,深耕多模态内容生态;
3. 具备优秀的信息检索与筛选能力,熟练使用Agent等工具提升工作效率与数据质量;
4. 热爱AI大模型与内容创作行业,认同数据驱动模型迭代的工作逻辑;
5. 掌握Python等任意脚本语言者优先。
加分项
1. 拥有海内外内容平台、创作者生态、Creator Economy相关从业经验;
2. 具备AI数据采集、数据授权、商务拓展(BD)相关工作经历;
3. 熟悉全球数据版权规则、知识共享协议及商业化数据授权模式;
4. 熟悉爬虫、深度搜索、SEO、各类数据…
招聘城市:北京
…等功能,提升大规模网页解析能力。
URL 归一化:优化 URL 解析与去重策略,提升爬虫抓取效率、内容聚合能力,构建高质量索引库。
页面质量评估:基于机器学习(ML)+ 自然语言处理(NLP)+ 规则工程,构建高质量内容筛选算法,识别低质量/垃圾/重复页面,提高训练数据质量。
知识抽取与语义理解:基于BERT/GPT/LLM 等技术,解析网页、文档、视频等多模态内容,构建网页内容理解、网页分类、实体识别等模型,助力大模型训练数据优化。
搜索数据优化:结合大模型能力+外部索引库,优化爬虫抓取策略,提升数据覆盖率、时效性,服务于搜索与问答产品。
爬虫数据分析与反爬对抗:基于数据挖掘分析网页特征,优化反爬检测、爬虫模拟行为、动态渲染等策略,提高数据采集成功率。
网页知识…
招聘城市:上海
…平台数据领域从业经历优先。
2、精通 Python 开发,熟练掌握Ray/Spark/Hadoop等分布式数据处理框架,了解 GPU 异构集群管理、MinIO/Alluxio 等存储技术,有爬虫系统开发、多模态数据处理经验者优先;熟悉内容平台数据特点(如音视频 / 弹幕 / UGC)者加分。
3、有AI 数据体系从 0 到 1 搭建经验,主导过大模型知识库、RAG 材料库、多模态数据集等项目落地,能独立完成搜索 / 内容场景数据处理架构设计与工程化实现。
4、具备海量数据处理能力,有处理 TB/PB 级文本、千万小时级音视频、百亿级网页 / UGC 数据的实战经验,能实现数据分钟 / 小时级低延迟采集 / 更新。
5、有可量化的项目成果,如 GPU 利用率提升至 80%+、存储成本降低 30%+、数据问题…
招聘城市:北京,上海
岗位职责:
1、负责分布式网络爬虫系统平台的技术选型、架构设计与研发。
2、推动网络爬虫核心技术的研究方向,提升爬虫系统的稳定性和扩展性。
3、管理并带领爬虫团队高效的支撑业务。
任职要求:
1、精通爬虫和反爬技术,如深度抓取、动态网页技术抓取、浏览器模拟抓取、APP抓取等技术。
2、熟悉分布式系统、多线程,精通scrapy框架以及原理,有开发爬虫框架经验。
3、对主流爬虫架构有深入研究,具有成熟爬虫工具的设计及运维经验。
4、有很强的学习能力和技术钻研能力,有良好的沟通能力,善于跨团队合作。
5、良好的逻辑能力,善于把复杂问题梳理清晰,并形成良好的团队交付阵型。