招聘城市:上海
岗位介绍:
职位描述
工作职责:
【这个岗位在做什么】
我们在给视频生成基模建立评测能力:定义“什么是好视频内容”的标准,定义模型审美和及格线,你在创作过程里攒下的那些经验和直觉,在这里变成能被算法接住的输入和需求。
如果你现在做的是内容创意,这个岗位的区别是:你不只是模型的使用者,你也是标准的制定者,参与下一代模型能力的迭代。
【你会做什么】
1.Benchmark 出题与人工评测
●按能力维度构造题目,例如如何考察角色一致性、多镜头连贯、口型对齐、运镜、文字渲染、物理合理性、音画关系等等;定义评分维度、评分细则、并进行评价,输出结构化的报告。
2.把创作者需求翻译成模型…
招聘城市:上海
岗位介绍:
职位描述
工作职责:
1. 构建高性能音视频理解 Pipeline,负责各类理解模型的推理、训练和持续优化。
2. 持续优化 Caption、Tag、PE、QA、Quality Assessment 等理解能力,提高数据生产质量。
3. 优化 CPU/GPU 推理效率,包括模型部署、Batching、Quantization、TensorRT、ONNX 等。
4. 持续优化各类专家模型,包括但不限于:
- Motion Detection
- Shot/Scene Cut Detection
- Artifact Detection
- Audio-Visual Sync
- OCR
- ASR
- Speaker Detection
- Quality Assessment
5. 与生成模型团队共同设计自动化数据生产 Pipeline,提升整体数据质量和处理效率。
工作要求:
任职要求
1. 熟悉 Transformer、Vision Transformer、多模态模型基础。
2. 熟悉 Qwen VL、Gemma、Gemini、SeedVL 等理解模型。
3. 熟悉 TensorRT、ONNX Runtime、CUDA Optimization。
4. 熟悉 FFmpeg、OpenCV、CUDA Video Codec。
5. 有千万级以上视频 Pipeline 经验。
我们希望你:
1. 不…
招聘城市:上海
…工程化能力,保障数据供给的时效性与稳定性。
4. 设计并持续优化数据质量标准与监控体系,关注多模态、AIGC等前沿方向,结合业务场景探索音视频数据采集与生产新模式。
工作要求:
任职要求:
1. 本科及以上学历,计算机、大数据、人工智能等相关专业者优先。
2. 具备扎实的Python/Go编程功底,精通Scrapy、Playwright、Selenium等主流框架。
3. 深入理解HTTP/HTTPS、WebSocket等网络协议,熟悉FFmpeg等音视频处理工具。
4. 具备良好的数据合规意识,了解相关的法律边界,能够在保证数据安全的前提下高效完成采集任务。
加分项:
1. 有视频生成、多模态大模型数据工程或AI数据中台开发经验者优先。
2. 熟悉大模型数据清洗标准,了解如何使用Prompt工程…
招聘城市:上海
…生成算法效果落地与规模化最优迭代。
4. 自主设计系统性算法对照实验,深度复盘实验失败案例、定位算法缺陷与瓶颈,针对性优化模型生成精度、画面连贯性、音画一致性等核心指标,持续迭代升级生成算法能力。
工作要求:
任职要求
1. 本科及以上学历,计算机、人工智能、深度学习、多媒体技术等相关专业,具备扎实的深度学习、多模态生成技术功底。
2. 熟练掌握PyTorch框架及分布式训练技术,具备Diffusion model、MOE、VAE、SFT、RLHF、模型蒸馏中至少两项核心技术的落地实践经验。
3. 具备音视频生成相关算法经验,精通多条件参考生成、图像/视频/音频生成与编辑、视频超分、插帧补帧、人物形象一致性、多镜头融合、音画同步等核心技术模块。
4. 具备扎实的算法…
招聘城市:上海
…与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。
工作要求:
工作要求
1. 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。
2. 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。
3. 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。
4. 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。
5. 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。
加分项
1. 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等;
2. 有大规模音视频生成与理解…
招聘城市:上海
…性能瓶颈(包括计算、通信、存储等),实施针对性优化,提升训练吞吐、稳定性与可扩展性。
3. 持续跟踪并集成业界前沿的训练优化技术(如 MoE、异步RL、LoRA RL、Agentic RL 等)。
工作要求:
1. 本科及以上学历,计算机相关专业,2年以上工作经验。
2. 熟悉 Python/C++ 中至少一种编程语言,具备扎实的工程基础。
3. 深入理解自然语言处理、计算机视觉或多模态算法,熟悉主流的 DiT(Diffusion Transformer) 与 VLM(Vision-Language Model) 模型架构,具备分布式训练(如 FSDP、DeepSpeed、Megatron 等)实战经验。
4. 熟悉常见强化学习训练算法(如 GRPO、DAPO 等)及训练框架(如 verl),熟悉异步强化学习范式。
5. 有相关领域开源项目贡献经验者优先。
6. 具备大规模训练实操经验者优先。
投递简历
招聘城市:上海
…跨模态对齐、时序建模和语言建模有深入理解。
4. 具有以下至少一个方向的研发经验:
- Omni Model、VLM 或多模态理解基础模型;
- VLM / LLM 预训练或后训练;
- 视频理解、视频 Caption 或视频推理;
- Reward Model、偏好对齐或强化学习;
- 视频生成或图像生成基础模型;
- 多模态 Agent、工具调用或任务规划。
5. 熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。
6. 具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。
加分项
- 参与过大规模 VLM / LLM 的预训练或后训练。
- 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。
- 具有视频生成、Diffusion 或 Flow Matching 相关经验。
- 具有长视频理解、音视频联合建模或多模态推理经验。
- 具有…
…音视频生成基础模型团队,正在致力于打造下一代多模态大模型,深耕音视频生成与理解、基建与平台、多模态Agent、评测与内容、Agentic Data全链路,攻坚多模态内容生成领域的核心命题,驱动数据与模型相互迭代的增长飞轮。团队向全球热爱多模态AI的探索者发出邀约,一同探寻视听世界的数字奥秘,重新定义高价值音视频内容的生产范式,用技术重塑内容创作,与亿万创作者共生。
招聘摘要: bilibili音视频基础模型团队现面向全球进行社招、校招和实习招聘。团队致力于打造下一代多模态大模型,深耕音视频生成与理解、基建与平台、多模态Agent、评测与内容、Agentic Data全链路。热招岗位包括音视频生成算法工程师、音视频…