图片清洗工作流

图片清洗工作流

公司
百度
年份
2025
角色
项目助理 · 工作流搭建与标注执行
类型
AI 数据工程 · SFT 数据生产

大模型上线前 SFT 数据生产阶段,需要高质量图片 Caption 数据支撑模型在图文对齐、视觉描述生成和艺术风格理解等能力上的训练优化。本人负责搭建图片清洗 Workflow,让标注同学拿到稳定可标的合格图片。

项目沉淀 / 01 份

提效文档

图片清洗工作流的设计思路、提效数据与迭代过程已整理为可下载文档。

背景

大模型上线前 SFT 数据生产阶段,需要高质量图片 Caption 数据支撑模型在图文对齐、视觉描述生成和艺术风格理解等能力上的训练优化。针对原始图片质量差异大、人工描述效率低等问题,需要通过自动化工作流提升数据生产效率和交付质量。

问题

清洗前我发现的问题:在图片理解和图片标注任务中,低质量图片会带来两个问题。

一是标注同学拿到的数据难度不一致,容易造成标注积极性和效率差异;二是人工需要反复加载、查看、判断,重复消耗人力。

我的角色

作为项目助理,围绕原始图片质量差异带来的生产问题,负责搭建 Dify 自动化清洗 Workflow,设计灰度区人工审核与 Badcase 迭代机制。

工作流 / 系统

图片清洗工作流搭建:基于初始图片数据质量差异大、容易造成数据分发不均的业务痛点,通过「脚本预筛 + VLM 复查 + 灰度区人工审核」搭建 Dify 自动化清洗 Workflow,对图片素材进行清洗,让标注同学拿到稳定、可以标注的合格图片。全量上线后误杀率 5%,只需每日进行灰度区数据审核,并根据 Badcase 迭代工作流。

图片清洗工作流界面
图片清洗工作流:脚本预筛 → VLM 复查 → 灰度区审核
Badcase 归因脚本插件
图片清洗工作流中辅助 Badcase 归因的脚本插件

关键决策

  • 先由脚本预筛处理明确不合格图片,再由 VLM 复查补足复杂判断
  • 将不确定样本留入灰度区,由人工审核而非强行自动判定
  • 以每日灰度区数据和 Badcase 作为工作流迭代输入

成果

  • 清洗工作流累计处理图片数据约 8 万张,识别不合格图片约 3 万张
  • 其中脚本预筛拦截约 1.7 万张,LLM 审核拦截约 1.3 万张
  • 全量上线后误杀率控制在 5%
  • 清洗环节只需定时少样本抽检和专人处理每日灰度区数据

让标注同学拿到稳定、可以标注的合格图片

反思

清洗工作流的核心不是追求全自动,而是把明确可判断的重复操作交给脚本和模型,把不确定样本留给人工审核。灰度区和 Badcase 持续为下一轮迭代提供输入。

下一个案例 图片 Caption 机标工作流 →