图片清洗工作流
大模型上线前 SFT 数据生产阶段,需要高质量图片 Caption 数据支撑模型在图文对齐、视觉描述生成和艺术风格理解等能力上的训练优化。本人负责搭建图片清洗 Workflow,让标注同学拿到稳定可标的合格图片。
项目沉淀 / 01 份
提效文档
图片清洗工作流的设计思路、提效数据与迭代过程已整理为可下载文档。
背景
大模型上线前 SFT 数据生产阶段,需要高质量图片 Caption 数据支撑模型在图文对齐、视觉描述生成和艺术风格理解等能力上的训练优化。针对原始图片质量差异大、人工描述效率低等问题,需要通过自动化工作流提升数据生产效率和交付质量。
问题
清洗前我发现的问题:在图片理解和图片标注任务中,低质量图片会带来两个问题。
一是标注同学拿到的数据难度不一致,容易造成标注积极性和效率差异;二是人工需要反复加载、查看、判断,重复消耗人力。
我的角色
作为项目助理,围绕原始图片质量差异带来的生产问题,负责搭建 Dify 自动化清洗 Workflow,设计灰度区人工审核与 Badcase 迭代机制。
工作流 / 系统
图片清洗工作流搭建:基于初始图片数据质量差异大、容易造成数据分发不均的业务痛点,通过「脚本预筛 + VLM 复查 + 灰度区人工审核」搭建 Dify 自动化清洗 Workflow,对图片素材进行清洗,让标注同学拿到稳定、可以标注的合格图片。全量上线后误杀率 5%,只需每日进行灰度区数据审核,并根据 Badcase 迭代工作流。
关键决策
- 先由脚本预筛处理明确不合格图片,再由 VLM 复查补足复杂判断
- 将不确定样本留入灰度区,由人工审核而非强行自动判定
- 以每日灰度区数据和 Badcase 作为工作流迭代输入
成果
- 清洗工作流累计处理图片数据约 8 万张,识别不合格图片约 3 万张
- 其中脚本预筛拦截约 1.7 万张,LLM 审核拦截约 1.3 万张
- 全量上线后误杀率控制在 5%
- 清洗环节只需定时少样本抽检和专人处理每日灰度区数据
让标注同学拿到稳定、可以标注的合格图片
反思
清洗工作流的核心不是追求全自动,而是把明确可判断的重复操作交给脚本和模型,把不确定样本留给人工审核。灰度区和 Badcase 持续为下一轮迭代提供输入。