视频模型评测
项目处于 Vidu Q3 模型迭代期,针对阶段性版本、功能专项和竞品对比等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。本人作为项目助理,参与版本评测、评测集维护、竞品横评和供应商对接。
背景
项目处于 Vidu Q3 模型迭代期,针对阶段性版本、功能专项和竞品对比等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。需要稳定的评测侧支持来定位模型问题、驱动版本迭代。
问题
视频生成模型评测维度多、主观性强,不同任务形态(T2V / I2V / R2V)的关注重点不同;评测集需要持续覆盖模型短板场景和线上分布代表性,否则评测结果难以驱动有效迭代。
我的角色
作为项目助理,参与版本评测、评测集维护、竞品横评和供应商对接。负责按既定评测标准完成阶段性版本、功能专项和竞品对比任务,记录并归因问题 Case;同时参与供应商培训、规则对齐、答疑和返修复验。
工作流 / 系统
版本评测:按既定评测标准完成视频生成/编辑/竞品对比任务 → 质量判断 → 问题 Case 记录 → 结果整理。
评测集维护:从用户 query、历史 Bad Case 和 PE 自构建 Case 中整理样本来源 → 补充陌生场景和不同难度梯度样本 → 覆盖基础/中档/难例三个梯度。
供应商培训:汇总初评中的同质化问题和高频错误 → 组织规则对齐与 QA 答疑 → 跟进整改和返修复验。
Bad Case 归因:围绕画面美学、叙事流畅性和运动质量沉淀典型 Case 与判定依据,提高后续复盘、问题回传和报告整理效率。
关键决策
- T2V 侧重指令遵循和运动合理性,I2V 侧重参考素材一致性,R2V 侧重时序稳定性
- 竞品横评按同一 query 对比不同模型,归纳优势场景和短板表现
- 评测集样本覆盖基础、中档、难例三个梯度,提升线上分布代表性
- Bad Case 按画面美学、叙事流畅性和运动质量归因,提高复盘效率
- 通过规则对齐、QA 答疑和返修复验推进供应商整改与交付
成果
- 个人评测准确率达 90%
- 完成多个小版本视频生成模型评测
- 完成阶段性版本、功能专项及竞品对比评测
- 具备独立撰写小版本评测报告的能力
- 通过初评验收 diff 汇总共性问题和高频错误,推进供应商整改与返修复验
把主观判断转化成可复现的判定依据
反思
评测的价值不在于打分,而在于把主观判断转化成可复现的判定依据。通过持续拆解评测标准、归因 Bad Case 并补充参照样本,让评测结果能够支持问题定位、供应商对齐和版本迭代。评测集和准入测试集一样,是需要持续维护的活文档。
个人兴趣评测 / 01 份
评测报告展示
基于个人兴趣完成的音视频生成模型横向评测,记录评测维度、模型表现与结论。