视频模型评测封面

视频模型评测

公司
生数科技
年份
2026
角色
项目助理 · 版本评测与评测集维护
类型
AI 评测 · 视频生成模型

项目处于 Vidu Q3 模型迭代期,针对阶段性版本、功能专项和竞品对比等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。本人作为项目助理,参与版本评测、评测集维护、竞品横评和供应商对接。

背景

项目处于 Vidu Q3 模型迭代期,针对阶段性版本、功能专项和竞品对比等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。需要稳定的评测侧支持来定位模型问题、驱动版本迭代。

问题

视频生成模型评测维度多、主观性强,不同任务形态(T2V / I2V / R2V)的关注重点不同;评测集需要持续覆盖模型短板场景和线上分布代表性,否则评测结果难以驱动有效迭代。

我的角色

作为项目助理,参与版本评测、评测集维护、竞品横评和供应商对接。负责按既定评测标准完成阶段性版本、功能专项和竞品对比任务,记录并归因问题 Case;同时参与供应商培训、规则对齐、答疑和返修复验。

工作流 / 系统

版本评测:按既定评测标准完成视频生成/编辑/竞品对比任务 → 质量判断 → 问题 Case 记录 → 结果整理。

评测集维护:从用户 query、历史 Bad Case 和 PE 自构建 Case 中整理样本来源 → 补充陌生场景和不同难度梯度样本 → 覆盖基础/中档/难例三个梯度。

供应商培训:汇总初评中的同质化问题和高频错误 → 组织规则对齐与 QA 答疑 → 跟进整改和返修复验。

Bad Case 归因:围绕画面美学、叙事流畅性和运动质量沉淀典型 Case 与判定依据,提高后续复盘、问题回传和报告整理效率。

评测闭环
评测闭环:版本评测 → Case 记录 → 归因 → 报告输出
任务矩阵
任务矩阵:T2V · I2V · R2V · 竞品横评
评测集梯度
评测集梯度:基础样本 · 中档样本 · 难例样本

关键决策

  • T2V 侧重指令遵循和运动合理性,I2V 侧重参考素材一致性,R2V 侧重时序稳定性
  • 竞品横评按同一 query 对比不同模型,归纳优势场景和短板表现
  • 评测集样本覆盖基础、中档、难例三个梯度,提升线上分布代表性
  • Bad Case 按画面美学、叙事流畅性和运动质量归因,提高复盘效率
  • 通过规则对齐、QA 答疑和返修复验推进供应商整改与交付

成果

  • 个人评测准确率达 90%
  • 完成多个小版本视频生成模型评测
  • 完成阶段性版本、功能专项及竞品对比评测
  • 具备独立撰写小版本评测报告的能力
  • 通过初评验收 diff 汇总共性问题和高频错误,推进供应商整改与返修复验

把主观判断转化成可复现的判定依据

反思

评测的价值不在于打分,而在于把主观判断转化成可复现的判定依据。通过持续拆解评测标准、归因 Bad Case 并补充参照样本,让评测结果能够支持问题定位、供应商对齐和版本迭代。评测集和准入测试集一样,是需要持续维护的活文档。

个人兴趣评测 / 01 份

评测报告展示

基于个人兴趣完成的音视频生成模型横向评测,记录评测维度、模型表现与结论。

下一个案例 Caption 工作流 →