视频模型评测封面

视频模型评测

公司
生数科技
年份
2026
角色
评测执行岗 · 版本评测与评测集维护
类型
AI 评测 · 视频生成模型

项目处于视频生成模型迭代期,针对视频生成、视频编辑和竞品横评等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。本人作为评测执行岗,参与版本评测、评测集维护和竞品横评。

背景

项目处于视频生成模型迭代期,针对视频生成、视频编辑和竞品横评等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。需要稳定的评测侧支持来定位模型问题、驱动版本迭代。

问题

视频生成模型评测维度多、主观性强,不同任务形态(T2V / I2V / R2V)的关注重点不同;评测集需要持续覆盖模型短板场景和线上分布代表性,否则评测结果难以驱动有效迭代。

我的角色

作为评测执行岗,参与版本评测、评测集维护和竞品横评。负责按既定评测标准完成视频生成、视频编辑和竞品对比任务,对模型输出进行质量判断和问题 Case 记录,并参与评测集构建与动态维护。评测标准的制定由算法侧主导,本人负责执行和反馈。

工作流 / 系统

版本评测:按既定评测标准完成视频生成/编辑/竞品对比任务 → 质量判断 → 问题 Case 记录 → 结果整理。

评测集维护:从用户 query、真实生产样本和 PE 自构建 Case 中整理样本来源 → 补充陌生场景和不同难度梯度样本 → 覆盖基础/中档/难例三个梯度。

Bad Case 归因:围绕指令未遵循、参考一致性破坏、运动异常和画面稳定性问题沉淀典型 Case 与判定依据,提高后续复盘、问题回传和报告整理效率。

评测闭环
评测闭环:版本评测 → Case 记录 → 归因 → 报告输出
任务矩阵
任务矩阵:T2V · I2V · R2V · 竞品横评
评测集梯度
评测集梯度:基础样本 · 中档样本 · 难例样本

关键决策

  • T2V 侧重指令遵循和运动合理性,I2V 侧重参考素材一致性,R2V 侧重时序稳定性
  • 竞品横评按同一 query 对比不同模型,归纳优势场景和短板表现
  • 评测集样本覆盖基础、中档、难例三个梯度,提升线上分布代表性
  • Bad Case 按问题类型归因(指令/一致性/运动/稳定性),提高复盘效率

成果

  • 个人评测准确率达 96%
  • 完成多个小版本视频生成模型评测
  • 覆盖 T2V / I2V / R2V 任务形态和竞品横评
  • 具备独立撰写小版本评测报告的能力

把主观判断转化成可复现的判定依据

反思

评测的价值不在于打分,而在于把主观判断转化成可复现的判定依据。96% 的准确率来自对评测标准的拆解和对 Bad Case 的持续归因——每次评测中发现的异常输出,都会沉淀成下一轮评测的参照样本。评测集和准入测试集一样,是需要持续维护的活文档。

个人兴趣评测 / 01 份

评测报告展示

基于个人兴趣完成的音视频生成模型横向评测,记录评测维度、模型表现与结论。

下一个案例 Caption 工作流 →