视频模型评测
项目处于视频生成模型迭代期,针对视频生成、视频编辑和竞品横评等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。本人作为评测执行岗,参与版本评测、评测集维护和竞品横评。
背景
项目处于视频生成模型迭代期,针对视频生成、视频编辑和竞品横评等任务持续评测,关注指令遵循、光影协调度、叙事流畅性等核心能力。需要稳定的评测侧支持来定位模型问题、驱动版本迭代。
问题
视频生成模型评测维度多、主观性强,不同任务形态(T2V / I2V / R2V)的关注重点不同;评测集需要持续覆盖模型短板场景和线上分布代表性,否则评测结果难以驱动有效迭代。
我的角色
作为评测执行岗,参与版本评测、评测集维护和竞品横评。负责按既定评测标准完成视频生成、视频编辑和竞品对比任务,对模型输出进行质量判断和问题 Case 记录,并参与评测集构建与动态维护。评测标准的制定由算法侧主导,本人负责执行和反馈。
工作流 / 系统
版本评测:按既定评测标准完成视频生成/编辑/竞品对比任务 → 质量判断 → 问题 Case 记录 → 结果整理。
评测集维护:从用户 query、真实生产样本和 PE 自构建 Case 中整理样本来源 → 补充陌生场景和不同难度梯度样本 → 覆盖基础/中档/难例三个梯度。
Bad Case 归因:围绕指令未遵循、参考一致性破坏、运动异常和画面稳定性问题沉淀典型 Case 与判定依据,提高后续复盘、问题回传和报告整理效率。
关键决策
- T2V 侧重指令遵循和运动合理性,I2V 侧重参考素材一致性,R2V 侧重时序稳定性
- 竞品横评按同一 query 对比不同模型,归纳优势场景和短板表现
- 评测集样本覆盖基础、中档、难例三个梯度,提升线上分布代表性
- Bad Case 按问题类型归因(指令/一致性/运动/稳定性),提高复盘效率
成果
- 个人评测准确率达 96%
- 完成多个小版本视频生成模型评测
- 覆盖 T2V / I2V / R2V 任务形态和竞品横评
- 具备独立撰写小版本评测报告的能力
把主观判断转化成可复现的判定依据
反思
评测的价值不在于打分,而在于把主观判断转化成可复现的判定依据。96% 的准确率来自对评测标准的拆解和对 Bad Case 的持续归因——每次评测中发现的异常输出,都会沉淀成下一轮评测的参照样本。评测集和准入测试集一样,是需要持续维护的活文档。
个人兴趣评测 / 01 份
评测报告展示
基于个人兴趣完成的音视频生成模型横向评测,记录评测维度、模型表现与结论。