Audio-Visual Flamingo 这类多模态模型生成的文本,问题往往不在语法,而在它是否忠实于视频与音频中真正发生的内容。核对文本结果,本质上是把模型输出与输入信号做一次交叉比对,而不是只看文本通不通顺。
核对 AVF 文本结果,要以输入视频和音频为唯一基准,从事实一致性、时间顺序、实体指称、细节遗漏四个维度进行校验。建议先抽取关键帧与音频转写,再与模型输出对比;没有真实基准时,可用红队问题引导模型暴露不确定点,但最终仍需人工决策。
先明确核对什么:区分事实与推断
AVF 的输出可分为两类:可直接对应输入信号的“事实项”和模型根据上下文补充的“推断项”。核对时优先检查事实项,例如人物姓名、动作、数量、时间顺序、物品颜色等;推断项如“看起来很开心”“可能是在开会”只能作为辅助信息,不能作为硬性核对目标。
- 事实项:人名、地名、时间、数字、颜色、动作、说话内容。
- 推断项:情绪、意图、关系、场景功能。
核对前需要先建立基准。比较可靠的基准来源有两个:视频关键帧和独立音频转写。关键帧能帮你确认视觉信息,音频转写能帮你确认说话内容。AVF 自己声称的内容不能作为基准。
设计一套可复用的核对清单
建议按以下项目逐条检查,每项都记录“通过/不通过/不确定”:
- 实体正确性:人名、地名、品牌、缩写是否与画面或音频一致?
- 时间顺序:事件描述顺序是否与视频播放顺序一致?有没有把后发生的写在前面?
- 数字与数量:人数、次数、时长、百分比等是否准确?注意音频转写中的数字与画面中的数字可能冲突,要确认以哪个为准。
- 指称明确:输出中的“他”“那个东西”是否能在上下文中找到明确回指?
- 细节遗漏:画面或音频中明显的动作、物体、话轮是否未出现?
- 多模态冲突:音频说“苹果”但画面是橙子,模型是否错误跟随了其中之一?
清单不要一次做太长,建议每个视频片段只核对 10 项以内,否则容易疲劳。
用提示词或脚本做半自动校验
完全人工核对成本很高。可以先让模型自己标注置信区间,或者用另一个语言模型做审查者。
下面是一个通用的审查提示词,可以放在你的工作流里,要求审查模型从原文中找依据:
请根据给定的音频转写和关键帧描述,检查下面这段视频描述是否准确。
对于每条描述:
- 若能在音频或视觉中直接找到依据,标注“有依据”;
- 若找不到但逻辑合理,标注“推测”;
- 若与依据冲突,标注“冲突”并给出冲突内容。
不要修正原文,只做标注。
音频转写:{{audio_transcript}}
关键帧描述:{{frame_description}}
待检查描述:{{generated_text}}使用这个提示词时,需要先把音频转写成文本,再抽取关键帧并写简短描述。它不能代替人对实体和语义的判断,只能帮你把可疑句子筛出来。
如果你会写代码,也可以用命名实体比对做快速扫描:把音频转写和模型输出中的实体分别抽取出来,做交集和差集。差集部分需要人工确认。这类脚本能发现漏写或虚构的实体,但无法发现逻辑错误。
人工抽检与错误分类
保留一个固定的人工抽检样本,比如从每个批次中随机抽 5 条。按以下错误类型分类计数:
- 幻觉:输出中出现输入中不存在的内容;
- 遗漏:输入中存在但输出未提及;
- 顺序错乱:事件先后出错;
- 指称不明:代词或简称无法对应到具体实体;
- 多模态冲突:音频与视觉矛盾时输出选择错误。
记录每类错误出现的次数,不一定需要精确统计,只需要看哪类最多。如果某一类频发,再针对性调整提示词或抽帧策略。这个动作是为了建立你对模型输出的信任边界,不是为了发布评测结论。
两个常见误区
第一个误区是只用模型自己的置信度打分来判定对错。置信度只反映模型内部状态,不代表与输入信号一致。第二个误区是忽略音频与视觉之间的时间对应关系。AVF 的输入来自不同模态,输出文本若没有和时间戳绑定,核对时要格外小心,因为模型可能把前面听到的声音安到后面出现的画面上。
核对 AVF 文本结果没有一劳永逸的方案。你需要先建立基准,再用清单逐项比对,最后靠人工抽检控制风险。整个流程的成本都不低,但在涉及对外发布或自动化处理的场景里,这笔准备时间通常值得花。