Audio-Visual Flamingo 使用提示词进行分类的写法

文章导读
分类任务里,提示词不是简单地把类别塞给 Audio-Visual Flamingo,而是写一段让模型知道「任务、输出格式、类别范围、兜底方式」的指令。模型会把视频帧和音频特征都当作输入,文本提示负责界定分类空间。提示词的语法和约束是否明确,直接影响输出能不能被程序直接解析。
📋 目录
  1. A 分类提示词的核心结构
  2. B 两个可直接套用的提示词模板
  3. C 如何把提示词和多模态输入组织在一起
  4. D 提示词写完后先验证这三处
  5. E 常见失效点与微调方向
A A

分类任务里,提示词不是简单地把类别塞给 Audio-Visual Flamingo,而是写一段让模型知道「任务、输出格式、类别范围、兜底方式」的指令。模型会把视频帧和音频特征都当作输入,文本提示负责界定分类空间。提示词的语法和约束是否明确,直接影响输出能不能被程序直接解析。

多模态分类提示词应包含三块:任务指令、输出格式和兜底设置。封闭标签优先用“只输出类别名”约束格式;拿不准时必须在提示词里允许“无法判断”,否则模型会硬猜。写法需要结合具体输入布局微调,先小样本验证再扩大。

分类提示词的核心结构

Audio-Visual Flamingo 这类多模态模型面对分类任务时,通常不会像问答那样输出长句,而是依赖提示词里的限定符。按下面四块写,能减少随机输出:

  • 任务限定:说明判断对象是“事件类型”“场景类别”还是“情绪状态”。例如“判断这段素材里的主要场景”。
  • 输出约束:明确要求模型只输出类别名,或逗号分隔的多标签,不要附带解释。
  • 类别定义:类别词本身容易歧义时,给括号注释或一句话示例,例如“交通拥堵:车流低速或停滞”。不要把类别定义写成一段长文。
  • 兜底设置:必须写“无法判断时输出:无法判断”。这个兜底让模型不需要硬猜,能明显降低幻觉输出。

两个可直接套用的提示词模板

下面是封闭式单标签和开放式多标签的常用写法。替换类别名即可用于初测。

单标签分类:
prompt = '请根据视频画面和背景音判断这段素材属于哪一类,类别只有:室内会议、户外访谈、街道噪声、纯音乐。只输出类别名,不要输出解释。如果画面和音频无法支持判断,输出:无法判断。'
多标签分类:
prompt = '判断这段素材里出现的场景类别,可以同时选多个:街道、室内、交通声、人声、音乐声、自然声。用逗号分隔输出,不要输出解释。没有出现的不写;全部无法判断时输出:无法判断。'

多标签模板里,“全部无法判断时”比“无法判断”更严格,避免模型在同一段输出里既给标签又给“无法判断”。

Audio-Visual Flamingo 使用提示词进行分类的写法

如何把提示词和多模态输入组织在一起

Audio-Visual Flamingo 的输入侧是视频帧、音频特征和文本三部分。分类提示词放在文本侧,不要在外部脚本里用 if-else 事后修正输出。下面是一段通用推理骨架,字段名以你对接的实现为准:

prompt = '请根据视频画面和背景音判断这段素材属于哪一类,类别只有:室内会议、户外访谈、街道噪声、纯音乐。只输出类别名,不要输出解释。如果画面和音频无法支持判断,输出:无法判断。'
output = model.generate(
    video=video_frames,
    audio=audio_features,
    prompt=prompt,
    max_new_tokens=64,
    temperature=0.0
)

temperature 设为 0.0 是分类任务常见做法,让输出更稳定。如果模型实现不支持 temperature 参数,可以忽略这一行。max_new_tokens 设到 64 一般够用,因为分类输出只要求类别名。

提示词写完后先验证这三处

  1. 格式稳定性:同一个样本跑三次,确认输出都是允许类别词。如果出现“这段素材属于”之类前缀,说明“只输出类别名”约束没有完全生效,需要把该短语再往句首放。
  2. 边界表现:专门准备一两段模糊样本,例如画面模糊且声音混杂。模型应该输出“无法判断”,而不是硬归到某个类别。
  3. 单侧依赖:制作一个画面和声音不一致的样本,比如海边画面配车流声音。如果模型只依赖画面判断,说明提示词没有把音频纳入判断依据。可以在提示词里写“结合画面和声音”,但也要注意,如果分类目标只依赖音频,应反过来写“只根据声音判断”。

常见失效点与微调方向

  • 输出带解释:把“只输出类别名”移到句子开头,并追加“不要解释”。
  • 模糊样本硬猜:确认提示词里确实写了“输出:无法判断”,采样温度调低。
  • 类别定义太长:类别注释压缩到一句话,比如“纯音乐:没有人声的音乐”,让模型能快速对齐。
  • 类别重叠:如果两个类别语义重叠,模型会随机输出其中之一。需要先合并或明确区分边界,而不是在提示词里硬拗。

风险边界:提示词不能弥补模型本身不掌握的知识。Audio-Visual Flamingo 能做的分类,是直接从样本内容中提取信号,而不是做外部背景推理。像“判断是否违法”“判断政治倾向”这类任务,需要先把它们拆成可观察的多模态特征,例如“是否出现特定文字、是否有特定声音元素”,否则模型无法可靠完成。