SeFi-Image 生成结果质量评估与筛选标准

文章导读
批量生成图片后,选图最怕标准不一致:一个人觉得风格偏了,另一个人觉得主体不完整,图片本身没变,结论却对不上。SeFi-Image 批量出图后,先把评估维度固定下来,再让同一批图走同一套打分和筛选流程。这套流程不改变出图效果,只决定哪些图可用,并为下一轮提示词修订提供依据。
📋 目录
  1. 确定四个评估维度和打分规则
  2. 用评分表记录每一张的结果
  3. 先用重复度工具排除近似图
  4. 设定通过阈值和抽检比例
  5. 把评分结果回写到提示词模板
A A

批量生成图片后,选图最怕标准不一致:一个人觉得风格偏了,另一个人觉得主体不完整,图片本身没变,结论却对不上。SeFi-Image 批量出图后,先把评估维度固定下来,再让同一批图走同一套打分和筛选流程。这套流程不改变出图效果,只决定哪些图可用,并为下一轮提示词修订提供依据。

批量图的筛选应以语义一致性为第一否决项,先排除内容错图,再用清晰度、风格匹配、主体完整度打分定级。用统一评分表记录每张图,辅以哈希查重减少重复评审;示例阈值为总分≥4且语义一致性≥4,小批次全检、大批次先抽检再扩大。低分图反推提示词失效关键词并记录修订,但评分标准是内部口径,不能替代对画面的最终事实审核。

确定四个评估维度和打分规则

评分前先统一口径。同一个“不够好”,有人指清晰度,有人指内容错位,口头层面很难收敛。把评估拆成四个固定维度:语义一致性、清晰度、风格匹配、主体完整度。每项按 1-5 分打分,评估顺序固定:先看语义一致性,内容不对直接淘汰,后面三项不用再评。

语义一致性(第一否决项)

图片内容是否还原提示词描述。1-2 分:主体、行为或场景跟提示词对不上;3 分:主要内容吻合,但有多出或缺失元素;4-5 分:对应准确,细节小出入可接受。

清晰度

1-2 分:整体模糊,边缘或文字不可辨;3 分:主体清晰,背景有噪点或压缩痕迹;4-5 分:细节干净,无可见模糊。

风格匹配

1-2 分:风格方向相反;3 分:方向对,但用色、线条偏差明显;4-5 分:整体协调,符合参考方向。

SeFi-Image 生成结果质量评估与筛选标准

主体完整度

1-2 分:主体被截断或关键部件缺失;3 分:基本完整,有遮挡或边缘裁切;4-5 分:主体完整,边缘干净。

用评分表记录每一张的结果

评分表固定字段,避免口头记结论。每批图建一张表,一张图一行,字段如下。

图片编号语义一致性清晰度风格匹配主体完整度总分备注评分人
IMG_014243433.5右手裁切,背景多出人物王工

备注栏写低分图的具体偏差,后面回写提示词模板要用。评分人署名是必须的;同一张图多人评分不一致时,可以回头核对分歧出在哪个维度。

先用重复度工具排除近似图

同一批图里常有重复或近似构图。先做文件级去重,再做感知哈希近似检测,能明显减少评审工作量。

SeFi-Image 生成结果质量评估与筛选标准
  • 文件哈希:完全相同的文件哈希值一致,可直接排除。
  • 感知哈希:计算图片指纹后用汉明距离判断近似,适合过滤构图相近的不同图。

以下用伪代码演示判断思路。

# 文件级完全去重
sha256sum output/*.png | sort | awk 'seen[$1]++ {print $2}' > duplicate_files.txt

# 感知哈希近似检测(Python 示例)
import imagehash
from PIL import Image

hashes = []
for img_file in image_list:
    h = imagehash.phash(Image.open(img_file))
    hashes.append((img_file, h))

for i in range(len(hashes)):
    for j in range(i + 1, len(hashes)):
        distance = hashes[i][1] - hashes[j][1]
        if distance <= 10:
            print(hashes[i][0], "近似于", hashes[j][0])

汉明距离阈值取 10 只是示例,需要结合实际图片规模调整。查重只减少重复评审,不能代替四维评分;去重后剩下的图仍要逐张评估。

设定通过阈值和抽检比例

评分之后要把数字变成动作。示例阈值:总分≥4,且语义一致性≥4,才进入可用候选。语义一致性是硬门槛,内容错了,画面再干净也要降级处理。

SeFi-Image 生成结果质量评估与筛选标准

抽检按批量规模来:一次生成几十张时建议全检;几百张时先抽 20% 或至少 30 张,看四个维度分数是否稳定,再决定继续抽还是全检。这个比例是操作起点,不是验收标准,需要结合生成质量和业务要求调整。

把评分结果回写到提示词模板

低分图不能只丢进回收站。建议把失分原因反推到提示词模板里,找出失效关键词——即提示词写了、但生成结果没有反映出来的词。

  • 语义一致性低分:回到提示词对应片段,检查关键词是否被其他描述稀释。比如“holding a map”没生成地图,可把地图相关短语前置或拆成独立短句。
  • 主体完整度低分:检查负向提示词是否缺少 cropped、out of frame 这类词,或两个主体描述存在占位冲突。

每一次修订都记录到模板修订表,方便回看改动来源:

原提示词片段低分问题推测失效关键词修订后提示词片段修订人
a person holding a map in the park主体完整度 2 分,右手被裁holding a map 与整体构图冲突a full-body person holding a map, generous margin around the subject王工

评分标准由使用方维护,不能一次定死;每跑几轮,回头核对四维分值描述是否还贴合实际废图形态。