Skip to content

视觉偏好盲测协议与 VLM 有序偏好抽取 Prompt

第三部 · Prompt · 第40章

撰写日期:2026-07-13

给品牌视觉、图标、封面这类主观资产做团队决策时,"喜欢哪个投一票"几乎不产出可用信号。这篇给两件配套的东西:一个采集偏好的盲测协议,一个把聊天截图里的偏好转成结构化投票的 VLM 抽取 Prompt

适用场景

  • 图标 / Logo / 封面 / 配色等视觉资产的多方案取舍;
  • 偏好散落在群聊截图里,需要转成可聚合、可比较的投票数据。

Part A:盲测采集协议

单选或点赞式投票只给出众数,丢掉了偏好的强度和分歧结构;受众若知道产品意图,会锚定到"应该喜欢什么"而非直觉反应。三条约束把这些坑堵上:

约束做法为什么
无描述盲测只发候选图,不介绍业务背景剥离既有认知偏差,拿到直觉反应
拉外部目标受众每人邀请若干名符合目标画像的圈外人参与逼近真实用户,而非团队内部审美
强制有序排名要求排出前 N 名(如"排最多三名"),可附理由有序排名能换算成接受度与分歧度,比"投一票"信息量大得多

产出形如"1 号共识最高、3 和 9 次之"这类可聚合的有序结论,而不是一团模糊好感。

Part B:VLM 有序偏好抽取 Prompt

从聊天截图里抽偏好时,模型天然倾向把任何提到候选编号的句子都当成投票,会把批评误读成偏好。抽取契约要显式区分"排序"与"吐槽",并设置信度闸门:

text
你要从这张聊天截图里,抽出参与者对候选编号的【有序偏好】。

【只计入明确的排序表达】
- 计入:形如 "3>2>8"、"第一名是 5"、"最喜欢 1 号" 的明确排序 / 优选。
- 不计入:仅提到某编号、或负面评价(如"10 号最丑""5 和 10 配色脏")——
  负面评价不是选择,一律不填。

【置信度闸门】
- 对整张图的抽取结果给一个 confidence(0~1)。
- confidence < 0.8 时,selections 一律返回空数组,不要硬猜。

【输出:纯 JSON,不要 markdown 围栏、不要解释】
{"selections": [编号从优到次的有序数组], "confidence": 0.0}

输入图片:{image}

调优记录

现象修正
"10 号最丑 / 5 和 10 配色脏"被抽成 selections=[10,5]加负例说明——负面评价不是排序 + 置信度 < 0.8 留空;同图稳定返回 selections=[]confidence≈0.9
输出带 markdown 围栏 / 解释文字,管道解析失败强制"纯 JSON、无围栏、无解释",让下游可直接入库
把只提编号的闲聊当成投票抽取契约只认"明确排序 / 优选"表达

我的判断

主观资产的决策,采集方法比统计方法更重要——盲测 + 强制排名决定了数据有没有信号;而从非结构化对话里抽结构化数据时,"宁缺毋滥"必须写进 Prompt(负例 + 置信度闸门),否则脏数据会顺着自动化管道一路污染下游看板。

相关

MIT License