Appearance
视觉偏好盲测协议与 VLM 有序偏好抽取 Prompt
第三部 · Prompt · 第40章
撰写日期:2026-07-13
给品牌视觉、图标、封面这类主观资产做团队决策时,"喜欢哪个投一票"几乎不产出可用信号。这篇给两件配套的东西:一个采集偏好的盲测协议,一个把聊天截图里的偏好转成结构化投票的 VLM 抽取 Prompt。
适用场景
- 图标 / Logo / 封面 / 配色等视觉资产的多方案取舍;
- 偏好散落在群聊截图里,需要转成可聚合、可比较的投票数据。
Part A:盲测采集协议
单选或点赞式投票只给出众数,丢掉了偏好的强度和分歧结构;受众若知道产品意图,会锚定到"应该喜欢什么"而非直觉反应。三条约束把这些坑堵上:
| 约束 | 做法 | 为什么 |
|---|---|---|
| 无描述盲测 | 只发候选图,不介绍业务背景 | 剥离既有认知偏差,拿到直觉反应 |
| 拉外部目标受众 | 每人邀请若干名符合目标画像的圈外人参与 | 逼近真实用户,而非团队内部审美 |
| 强制有序排名 | 要求排出前 N 名(如"排最多三名"),可附理由 | 有序排名能换算成接受度与分歧度,比"投一票"信息量大得多 |
产出形如"1 号共识最高、3 和 9 次之"这类可聚合的有序结论,而不是一团模糊好感。
Part B:VLM 有序偏好抽取 Prompt
从聊天截图里抽偏好时,模型天然倾向把任何提到候选编号的句子都当成投票,会把批评误读成偏好。抽取契约要显式区分"排序"与"吐槽",并设置信度闸门:
text
你要从这张聊天截图里,抽出参与者对候选编号的【有序偏好】。
【只计入明确的排序表达】
- 计入:形如 "3>2>8"、"第一名是 5"、"最喜欢 1 号" 的明确排序 / 优选。
- 不计入:仅提到某编号、或负面评价(如"10 号最丑""5 和 10 配色脏")——
负面评价不是选择,一律不填。
【置信度闸门】
- 对整张图的抽取结果给一个 confidence(0~1)。
- confidence < 0.8 时,selections 一律返回空数组,不要硬猜。
【输出:纯 JSON,不要 markdown 围栏、不要解释】
{"selections": [编号从优到次的有序数组], "confidence": 0.0}
输入图片:{image}调优记录
| 现象 | 修正 |
|---|---|
"10 号最丑 / 5 和 10 配色脏"被抽成 selections=[10,5] | 加负例说明——负面评价不是排序 + 置信度 < 0.8 留空;同图稳定返回 selections=[]、confidence≈0.9 |
| 输出带 markdown 围栏 / 解释文字,管道解析失败 | 强制"纯 JSON、无围栏、无解释",让下游可直接入库 |
| 把只提编号的闲聊当成投票 | 抽取契约只认"明确排序 / 优选"表达 |
我的判断
主观资产的决策,采集方法比统计方法更重要——盲测 + 强制排名决定了数据有没有信号;而从非结构化对话里抽结构化数据时,"宁缺毋滥"必须写进 Prompt(负例 + 置信度闸门),否则脏数据会顺着自动化管道一路污染下游看板。