deerflow-code/offline-backend-20260512/backend/knowledge/knowledge_base/playbooks/uncertainty_communication_protocol.md
2026-09-07 18:24:55 +08:00

10 KiB
Raw Blame History

不确定性沟通协议

本文件定义所有分析输出中不确定性的标准表达方式。模型在每次输出前必须按本文件规范处理不确定性。

政治分析的核心品质标记是对不确定性的诚实。过度自信与过度模糊都是失格。本协议的目的是让模型在这两个极端之间稳定操作。


一、为什么需要协议

如果不规范不确定性的表达,模型会出现两种典型失败:

失败 A: 过度自信。用"将会""必然""毫无疑问"等词汇陈述实际上充满变数的判断。读者据此做决定,承担非预期风险。

失败 B: 过度模糊。用"或许""可能""见仁见智""难以判断"塞满文本,让分析失去信息量。读者读完不知道分析者到底判断什么。

本协议要求:每个判断都标注信心度,但同时仍要做出判断。逃避表态不是选项。


二、信心度五级分级

所有判断按以下五级标注:

等级 1: 高度确定(high_confidence)

条件:

  • 多个独立可靠来源一致
  • 知识库已审定的事实陈述
  • 明确的官方记录、法律条文、选举结果

表达措辞:

  • "确实""已知""根据 X 资料"
  • "X 政党在 Y 年获得 Z% 选票"(可查事实)
  • "Y 法律的第 N 条规定..."

典型适用:

  • 历史选举结果
  • 公开的法律条文
  • 已经发生的官方声明(引用,非诠释)

等级 2: 相当可能(likely)

条件:

  • 主要证据指向此判断
  • 已知的反证有限或较弱
  • 类似情境在历史上多次出现同方向结果

表达措辞:

  • "相当可能""主要证据显示""倾向于"
  • "X 派系内部在 Y 议题上意见分歧的可能性较高"
  • "根据现有民调,A 候选人的支持度高于 B 候选人"

典型适用:

  • 基于多份民调的趋势判断
  • 根据历史模式的近期预测
  • 多源验证的政策动向

等级 3: 有所证据(possible)

条件:

  • 部分证据支持
  • 也存在合理的相反诠释
  • 单一来源或不完整资料

表达措辞:

  • "有可能""可能""一种可能的解读是"
  • "此发言可能暗示..."(说明同时也可能不暗示)
  • "若 X 发生,则可能..."

典型适用:

  • 单一信号的解读
  • 模糊性发言的诠释
  • 早期信号的初步判断

等级 4: 推测性(speculative)

条件:

  • 证据稀薄但有理论或类比依据
  • 主要基于推论而非直接观察
  • 涉及行为者意图的判断

表达措辞:

  • "推测""一种可能的情境是""若推论无误"
  • "此举背后的意图可能是 X,但目前证据不足以确认"
  • "在某些情境下,可能出现..."

典型适用:

  • 行为者动机推论
  • 情境规划中的特定情境
  • 长期趋势预测

等级 5: 知识库未覆盖(not_in_knowledge)

条件:

  • 知识库没有相关资料
  • 资料不足以判断
  • 任务超出知识库设计范围

表达措辞:

  • "知识库未涵盖此问题"
  • "现有素材不足以判断"
  • "此问题需要外部查证"

典型适用:

  • 知识库截至日期之后的事件
  • 知识库刻意未包含的内容(个人隐私、未公开资料等)
  • 高度专业的非政治议题(经济、法律、技术等具体细节)

三、复合判断的处理

许多分析涉及多个子判断。每个子判断的信心度可能不同。

规则 3.1: 复合判断的信心度等于最弱环节

如果一个判断由多步推论组成(A → B → C),整体信心度不能高于其中最弱的一步。

错误示范: "因为 A 高度确定,所以 C 高度确定。"(忽略 A→B 与 B→C 各自的不确定性)

正确示范: "A 高度确定(等级 1);从 A 推 B 是相当可能(等级 2);从 B 推 C 是推测性(等级 4)。整体而言,C 的信心度为推测性。"

规则 3.2: 不同维度分别标注

一个判断可能涉及多个维度(事实层、解读层、预测层),各维度的不确定性可能不同。

范例:

  • 事实层:"X 在 Y 时间发表 Z 演讲" — 高度确定
  • 解读层:"此演讲意在向某受众发出某信号" — 有所证据
  • 预测层:"此信号将导致某反应" — 推测性

输出时三层分别标注,不要混为一谈。


四、典型场景的处理

场景 1: 民调相关判断

民调本身有抽样误差、house effect、问法效应。涉及民调的判断遵循:

  • 单一民调的具体数字:等级 2-3(看机构与方法学)
  • 多家民调一致显示的方向:等级 2
  • 跨时段的趋势:看一致性,通常等级 2-3
  • 由民调推论选举结果:必降一级(民调不直接等于选票)

输出范例:

"根据 [机构] 在 [时间] 的民调,A 候选人支持率为 X%(高度确定,引用事实)。综合多家民调,A 在过去三个月维持领先(相当可能,三家以上同方向)。但民调与最终选票之间常有 5-10 个百分点的偏差,因此推论 A 必胜在此阶段为推测性。"

场景 2: 政治意图判断

判断政治人物或机构的"意图"是政治分析中信心度天然较低的部分。

规则: 涉及意图的判断,信心度上限为等级 3(有所证据)。除非有当事人明确公开表态。

正确措辞:

  • "此举的可能动机包括..." — 列举多种可能而非锁定一种
  • "公开表态显示意图是 X,但此说法的真实性需要持续观察"

禁止措辞:

  • "X 真正的意图是 Y" — 除非有直接证据
  • "X 之所以这么做是因为..." — 单一因果归因

场景 3: 长期预测

时间越远的预测信心度越低。基本规则:

  • 未来 3 个月:可至等级 2-3
  • 未来 3-12 个月:通常等级 3-4
  • 超过 1 年:通常等级 4
  • 2028 选举结果(在 2026 年此刻):等级 4,且应以情境而非点估计呈现

场景 4: 历史归因

判断"某结果是因为某原因造成"是因果推论,信心度有限。

规则: 历史因果归因,信心度上限通常为等级 2-3。

正确做法:

  • 列出多个可能原因
  • 评估各原因的相对权重
  • 标注无法完全排除的反事实

五、不确定性的视觉化

输出较长报告时,建议在关键判断旁标注信心度等级,让读者快速识别。

行内标注法

"A 候选人将赢得 2028 年大选 [推测性]。其支持率自 2025 年中以来稳定上升 [相当可能],且经济议题对其有利 [有所证据]。"

段尾标注法

"[整段判断] ... 〔综合信心度:相当可能;最弱环节:从民调到选票的转换〕"

不强制视觉化但语言要清晰

不一定要用方括号标签,但语言措辞必须能让读者识别信心度。这就是为什么本协议规定每一级有特定措辞——为了让读者从用词就能识别。


六、明确禁止的表达

以下措辞在分析输出中禁止使用:

禁止 1: 绝对化措辞(除非真的等级 1)

  • ❌ "必然""一定""毫无疑问""绝对"
  • ❌ "百分之百""完全确定"
  • 例外:等级 1 的事实陈述可用"确实""已知"

禁止 2: 假性中立措辞

  • ❌ "见仁见智""各有说法""莫衷一是"——除非真的列出各方说法
  • ❌ "可能 A 也可能 B"——必须给出哪个更可能或为何无法判断

禁止 3: 模糊到无信息的措辞

  • ❌ "或许有可能"——双重模糊
  • ❌ "在某种意义上"——空话
  • ❌ "众所周知"——除非真是已知事实

禁止 4: 隐藏信心度的措辞

  • ❌ "众所周知 A 将赢" — 把推测包装成共识
  • ❌ "不可否认 A 是叛徒" — 把立场包装成事实
  • ❌ "毋庸置疑 X 是错的" — 用强调词替代论证

七、特殊情境

情境 1: 当资料相互矛盾

不同来源给出矛盾资讯时:

  1. 不要平均——简单折中可能两边都错
  2. 明示矛盾——"A 来源显示 X,B 来源显示非 X"
  3. 评估来源可靠度——参见 reference/source_credibility_tiers.md
  4. 若无法判断哪方正确——标注为等级 3-5,说明矛盾的具体内容

情境 2: 当判断涉及隐私敏感

涉及个人私事、家庭关系、未公开通讯等:

  • 知识库不收录此类内容
  • 即使从公开素材可推论,也应避免推论
  • 输出"此涉及隐私范畴,不予分析"

情境 3: 当判断涉及法律边界

涉及违法、不法行为指控:

  • 未经司法判决的指控不视为事实
  • 区分"被起诉""被调查""有争议""被某方认为不当"等不同状态
  • 引用具体的法律状态而非笼统标签

情境 4: 当被问到"你怎么看"

使用者可能直接问模型的"立场"或"个人看法"。

  • 模型不应表达政治立场
  • 改以"基于此分析框架"重新表达
  • 例如不说"我认为 A 党会赢",说"基于现有素材与历史模式,A 党在情境 X 下胜率较高"

八、输出末尾的总信心度声明

每份分析报告末尾应有一段"信心度总结",例如:

## 分析信心度总结

本分析中:
- 事实陈述部分(A、B 段):高度确定
- 解读部分(C 段):相当可能至有所证据
- 预测部分(D 段):推测性

主要不确定来源:
1. 川普 2.0 时期美方对台政策细节,知识库覆盖较薄
2. 2028 候选人尚未确定,预测以情境呈现而非点估计
3. 大陆侧反应模式预测基于过往规律,但当代决策环境已有变化

未涵盖范围:[列举本分析未触及但可能相关的面向]

这段声明本身就是分析品质的展现。


九、与其他文件的关系

  • 本协议与 playbooks/avoid_pitfalls.md 中的"输出陷阱"段落相互配合
  • 来源可靠度的判断参见 reference/source_credibility_tiers.md
  • 偏差自检参见 playbooks/bias_self_check.md(占位)
  • 各 playbook 的输出格式应明示如何套用本协议

十、最重要的一条

承认不知道是品质标记,不是缺陷。

宁可输出"基于现有素材,此问题在等级 3 以上的信心度下无法判断,主要原因是 X、Y",也不要编造一个看起来完整的答案。

读者会感谢诚实。读者无法从过度自信的错误中复原。


last_updated: 2026-05-08