知识从哪来 · Knowledge Provenance

👤 崔西红柿-Tracey 📦 v1.0.0 ⭐ 4.7 ⬇️ 238 下载
🤖 AI-Agent 免费

📖 技能介绍


AIGC: Label: "1" ContentProducer: 001191440300708461136T1XGW3 ProduceID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode1: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ= ContentPropagator: 001191440300708461136T1XGW3 PropagateID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode2: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ=


知识从哪来 · Knowledge Provenance

§0 你一定经历过这个场景

你问 AI:「Q3 用户流失率为什么比 Q2 高了 12%?」

AI 答:「主要原因是新版本改动了 onboarding 流程,导致首周留存率从 68% 降到 53%。结合行业经验,同类改动通常需要 2-3 周才能观察到稳定数据,所以建议暂缓下个版本的交互变更。」

你追问:「53% 这个数字哪来的?」

AI 沉默了。它不记得这个数是训练数据里的、联网搜到的、还是自己推出来的。

你追问:「'2-3 周' 是你的经验还是行业共识?」

AI 还是答不上来。

你不再信任这段回答了——不是因为它错了,而是因为你没法验证它的每一句话。

Knowledge Provenance 做的事情:在 AI 生成回答的同时,为每一个关键判断打上来源标签。不是事后追认——是生成时同步记录。

它不判断真假,只告诉你原料从哪来。真假由你判断。


§Q 快速上手

唤醒方式

对 AI 说以下任意一句即可启动 Knowledge Provenance:

你说的话 效果
「标注一下这段话的来源」 进入全透明模式,逐条标注来源
「这条数据从哪来的」 按需模式,展开指定语句的来源详情
「这个结论是推断的还是查到的」 区分事实引用与推断
「开摘要模式」 只标注低置信度或有争议的来源
「关了」 关闭来源标注

四种透明度模式

模式 触发词 标注范围
全透明 「全标」/「全部标注来源」 每条信息都带 [类型 · 置信度]
摘要 「摘要模式」/「只标关键的」 只标注低置信度或有争议的来源
按需 直接追问某条信息 仅对用户追问的语句展开标注
关闭 「关了」/「不用标注」 不标注(默认)

来源标签格式

[来源类型 · 置信度]

完整示例:

2025 年中国 SaaS 市场规模约 892 亿元 [联网搜索 2026-07-14 · 中]
——来源:艾瑞咨询《2025 中国企业级 SaaS 行业研究报告》,单一信源未交叉验证,
   建议使用时标注"据艾瑞咨询"。

回答标注示例

标注前(普通 AI 回答):

Q3 用户流失率上升 12%,主要原因是新版 onboarding 流程导致首周留存率从 68% 降到 53%。建议暂缓下个版本的交互变更,先观察 2-3 周。

标注后(全透明模式):

Q3 用户流失率上升 12% [本轮对话提供数据 · 高],主要原因是新版 onboarding 流程导致首周留存率从 68% 降到 53% [本轮对话提供数据 · 高]。建议暂缓下个版本的交互变更,先观察 2-3 周 [训练数据 · 中]。

── 置信度说明: · 「53%/68%」→ 用户提供,置信度高 · 「2-3 周观察期」→ 来自训练数据中的产品管理通用经验,非本次对话或联网搜索获取,置信度中。 如需要更精确的行业基准数据,建议明确搜索「SaaS 产品 onboarding 改动后的数据稳定周期」

什么情况下用

适合用的场景: - 阅读 AI 生成的报告/分析,需要验证关键数据 - 需要区分 AI 的「事实陈述」和「推断建议」 - 调试 AI 输出,排查错误结论的源头 - 多人协作中需要明确每段内容的可信度

不适合用的场景: - 闲聊或创意类对话(来源标注反而干扰阅读) - AI 回答本身不涉及数据或事实性断言 - 用户已经明确知道信息来源


§1 核心能力详解

F1:五类来源体系

类型 含义 判定规则 典型标签示例
训练数据 来自模型预训练语料 不来自本轮对话/历史记忆/联网搜索,且非推断 [训练数据 · 中]
本轮对话 用户在当次会话中提供的信息 用户明确输入的数据、文件、说明 [本轮对话提供数据 · 高]
历史记忆 从长期记忆/历史会话中检索 来自记忆检索结果,附检索时间 [历史记忆 2026-06-20 · 高]
联网搜索 实时网络搜索结果 来自 web_search / web_fetch,附时间戳和 URL [联网搜索 2026-07-14 · 高]
推断 基于其他来源推导的结论 不是直接从任何来源获取,而是推理产物 [本轮对话推断 · 中]

推断的子类型

子类型 示例 典型标签
逻辑推断 "A>B 且 B>C,所以 A>C" [推断 · 逻辑推理 · 高]
统计推断 "基于 3 个样本推测整体趋势" [推断 · 统计外推 · 低]
类比推断 "类似项目 X 用了 4 周,所以这个大概也要 4 周" [推断 · 类比 · 中]
经验推断 "按行业惯例,DDL 缓冲期通常为 2 天" [推断 · 经验 · 中]

F2:置信度体系

置信度 判定条件
用户直接提供 / 权威信源且多源交叉验证 / 逻辑必然结论
单一信源 / 训练数据通用知识 / 经验性推断 / 类比推断
过期信息 / 小样本外推 / 模糊记忆 / 弱相关类比

置信度上调规则: - 多源交叉验证一致:上调一级 - 用户确认后:上调至「高」

想要更强大的技能插件,就来小葱技能站7w4.net看看吧。

置信度下调规则: - 来源发布日期超过 1 年:下调一级 - 来源为个人博客/论坛/社交媒体:下调一级 - 来源与其他信源矛盾:下调一级并标注冲突

F3:与逻辑链检察联动

逻辑链检察告诉你推理的步骤(How),Knowledge Provenance 告诉你每步的依据从哪来(Where)。

逻辑链输出:
  Step 1: 用户流失率从 Q2 的 5% 上升到 Q3 的 17% → 上升 12 个百分点
  Step 2: 对比 Q2→Q3 的产品变更,最大改动是 onboarding 流程
  Step 3: 首周留存率从 68% 降到 53%,与 onboarding 改动高度相关
  Step 4: 结论——onboarding 改动是流失率上升的主要原因

Knowledge Provenance 叠加标注:
  Step 1: [本轮对话提供数据 · 高]
  Step 2: [训练数据 · 中] ← 产品变更信息未在当前对话中提供
  Step 3: [本轮对话提供数据 · 高]
  Step 4: [推断 · 相关性推断 · 中] ← 相关≠因果,未排除混淆变量

用户一眼看到:Step 2 和 Step 4 的依据相对薄弱,需要额外验证。

F4:与幻觉捕手联动

来源标注为「推断」的语句,自动设为幻觉捕手的重点扫描对象

原文:建议暂缓下个版本的交互变更,先观察 2-3 周 [推断 · 经验 · 中]
     ↑ 推断标签触发幻觉捕手重点扫描
     ↓
幻觉捕手输出:未发现事实性错误,但「2-3 周」缺乏具体引用依据,
              属于经验性建议而非事实断言。风险等级:低。

§2 工作流程

用户请求 AI 回答
      │
      ▼
┌─────────────────────────────┐
│ AI 生成回答(token by token)  │
│ 同步记录每个关键判断的来源映射  │ ← 核心:不能事后补标
└─────────────────────────────┘
      │
      ▼
┌─────────────────────────────┐
│ 根据透明度模式决定输出格式     │
│ · 全透明:全部带标签          │
│ · 摘要:只标注低置信度        │
│ · 按需:等待用户追问          │
│ · 关闭:不标注               │
└─────────────────────────────┘
      │
      ▼
┌─────────────────────────────┐
│ 输出标注后的回答              │
│ 标签格式:[类型 · 置信度]     │
│ 末尾附置信度说明(如有低置信度)│
└─────────────────────────────┘

§3 来源判定决策流程

这段信息从哪来?
    │
    ├─ 用户在本次对话中明确提供? → 本轮对话 · 标注置信度
    │
    ├─ 从历史记忆/长短期记忆中检索到? → 历史记忆 · 附检索时间 · 标注置信度
    │
    ├─ 从联网搜索结果中获取? → 联网搜索 · 附时间戳 · 标注置信度
    │
    ├─ 基于以上某类来源直接推理得出? → 推断 · 标注推理类型和置信度
    │     ├─ 逻辑必然结论 → 推断 · 高
    │     ├─ 统计外推 → 推断 · 低
    │     ├─ 类比 → 推断 · 中
    │     └─ 经验判断 → 推断 · 中
    │
    └─ 以上都不是? → 训练数据 · 中(默认)
          └─ 若信息明显过时或模糊 → 训练数据 · 低

§R 核心铁律

  1. 来源映射必须同步,绝不事后补标。 回答生成完成后,无法准确回忆每个 token 的来源归属。事后补标 = 猜测,猜测 = 造假。
  2. 推断就是推断。 不要把推断包装成事实。即使用户可能不会追问,也要诚实地标注「推断」。
  3. 置信度不下限不封顶,但必须诚实。 不确定就标注「中」或「低」。高置信度必须满足明确的判定条件。不为了显得可信而虚标置信度。
  4. 用户永远可以追问。「这条从哪来的」是用户的天然权利,任何时候追问都应该获得展开回答。 即使在关闭模式下,追问也应触发按需标注。
  5. 来源标注不替代事实核查。标注「联网搜索 · 高」不等于信息正确——它只说明信息来源,不验证信息真伪。 如果在幻觉捕手联动模式下,标注为推断的语句会自动提升扫描优先级,但来源标注本身不做真伪判断。
  6. 与逻辑链检察互不替代。 逻辑链告诉你 How(推理步骤),来源标注告诉你 Where(依据来源)。两者叠加才完整。单独使用任何一个都是有信息缺口的。

§A 结构化异常处理

异常场景 处理方式 标注行为
来源无法确定(不匹配任何已知类型) 标注为「未知来源 · 低」,并提示用户帮助补充 [未知来源 · 低]
多源信息冲突 同时列出所有来源,标注冲突,置信度各下调一级 [联网搜索 A · 低] vs [训练数据 · 低] + 冲突说明
用户中途切换透明度模式 已输出部分无法回标(见铁律 1),但从切换点起按新模式输出 切换点之后生效
回答包含置信度极低的信息 全透明模式下自动附置信度警告;摘要模式下该语句自动纳入标注范围 末尾附「⚠️ 置信度警告」板块
联网搜索结果为空或不相关 降级标注为「训练数据 · 低」或「推断 · 低」,并告知用户搜索未命中 [搜索未命中,改用训练数据 · 低]
用户提供的信息自身可能不准确 照常标注「本轮对话提供数据 · 中」,不替用户验证其输入的正确性 [本轮对话提供数据 · 中]—来源明确但未交叉验证

§B 常见错误与纠正

常见错误 为什么错 纠正
事后补标来源 回答生成后无法准确回忆来源,补标等于编造 必须在生成时同步记录。如果确实忘了,标注「来源未记录」而非猜测
把训练数据内容标为「联网搜索」 训练数据中的知识和实时搜索是两类来源 只有调用了 web_search / web_fetch 工具获取的内容才算联网搜索
置信度通胀 为了让回答看起来可信,把中置信度标为高 中就是中,低就是低。用户宁可看到诚实的「中」也不要虚假的「高」
推断包装成事实 "同类改动通常需要 2-3 周"实际上是经验推断,但标注为"训练数据 · 高" 经验推断 → [推断 · 经验 · 中],不是训练数据事实
忽略来源的时间衰减 2023 年的数据标注为「高」置信度 超过 1 年的来源自动下调一级置信度

§C 能力边界

| 做不到的事 | 说明 | |:--|:--|:--| | 不验证真伪 | 来源标注告诉你信息从哪来,不告诉你信息对不对。真伪验证属于幻觉捕手的范畴 | | 不补标已有回答 | 已经生成的回答无法追溯来源。只能对新回答生效 | | 不追溯其他 AI 的回答 | 只能标注当前 Agent 自己生成的内容的来源 | | 不保证 100% 覆盖 | 部分简单陈述(如过渡句、礼貌用语)不标注来源,但关键事实和判断必须有标签 |


§D 避坑指南

场景 现象 原因 怎么办
全透明模式太啰嗦 一段 200 字的回答带了 15 个标签,阅读体验差 全透明模式下过于细粒度标注 对同一来源类型和置信度的连续语句做合并标注,不要逐句重复
训练数据内容被过度拆分 同一个段落拆成 5 个标签,实际上都来自训练数据 判定逻辑过于碎片化 以"信息单元"而非"句子"为标注单位。一个逻辑完整的信息块共用一个来源标签
用户过度依赖置信度 用户只看「高/中/低」,不看来源类型说明 忽略了不同来源类型的可信度差异 摘要模式下在文本末尾附「置信度等级含义速查」
历史记忆来源标注时间但用户不理解 [历史记忆 2026-03-15 · 高]——用户追问"3 月 15 日是什么意思" 用户不一定理解记忆检索的时间戳含义 首次使用历史记忆来源时附带一句说明:「该信息检索自您在 2026-03-15 会话中提供的内容」

§E FAQ

Q1:Knowledge Provenance 和逻辑链检察的关系是什么?

逻辑链检察展示推理步骤(How),Knowledge Provenance 标注每步来源(Where)。两者互补:一条完整的推理链需要同时具备「怎么推」和「依据在哪」。详见 §1「F3:与逻辑链检察联动」。

Q2:和幻觉捕手有什么区别?

幻觉捕手负责验证信息真伪("这句话对不对"),Knowledge Provenance 负责标注信息来源("这句话从哪来")。来源标注为「推断」的语句会自动设为捕手重点扫描对象。详见 §1「F4:与幻觉捕手联动」。

Q3:全透明模式和摘要模式怎么选?

  • 研究/审计/调试场景 → 全透明
  • 日常阅读 → 摘要(只标低置信度和争议来源)
  • 快速浏览 → 按需(需要时追问)
  • 闲聊/创意 → 关闭

Q4:如果信息来源是训练数据,但我不确定是什么时候训练的,怎么标?

标注为「训练数据 · 不确定时效」。不编造具体年份。如果内容可能有时间敏感性,额外标注「⚠️ 时效性未知,建议核实」。

Q5:同一段话里有多个来源怎么处理?

不合并。分别标注。例如:「Q3 留存率 53% [本轮对话 · 高],同类项目通常需要 2-3 周恢复 [训练数据 · 中]」。

Q6:用户说"你这个数据不对"——怎么响应?

不争论。标注不变,但附加说明「来源如上,如需核实,建议 [提供核实路径]」。来源标注不替代事实核查,用户有权质疑。


§F 版本历史

版本 日期 变更说明
1.0.0 2026-07-14 初始版本。五类来源体系(训练数据 / 本轮对话 / 历史记忆 / 联网搜索 / 推断)+ 推断四子类型(逻辑 / 统计 / 类比 / 经验)。四级透明度模式(全透明 / 摘要 / 按需 / 关闭)。与逻辑链检察 + 幻觉捕手联动设计。六条核心铁律。六类异常处理 + 五类常见错误 + 四类避坑场景。
(内容由AI生成,仅供参考)

🤖 AI 评测

这个 Skill 的设计理念很好,能让 AI 回答时标注每句话的来源,帮助你判断信息可不可信。它的透明度分级和置信度标注设计得比较实用,遇到数据争议时很有用。不过目前文档偏规范性质,没有给出具体怎么用的示例,实际效果要看 AI 执行得怎么样。整体属于中上水平,但还需要配套工具支持才能发挥最佳效果。

📊 多维度评分

适应性4.8
规范性4.9
有效性4.8
可靠性3.8
可信度5

📁 包含文件 (3 个)

📄 README.md 2.3 KB
📄 SKILL.md 16.3 KB
📄 需求说明书.md 4.1 KB