chatdistill-信息蒸馏工具

👤 。。 📦 v1.0.0 ⭐ 4.2 ⬇️ 267 下载
📚 知识管理 免费

📖 技能介绍


name: chat-distill description: 聊天记录提纯器——将杂乱的多轮微信/即时通讯聊天记录蒸馏成结构化的 26-Scheme Prompt 蓝图。当用户提供聊天记录、对话截图、语音转文字内容,并希望从中提取核心需求、生成 AI Agent 提示词、或将碎片化讨论整理成可执行方案时触发。典型场景:(1) 微信群聊头脑风暴后想落地成方案 (2) 老板在群里零散布置任务需要编译成完整需求文档 (3) 多人讨论的产品/项目需求需要提炼成 PRD 或 SOP (4) 语音转文字的会议记录需要结构化 (5) 任何需要从对话噪音中提取信号并输出 26-Scheme Prompt 的场景。触发词:聊天记录提纯、聊天记录蒸馏、群聊提纯、对话整理、微信记录变方案、聊天变 prompt、chat-distill、26-Scheme。


聊天记录提纯器 (Chat Distill)

核心能力

将杂乱的多轮聊天记录(微信、飞书、钉钉、Slack 等)蒸馏成高精度、生产级的 26-Scheme Prompt 蓝图——覆盖角色、背景、任务、利益相关者、优先级、风险、验收、决策推理、质量标准等 26 个正交维度,确保生成的 Prompt 零歧义、可直接执行。

执行流水线

第一步:原始数据预处理

  1. 读取用户提供的聊天记录(文本粘贴、文件上传、截图 OCR 均可)
  2. 标注发言人身份(A/B/C 或姓名),保留时间线顺序
  3. 识别并标记噪音类型:寒暄、表情包描述、语音转文字错别字、重复确认、跑题闲聊

第二步:核心意图挖掘

  1. 目标识别:从对话中提取最终想要交付的资产/动作(文案、方案、代码、报告等)
  2. 约束提取:字数、语气、格式、deadline、禁止事项等硬性要求
  3. 偏好信号:用户提及的参考案例、风格倾向、"不要 XX 要 XX"类对比表达
  4. 隐含推理:老板对草稿的批评 -> 反转为正向约束;讨论中的犹豫/妥协 -> 标记为低置信度
  5. 多维信号采集:利益相关者关系、优先级线索、风险暗示、验收标准、版本迭代痕迹等

第三步:噪音过滤

完全移除以下内容: - 寒暄问候("在吗""哈喽""谢谢") - 情绪填充("哈哈""牛""6") - 冗余确认("收到""好的""明白") - 跑题闲聊(与核心目标无关的支线对话) - 语音转文字的明显错别字(自动修正)

第四步:26-Scheme 结构化编译

将提纯后的信息填入二十六柱框架:

核心六柱(基础层)

1. Role(角色与人设)
  • 根据业务领域定义高度具体的专家身份
  • 禁用泛化标签("助手""AI"),使用精准人设("资深汽车文案""敏捷产品经理")
2. Context(背景与意图)
  • 合成业务场景、市场痛点、目标受众
  • 提取对话中触发此任务的显性/隐性动因
3. Task(核心指令与流水线)
  • 按时间顺序拆解执行步骤为 SOP
  • 每步用强动词开头("撰写""分析""生成")
4. Output Format(输出格式)
  • 指定精确的响应布局(Markdown 表格、JSON schema、编号列表、特定标签等)
  • 若对话未明确,根据任务类型推断最佳视觉与结构格式
5. Constraints(约束与红线)
  • 列出所有硬边界:长度限制、禁用措辞、强制语气、数据范围
  • 将口语化要求翻译为可执行参数("别太枯燥" -> "保持活泼有力的语气,避免行业术语")
6. Examples(Few-Shot 示例)
  • 提取对话中提及的参考案例、已接受的草稿、模板
  • 若对话缺少示例,根据业务上下文生成一组高质量的 Input/Output 对

扩展十四柱(增强层)

7. Stakeholders(利益相关者与受众)
  • 识别决策者、执行者、受影响方、最终受众
  • 标注各方关注点和潜在冲突
8. Priority & Weight(优先级与权重)
  • 区分 Must-have / Should-have / Could-have
  • 标注各需求的权重和紧迫程度
9. Success Metrics(成功指标与 KPI)
  • 定义可量化的成功标准(转化率、通过率、响应时间等)
  • 标注基线值和目标值
10. Timeline & Milestones(时间线与里程碑)
  • 提取所有 deadline、交付节点、评审时间
  • 标注关键路径和缓冲期
11. Resources & Dependencies(资源与依赖)
  • 列出所需输入、工具、数据源
  • 标注外部依赖和阻塞项
12. Tone & Voice(语气与品牌声音)
  • 定义具体的语言风格:正式/活泼/技术/情感化
  • 标注品牌调性一致要求
13. Domain Knowledge(领域知识与术语表)
  • 提取行业专有名词和缩写
  • 定义必须使用的术语标准
14. Risk & Mitigation(风险与应对)
  • 识别可能出错的风险点
  • 为每个风险标注应对策略
15. Edge Cases(边界与异常处理)
  • 列出特殊情况、极端输入、空值场景
  • 定义 fallback 行为
16. Validation Criteria(验收标准)
  • 定义明确的验收检查清单
  • 标注质量门禁和 Review 流程
17. Iteration & Version(迭代历史与版本)
  • 记录讨论中的版本演进(v1->v2->v3 关键变更)
  • 标注当前版本号和待定项
18. Deliverable Spec(交付物规格)
  • 精确定义交付物格式、文件名、存储位置
  • 标注是否需要多版本交付
19. Compliance & Ethics(合规与伦理)
  • 标注法律合规要求(数据隐私、版权、广告法等)
  • 定义伦理红线
20. Localization & Culture(本地化与文化适配)
  • 标注多语言需求和文化敏感性
  • 定义地区适配要求

高阶六柱(决策与质量层)

21. Anti-Goals / Out of Scope(反目标与排除范围)
  • 明确标注"不要做什么"——比 Constraints 范围更广的战略拒绝
  • 提取讨论中明确排除的方向、被否决的方案、不关注的用户群
  • 防止 LLM 在已被否决的方向上浪费资源
22. Assumptions & Preconditions(假设与前提条件)
  • 列出讨论中默认成立的前提假设(显性和隐性)
  • 区分"已验证的事实"和"基于经验的假设"
  • 标注每个假设的不确定性等级(确定/很可能/猜测)
23. Decision Log(决策记录与推理链)
  • 记录关键决策点:"为什么选 A 不选 B"
  • 提取决策者、决策时间、核心推理逻辑
  • 标注被否决的替代方案及其否决理由
24. Quality Standards(质量标准)
  • 定义"好"的标准——不只是一票通过/不通过的 Validation
  • 包含审美、体验、精确度等非二元维度
  • 与 Success Metrics 互补:Metrics 是量化 KPI,Quality 是定性标准
25. Feedback Mechanism(反馈收集机制)
  • 产出物如何收集反馈:审阅人、审阅渠道、反馈格式
  • 标注迭代触发条件:什么信号意味需要重做
  • 定义反馈闭环的时效要求
26. Data Sources(数据源与可信度)
  • 列出输入数据来源、格式、可信度等级
  • 标注数据的局限性(时效性、样本偏差、覆盖率)
  • 区分"权威数据"和"参考数据",防止 LLM 混用

第五步:质量校验

编译完成后执行以下检查: - 零信息丢失:所有具体数字、deadline、专有名词、功能列表、负面约束 100% 保留 - 去口语化:最终 prompt 中不得出现任何口语俚语、结巴、对话填充词 - 隐含推断:批评反转为正向标准、模糊表述具体化 - 槽口完整性:26 个槽口逐一检查,空槽须标注"对话中未提及,已根据上下文推断" - 可执行性:生成的 prompt 应可直接输入任意 LLM 执行而无歧义

第六步:输出

生成最终 prompt,包裹在单个 Markdown 代码块中,使用以下精确结构:

# 1. Role (角色与人设)
- [精准专家身份]

# 2. Context (背景与意图)
- [业务场景、痛点、触发动因]

# 3. Task (核心指令与流水线)
- [SOP 步骤列表]

# 4. Output Format (输出格式)
- [精确结构要求]

# 5. Constraints (约束与红线)
- [硬边界列表]

# 6. Examples (Few-Shot 示例)
- **Input**: [示例输入]
- **Output**: [示例理想输出]

# 7. Stakeholders (利益相关者与受众)
- [决策者、执行者、受众]

# 8. Priority & Weight (优先级与权重)
- [Must/Should/Could 分级]

# 9. Success Metrics (成功指标与 KPI)
- [可量化标准]

# 10. Timeline & Milestones (时间线与里程碑)
- [关键节点和 deadline]

# 11. Resources & Dependencies (资源与依赖)
- [所需输入和外部依赖]

# 12. Tone & Voice (语气与品牌声音)
- [语言风格和品牌调性]

# 13. Domain Knowledge (领域知识与术语表)
- [专有名词和术语标准]

# 14. Risk & Mitigation (风险与应对)
- [风险点和应对策略]

# 15. Edge Cases (边界与异常处理)
- [特殊情况和 fallback]

# 16. Validation Criteria (验收标准)
- [验收检查清单]

# 17. Iteration & Version (迭代历史与版本)
- [版本演进和当前状态]

# 18. Deliverable Spec (交付物规格)
- [格式、命名、存储]

# 19. Compliance & Ethics (合规与伦理)
- [法律和伦理红线]

# 20. Localization & Culture (本地化与文化适配)
- [多语言和文化要求]

# 21. Anti-Goals / Out of Scope (反目标与排除范围)
- [明确排除的方向和被否决的方案]

# 22. Assumptions & Preconditions (假设与前提条件)
- [默认成立的前提,标注不确定性等级]

# 23. Decision Log (决策记录与推理链)
- [关键决策点、推理逻辑、否决的替代方案]

# 24. Quality Standards (质量标准)
- [定性标准:审美、体验、精确度等非二元维度]

# 25. Feedback Mechanism (反馈收集机制)
- [审阅人、渠道、迭代触发条件、时效要求]

# 26. Data Sources (数据源与可信度)
- [数据来源、格式、可信度等级、局限性]

小葱技能7w4.net有完整的技能分类。

使用方式

输入格式

用户可通过以下方式提供聊天记录: 1. 直接粘贴:将聊天记录文本粘贴到对话中 2. 文件上传:上传 .txt / .md / .json 格式的聊天导出文件 3. 截图:提供聊天截图(通过 OCR 识别) 4. 语音转文字:粘贴语音转文字结果(自动修正错别字)

辅助工具

配套脚本 scripts/distill.py 可用于批量处理聊天记录文件:

python scripts/distill.py input.txt [output.md]

精简模式

当聊天记录较短或场景简单时,可使用 --compact 参数仅输出核心六柱:

python scripts/distill.py input.txt output.md --compact

特殊场景处理

多人会议记录

  • 识别主持人、汇报人、参与者角色
  • 按议题分组而非时间线组织
  • 决策项和待办项单独标注
  • Stakeholders 槽口标注所有参会方的角色与权限

老板批评型对话

  • 将所有批评反转为目标约束
  • "太技术了" -> 约束:"避免工程术语,面向非专业读者"
  • "不够吸引人" -> 约束:"使用情感化语言,增强场景代入感"
  • Risk 槽口标注"未满足老板预期"的风险及应对

多轮迭代型对话

  • 只保留最新版本的反馈
  • 标注版本演进路径(v1->v2->v3 的关键变更点)
  • 最终 prompt 基于最新版本生成
  • Iteration & Version 槽口完整记录演进

跨语言对话

  • 若聊天记录中混合中英文,输出 prompt 的语言跟随用户最终交付目标
  • 专有名词保留原文,不强行翻译
  • Localization 槽口标注多语言需求

参考资源

详细框架指南见 references/26-scheme-guide.md 完整示例库见 references/examples.md 原始规范文档见 references/original-spec.md

🤖 AI 评测

这是一个设计非常专业的 Skill,能将杂乱的聊天记录整理成结构化的 Prompt 蓝图,26 维框架考虑得非常全面。文档清晰易读,有使用示例。缺点是实际文件中部分功能不完整,核心文件与文档描述存在版本差异,可能影响使用体验。总体质量良好,框架设计出色,但完整性有待加强。

📊 多维度评分

适应性4.6
规范性4
有效性4.4
可靠性3.7
可信度4.7

📁 包含文件 (5 个)

📄 SKILL.md 11.5 KB
📄 chat-distill-readme.md 2.7 KB
📄 chat-distill-test_input.txt 580 B
📄 chat-distill-test_input_cn.txt 711 B
📄 聊天记录提纯.md 6.5 KB