可进化的分析准则库 (Evolving Tenets Library)
数据分析不仅是一门技术,更是一项涉及业务理解、数据纪律、安全隐私的严谨工作。传统的 Text-to-SQL 助手往往因为缺乏具体的业务指导与合规底线,容易犯下数据编造、指标张冠李戴、PII 泄漏等严重事故。
为此,LakeMind 首创了“可进化的分析准则库”体系。它是一套遵循谷歌开源 OKF (Open Knowledge Format) v0.1 规范 的本地 Markdown 知识包,以“宪法式”分层结构治理,随软件分发,且支持随着您的真实业务教训不断补充与自主演化。
1. 宪法式分层治理架构
准则库物理存储在本地主目录的 ~/.lakemind/tenets/ 目录下(所有工作区共享,属于软件资产)。它采用自上而下的层级治理关系,防止准则之间产生逻辑冲突:
总则 (general-principles) ── 根本原则,最高“宪法”
├─ 数据纪律红线 (data-discipline) ┐ 纪律管真实,安全管合规,
├─ 数据安全准则 (data-security) ┘ 构成跨阶段的不可触碰底线
├─ 阶段分则 (data-profiling / data-metrics / data-cleaning / data-analysis / data-presentation)
└─ 行业与主题准则 (industry/ / topic/) ── 针对具体业务垂直特化1.1 总则 (General Principles)
位于 core/general-principles.md。定义了跨行业普适的六个根本原则:
- 第一条:实事求是 —— 分析的唯一目的是还原事实,而非证明假设或美化指标。
- 第二条:数据为证 —— 结论中的每一个数字都必须有可追溯的查询来源。
- 第三条:归属正确 —— 拒绝“张冠李戴”,数字永远仅对其查询对应的筛选条件与维度生效。
- 第四条:最小假设 —— 不做超出数据范围的盲目因果推断。
- 第五条:先理解后分析 —— 杜绝拿来数据就盲目写 SQL,必须先进行数据画像。
- 第六条:分析可复现 —— 业务口径、清洗步骤必须文档化写入 OKF 知识库以供他人复现。
1.2 横切底线 (Cross-cutting Baselines)
- 数据纪律红线 (
core/data-discipline.md):定义了“绝对禁止编造数字”、“张冠李戴”、“整数截断”等五条不可逾越的红线。 - 数据安全准则 (
core/data-security.md):定义了个人敏感信息 (PII) 识别标准、默认脱敏策略、数据安全分级与未成年人数据高敏特化处理。
1.3 阶段分则 (Phase Playbooks)
将分析流程拆解为五个具体的执行步骤:
- 数据画像 (
core/data-profiling.md):时间范围摸底、空值率与主外键一致性评估、字段类型错配识别。 - 指标体系与口径 (
core/data-metrics.md):定义指标五要素(分子、分母、窗口、单位、去重),防止口径缺失。 - 数据清洗 (
core/data-cleaning.md):脏数据过滤策略、防范多表 JOIN 导致的行数“爆炸”机制。 - 数据分析 (
core/data-analysis.md):假设驱动、多维验证,规避辛普森悖论、幸存者偏差与时间序列滞后效应。 - 数据呈现 (
core/data-presentation.md):图表与表格的抉择心智、数字精度表示、免于双 Y 轴或截断 Y 轴误导。
1.4 垂直业务准则 (Industry & Topic Playbooks)
- 行业准则 (
industry/):例如教育行业大纲 (industry/education/index.md) 与 K12 课外辅导垂直细分准则 (industry/education/k12.md),具体记录了诸如“体验课订单归因错误(3546单99元体验课的归因乌龙)”等真实行业惨痛教训。 - 主题准则 (
topic/):跨行业适用的专项主题,如漏斗与归因转换分析 (topic/conversion.md) 等。
2. 准则的初始化与增量播种 (Seeding)
为了让用户在首次安装软件时就能够“冷启动”获得前人积累的经验,LakeMind 设计了安全的播种机制:
- 首次启动初始化:应用在第一次运行或新建工作区时,会将编译在二进制中的“种子准则库”解压播种到用户的
~/.lakemind/tenets/。 - 尊重用户编辑(从不覆盖):种子写入前会执行
exists检测。如果您对准则内容进行过修改或订正,软件升级时绝不会覆盖您的本地修改,充分保护用户资产。 - 增量播种:当 LakeMind 软件升级并引入了新的行业或阶段准则文件时,系统会仅将新增的 Markdown 种子增量补充到您的目录中。
3. 动态检索与渐进式注入
在对话过程中,Agent 绝对不会傻傻地把成百上千行的全部准则一股脑塞进大模型,这会造成极高的 Token 浪费并干扰模型的注意力。Agent 会采用渐进式披露与动态检索机制:
- 大纲常驻:系统提示词(PREAMBLE)中只内联了最根本的“数据纪律五条红线”以及整体准则大纲。
- 主动检索:当用户提出的任务涉及特定场景时,Agent 会通过专属工具进行按需检索:
search_tenets:当 Agent 遇到不确定或可能存在潜在陷阱的指标/概念时,调用该工具根据关键词对准则库的标签、描述、正文进行检索。load_tenets:支持渐进式披露。不带参数调用可获得整个准则库的树状目录大纲;带标签可批量筛选相关准则;带具体concept_id(如industry/education/k12)可直接精读该条准则并注入上下文。
4. 准则的自主演化 (Evolution)
准则不是一成不变的,它是活的知识。 LakeMind 建立了准则本身的元规则 (core/meta-governance.md),要求所有的准则变更必须遵循规范:
- 基于真实教训,禁止凭空捏造:新增或修改一条准则时,正文末尾必须保留
# Citations块,指明该规则源自哪一次真实的对话纠正或分析 Bug,用真实的 Citadel 案例给 Agent 提供极具说服力的“反面教材”。 - 直接编辑 Markdown 演化:由于准则全部为本地纯 Markdown 文本,您可以直接用自己喜欢的编辑器编辑
~/.lakemind/tenets/下的任何文件(例如,根据你们公司的安全规范直接修改core/data-security.md中的脱敏格式)。Agent 会实时读取并遵照新的准则执行。 - Git 版本保护:准则库目录支持进行 Git 初始化与版本控制,您对准则的每一次修改、定制都可追踪、可回退,甚至可以通过 Git 与团队其他成员协同共享同一套最新的“数据宪法”。

