
人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载本文围绕 gbrain 插件变体 gbrain-coding 中的concept-synthesis技能展开它解决的是个人大脑brain库中最典型的数据多、信息少问题信号检测器、语音笔记、链接摄入等管道每天都会为每个被提及的想法创建一张概念页数月之后库中堆满数千张重复、近似重复、缺乏关联的存根页。读完本文你将掌握该技能的五阶段处理管线——确定性去重合并、打分分层、LLM 综合、聚类成图、可逆策展剔除——以及每个阶段的判定规则、CLI 操作命令、输出页面格式与质量验收标准能够直接把一套从原始概念存根到分层知识图谱的完整流水线复刻到自己的 gbrain 环境中。一、这个技能解决什么问题concept-synthesis概念合成的定位在技能 frontmatter 的description字段中写得非常明确将原始概念存根去重并合成为一张分层知识图谱tiered intellectual mapT1 Canon 到 T4 Riff跨时间、跨来源追踪思想的演化把数千张原始概念页变成一份可被策展的个人智力指纹intellectual fingerprint。技能声明为mutating: true、writes_pages: true写入目录为concepts/见 plugin-variants/gbrain-coding/skills/concept-synthesis/SKILL.md。它针对的核心痛点是 gbrain 生态中多个摄入管道长期运行的必然结果存根泛滥signal-detector文本渠道、voice-note-ingest音频渠道、idea-ingest链接/文章渠道会为每一个被提及的想法创建一张概念页数月后积累出数千张页面其中大量是重复或近似重复时间线碎片化同一条来源被反复抄进多张概念页时间线条目互相重复零综合页面只记录用户在某天提过 X没有任何合成意义上的提炼无分层所有概念平铺没有 Canon / Developing / Speculative / Riff 的层级区分无聚类相关的想法之间没有链接无法形成领域结构。在根技能库 skills/_brain-filing-rules.md 中concepts/目录被明确指定为可复用框架/论点类内容即心智模型的归档位置而 concept-synthesis 正是对这片目录进行治理的核心技能。二、五阶段架构总览该技能把整个治理过程拆成五个阶段前四个阶段只向上合并、从不删除第五阶段才引入可逆的策展剔除curation cullPhase 1: Dedup merge确定性 N 张存根 → 约 N/4 个规范概念 ├── Jaccard 去重标题 首段词重叠 ├── 子串去重founder mode vs founder mode vs manager mode ├── 语义去重LLM 判定这是同一个想法吗 └── 把重复页的时间线与别名合并进规范页 Phase 2: Score tier确定性 启发式 每个规范概念 → 打分并分层 ├── Frequency引用该概念的不同来源数 ├── Timespan首次提及到末次提及的天数 ├── Breadth出现的不同月份数 ├── Engagement概念承载来源的平均互动量如有 └── TierT1 Canon | T2 Developing | T3 Speculative | T4 Riff Phase 3: SynthesizeLLM仅 T1T2 T1 T2 概念 → 富综合 ├── Evolution narrative想法随时间如何锐化 ├── Best articulation互动最高或最精确的引文 ├── Related concepts指向其他概念的交叉链接 ├── Context想法出现/演化时的背景 └── Counter-positions这个想法反对什么 Phase 4: Cluster mapLLM 全部分层概念 → 智力聚类 ├── 把相关概念归入领域LLM 自动命名 ├── 生成聚类摘要页 ├── 构建主 concepts/README.md 完整地图 └── 识别思想谱系概念 A → 演化为概念 B Phase 5: Curation cull评分表 可逆合并 每个概念 → 硬判定ELITE | KEEP | MERGE/REWRITE | DELETE ├── 6 轴评分表实质 2x、包装 1x 最低实质门槛 ├── Grounding 标签VERIFIED / OPINION / NEEDS_SOURCE / UNSAFE ├── 聚类预算 声誉风险门 ├── 带反向链接合并进聚类规范页完全可逆 └── merge_count / independent_sources → 涌现式分层提升三、Phase 1确定性去重与合并第一阶段的目标是把N张存根压到约N/4张规范概念。去重分三层递进Jaccard 去重——基于标题 首段的词重叠度做确定性去重重叠达到阈值即视为重复候选子串去重——处理founder mode与founder mode vs manager mode这类包含关系短标题被长标题吸收语义去重——交给 LLM 回答这两条是否表达同一个想法。判定为重复后把重复页的时间线与别名aliases合并进规范页别名会写进规范页 frontmatter 的aliases字段用于后续检索。从技能路由验证数据 routing-eval.jsonl 可以看到该技能面向的意图正是这类批处理任务dedupe stubs and tier themfold the redundant stubs into canonical heads同时路由测试也明确了一个边界单页删除等一次性操作不应路由到本技能预期技能为null也就是说本技能只处理语料级治理。四、Phase 2打分与分层每个规范概念进入评分管线四个维度共同决定其层级维度含义Frequency引用该概念的不同来源数量Timespan首次提及到末次提及相隔的天数Breadth该概念出现的不同月份数Engagement概念承载来源的平均互动量如有四个层级对应不同的生命周期阶段T1 Canon经典跨年复现的永久智力指纹T2 Developing发展中正在锐化、可能升级为 CanonT3 Speculative推测公开试验中的想法T4 Riff即兴片段单次提及的碎片。分层结果写入概念页 frontmattertier、tier_label。质量门对层级有硬性约束T1 不得少于 4 个月跨度或 6 次提及T4 跨度不得超过 3 个月详见后文质量门一节。分层只写元数据不生成综合内容——综合仅保留给 T1/T2。五、Phase 3T1/T2 的富综合输出格式仅对 T1 与 T2 概念agent 读取时间线与关联来源页通过put_page把综合章节写入概念页。T1 Canon 的完整输出格式如下--- title: concept name type: concept tier: 1 tier_label: Canon mention_count: 18 distinct_months: 8 first_mention: YYYY-MM-DD last_mention: YYYY-MM-DD composite_score: 78.4 aliases: [alternate phrasing 1, alternate phrasing 2] related: [sibling-concept-1, sibling-concept-2] --- # concept name **Tier 1 — Canon** | 18 mentions across 8 months ## Synthesis [2-4 段叙述性文字以第三人称分析视角追溯想法如何演化、 在用户世界观中的含义、为何重要] ## Best Articulation 来自来源的逐字引文——这个想法最精确或互动最高的表达。 — Date ## Evolution | Period | Expression | Signal | |--------|-----------|--------| | YYYY-MM | First articulation | First use — aspiration frame | | YYYY-MM | Sharpening | Anti-pattern emerges | | YYYY-MM | Peak form | Cleanest expression | ## Related Concepts - sibling concept — relationship description - sibling concept — relationship description ## Timeline [含去重条目的完整时间线、引文、来源链接]而 T3/T4 保持存根形态不消耗 LLM 预算做综合--- title: concept name type: concept tier: 4 tier_label: Riff mention_count: 1 --- # concept name **Tier 4 — Riff** | 1 mention Quote from the source — Date综合章节有明确的质量纪律必须呈现演化而非复述、必须用逐字引文而非转述、相关概念用 Markdown 链接非 wiki 链接、严禁编造来源或日期。引文规范细节见 conventions/quality.md——该约定强制要求每条写入大脑页的事实都带[Source: ...]内联引用并规定了引文优先级用户直接陈述 编译真相 时间线原始证据 外部来源。六、Phase 4聚类与概念地图第四阶段把所有已分层概念聚成智力宇宙由 LLM 完成将相关概念归入领域并自动命名为每个聚类生成摘要页构建主地图concepts/README.md识别思想谱系概念 A 演化为概念 B。concepts/README.md的规范结构# Intellectual Universe ## Canon (T1) — N concepts The permanent intellectual fingerprint. Ideas that recur across years. ### [Cluster Name] - concept-slug — one-line characterization - ... ## Developing (T2) — N concepts Sharpening. Might become canon. ## Speculative (T3) — N concepts Testing in public. ## Stats - Total concepts: N - T1 Canon: N - T2 Developing: N - T3 Speculative: N - T4 Riff: N - Earliest source: YYYY-MM-DD - Latest source: YYYY-MM-DD技能的反模式清单特别警告聚类名不许用Various Topics这类泛称——如果无法给聚类命名说明这个聚类不存在。七、调用方式与 CLI 操作该技能本质上是 Markdown agent 指令agent 复用 gbrain 既有操作 LLM 通道执行各阶段。核心命令序列# 1. 列出全部概念页 gbrain query type:concept --limit 10000 --json # 2. Phase 1 去重 —— agent 本地执行 Jaccard 子串去重 # 再由 LLM 通道识别语义重复。 # 3. Phase 2 分层 —— agent 按 frequency / timespan / breadth # 为每个规范概念打分并把层级写入 frontmatter。 # 4. Phase 3 综合 —— 对每个 T1/T2agent 读取时间线 # 关联来源页通过 put_page 把综合章节写到概念页。 # 5. Phase 4 聚类 —— agent 读取分层后的概念清单 # 写出包含完整智力地图的 concepts/README.md。这些命令对应 gbrain CLI 的实际能力gbrain query负责结构化检索gbrain search负责混合检索RRF 融合打分见 src/commands/search.tsgbrain get / put / delete负责页面读写与软删除gbrain history / revert负责版本历史与回滚。技能文档还特别强调一点不要对合并候选硬编码相似度阈值——gbrain search返回的是混合RRF 融合分数而非原始余弦相似度任何写死的数字都会随语料与搜索模式变化而失效。八、Phase 5策展剔除Curation Cull——本技能的核心新增Phase 1–4 只向上合并、从不删除数月后语料里会堆积空洞存根稀释真正有价值的复利概念的问题。Phase 5 就是剔除通道为每个概念给出硬判定ELITE | KEEP | MERGE/REWRITE | DELETE按节奏或按需运行且每一步破坏性操作都可逆。约定执行前必须阅读 conventions/test-before-bulk.md——先剔除 3–5 个聚类读取真实输出确认无误后才跑全量。8.1 核心之问如果用户两年后冷不丁翻出这个概念它是能锐化一个想法、种下一颗新种子还是会被当作填充物直接划走划走 DELETE。8.2 六轴评分表每轴 1–5 分三个实质轴权重2x三个包装/契合轴权重1x。实质承载概念包装为其赢得曝光面积。SUBSTANCE2x 权重轴135Insight tension洞察与张力——承载真正的智力负荷一个机制、一个非显而易见的因果链、一个反转、一个隐藏成本陈词滥调创业很难熟悉想法带一个具体角度一个可复用的具名机制Originality surprise原创与惊喜——颠覆预期的崭新框架而非谁都能写的套话心灵鸡汤自律胜过动力透过用户视角的已知想法感觉新造且可移植的框架Specificity completeness具体与完整——自洽的主张/机制/区分带具体细节而非缺上下文的碎片含糊或残缺完整但泛泛具体、有据、完全自足PACKAGING FIT1x 权重轴135Voltage wit电压与机锋——语言中的电荷急转、压缩、一句落地的话平淡 / 教科书式干净可引用、有弹性Representative代表性——像用户说的话或与用户记录在案的世界观相连任何账号都写得出来与用户视角兼容无疑是用户本人的指纹Powerful legible有力且可读——可用的弹药文章小节、演讲台词、会议框架同时能传递用户是谁惰性琐事稍加打磨可用可直接部署 让别人更理解用户8.3 评分 → 判定加权分 (Insight Originality Specificity) × 2 (Voltage Representative Powerful) × 1。满分45换算为百分比。加权百分比判定必须同时成立的门槛≥85%ELITE— 保留并标记可复用无任何轴 3至少 2 个 5 分且至少一个在 SUBSTANCE 轴上75-84%KEEP(Insight ≥4 或 Originality ≥4) 且 Specificity ≥3 且 (Representative ≥3 或 Powerful ≥4)55-74%MERGE/REWRITE 或弱保留想法好但躯干差 → 并入聚类规范页或重写为独立页。仅当来源罕见或填补覆盖空白时按原样保留否则 DELETE55%DELETE—最低实质门槛覆盖百分比若 Insight 3 或 Originality 3概念永远不能被判定为 KEEP 或 ELITE。风格不能为空洞想法买单。MERGE/REWRITE 是真实的第三判定不是逃避选项。许多存根里困着一个有生命力的想法只是躯干孱弱——应并入聚类规范页或重写为独立页。使用时机Insight ≥ 3 但 Specificity 或 Voltage 拖低总分时。8.4 硬删除触发器任一命中即删除不看分数心灵鸡汤式复述——正确但没有一句是贺卡不会写的套话、无机制。碎片——依赖不可获取的上下文无法自足除非来源罕见且即便如此也须可理解、有用。扭曲的提取——转录乱码、思路中断、语无伦次或伪装成概念的块头chunk header。偏离使命的琐事——准确但用户不会去构建、相信或使用的东西。聚类内重复——未通过 8.7 节操作重复测试。无依据的事实断言——错误或未注明来源却以事实口吻陈述的事实/历史/因果断言见 grounding 标签软化或删除。8.5 Grounding 标签仅事实类概念——打标签而非单纯罚分任何事实、历史、科学或因果断言都要经过真值检查并在 frontmatter 中写入grounding:标签VERIFIED— 准确且有来源 → 可保留并部署OPINION— 明确表述为用户观点或论证 → 可保留NEEDS_SOURCE— 看似合理但以事实口吻出现且无来源 → 仅当改写为观点/主张后保留UNSAFE— 错误或很抓眼球但其实是错的 → 删除或软化。技能文档的告诫值得原文保留不要存储自信的错误——一旦被部署它们只会让用户更不被理解而不是更被理解。引用规范遵循 conventions/quality.md。8.6 声誉风险门一个概念如果抓眼球但可能歪曲用户本人——让用户听起来残忍、轻视他人、或持有其实并不持有的立场——那它是负债而非弹药。即使电压得分再高也要标记重写或删除。Powerful 的意思是使用时不招致反噬。8.7 聚类预算大规模平庸问题当大量概念来自同一来源或共享同一想法时要评估的是集合而非单个概念。每个语义聚类的默认预算1 个规范概念该机制最锐利的表述——始终保留1–2 个仅当每个都新增一个不同的机制、具体例子、不同情绪基调、新受众或用户独有的措辞超过 3 个仅当与活跃项目绑定。其余一律 MERGE优先见 8.9或 DELETE。同一主题下四十条近乎相同的存根 → 一条规范机制概念也许再加一句好句子其余全部合并。8.8 操作重复测试不要目测重叠百分比。把候选概念与聚类内最佳现有概念对比回答它是否新增了机制、例子、情绪基调、受众或用户专属措辞没有 → MERGE并保留信号或 DELETE。有 → 它新增的东西正是保留它的理由。8.9 带反向链接的合并Merge-with-Backlinks可逆——什么都不销毁对冗余聚类剔除是倒置的不要删除尾巴——把它合并进规范头让合并台账变成显著性度量。一个想法被独立推导 N 次不是膨胀而是语料在 N 种不同语境下标记这很重要。删除重复会扔掉这个信号合并则捕获它。每次合并会在规范页上增加三个 frontmatter 字段和一个正文章节merge_countint——吸收的页面原始数量含同源重复提取independent_sourcesint——聚类来源的不同来源数。这才是真正的显著性度量——原始 merge_count 在单一来源被反复提取时会虚高independent_sources 就是修正backlinks{source, angle, date}列表——每张被吸收页的来源及其带来的具体角度。所有框架都保留下来只是不再作为独立顶层页存在## Facets正文——规范机制放最上然后每张被吸收页一行as seen in {source}: {angle}。概念变成多角度的而非冗余的。合并质量门拒绝不完整合并仅当 (a)## Facets章节为每张被吸收页提供一行来源 具体角度且 (b) 每个backlinks条目都含 source angle date 时合并才被写入。空 Facets 或悬空条目 拒绝合并并标记该聚类人工审查。不允许半合并。区分度守卫是硬否决不是建议。两条看起来像重复的概念除非 LLM 裁判肯定地确认它们陈述的是同一个机制否则不合并。默认是不合并裁判必须挣来这个合并且其 yes/no 与理由要按聚类记录。不同机制/例子/基调 → 各自独立成规范页。相似性负责提议判断力负责裁决。寻找合并候选——定性区间而非数值截止线。不要硬编码相似度阈值gbrain search返回混合RRF 融合分数而非原始余弦相似度任何钉死的数字都会随语料和搜索模式变化而失效。做法是定性地搜用每个概念的标题 首段搜索当两个概念在结果列表顶部互现、且与其余结果存在可见分差时才把另一个概念当作合并候选。共享词汇但不共享机制的概念会落在列表中部——这正是区分度守卫大显身手的区间。全量处理前先在自己的语料分布上做校准。8.10 合并机制渐进式、完全可逆# 0. 盘点被剔除的分层 gbrain query type:concept --limit 10000 --json # 1. 探测合并候选双向顶部命中 gbrain search concept title first paragraph --limit 10 # 2. 在触碰被吸收页之前先原样归档到 _merged/ 下 # 并在其 frontmatter 加 merged_into: canonical-slug。 # _merged/ 树就是撤销按钮。 gbrain get concepts/absorbed-stub gbrain put concepts/_merged/cluster-name/absorbed-stub # 3. 生长规范头merge_count、independent_sources、 # backlinks以及 ## Facets 章节 gbrain put concepts/canonical-slug # 4. 软删除被吸收的原页在清除前可恢复 gbrain delete concepts/absorbed-stub # 撤销路径gbrain restore slug清除窗口内、 # _merged/ 副本清除后仍存活、以及逐页版本历史 gbrain history concepts/canonical-slug gbrain revert concepts/canonical-slug version_id分步提交。剔除期间不硬删除任何内容_merged/树 软删除 页面历史让每一步都可逆。8.11 合并台账 → 涌现式分层提升把independent_sources喂回 Phase 2 的 Frequency 轴。当规范概念的independent_sources越过语料直方图中的自然间隙——看分布不要硬编码整数——它就成为分层提升候选T4→T3、T3→T2、T2→T1 评审。无规模上限一个持续吸收合并的概念理应长胖。分层边界因此是涌现的而非手工划定的——语料在告诉你一个反复出现的想法已经挣得了自己的层级。九、质量门去重质量不允许两张概念页是换了个说法的同一个想法别名保存在 frontmatter 中供检索运行gbrain query type:concept抽查数量下降情况。分层质量T1 应让人感觉对这就是我反复使用的框架之一——可辨识、复现、锐利T2 应让人感觉我正在打磨这个它越来越清晰任何概念不得在跨度 4 个月或提及 6 次时被标为 T1任何概念不得在跨度 3 个月时停留在 T4。综合质量呈现演化而非复述使用逐字引文而非转述链接相关概念Markdown 链接非 wiki 链接不编造来源或日期。剔除质量不得删除持有聚类内唯一机制表述的概念——规范概念挺过每一次剔除每次合并都通过合并质量门填充完整的## Facets 完整的backlinks条目无半合并区分度守卫裁决按聚类记录任何合并写入前裁判都明确说了是不得以事实口吻保留任何标记 UNSAFE 的主张每张被吸收页在原件软删除前都有一份逐字_merged/副本。十、Cron 集成这是重活应按节奏运行而非每个信号都触发在大型摄入批次完成后signal-detector 爆发、archive-crawler 运行等每周 cron 做新增晋级 T1/T2 概念的增量综合语料发生重大偏移时手动触发完整再综合Phase 5 剔除比综合更少运行——每月一次或在大规模摄入波明显推高存根数之后。始终先 test-before-bulk。十一、反模式清单以下是技能明确列出的反模式逐条规避即可避免最常见的事故对 T3/T4 跑综合——把 API 预算浪费在可能永远不会锐化的想法上编造引文或日期——时间线必须能对照既有大脑页验证泛化聚类名Various Topics——无法命名的聚类不是真聚类在无新来源材料的情况下重复综合已综合过的 T1——尊重幂等性对合并候选硬编码数值相似度截止线——搜索分数是语料与模式相对的用定性区间让区分度守卫裁决仅凭相似度合并——共享词汇不等于共享机制区分度守卫是硬否决而非建议删除冗余概念而非向上合并——删除会扔掉驱动分层提升的频率信号因为措辞漂亮就保留空洞概念——最低实质门槛正是为此而设剔除期间硬删除——归档到_merged/ 软删除让每条撤销路径存活不做 3–5 个聚类抽查就全量剔除conventions/test-before-bulk.md。test-before-bulk约定还给出了渐进式批量协议10 → 100 → 500 → 全量并要求每轮都做 count-before/count-after 核对、抽查输出、错误率 2%且优先使用 gbrain 原生机制--pace、--progress-json、--dry-run而不是手写 shell 循环——这些同样适用于 Phase 5 的批量剔除。十二、相关技能与契约concept-synthesis是摄入管道的下游治理者上游是三个产生原始存根的技能signal-detector——从文本渠道产生原始概念存根voice-note-ingest——从音频渠道产生原始概念存根idea-ingest——从链接/文章产生原始概念存根。技能契约Contract保证路由匹配 frontmatter 中的规范触发器输出写入writes_to:声明的目录遵循所引用的约定quality.md、_brain-filing-rules.md等保留隐私契约——不含真实姓名、不含 fork 专用文件系统路径、不含上游 fork 引用。技能的输出格式与契约声明都有对应的结构一致性测试见test/skills-conformance.test.ts路由行为则由 routing-eval.jsonl 中的正负例持续验证。结语concept-synthesis的价值在于把积累升级为复利前四阶段用确定性算法 LLM 把存根去重、分层、综合、聚类成可检索的知识图谱第五阶段用一套可操作的评分表与可逆合并机制对语料做策展让重复出现本身成为显著性信号而非垃圾。如果你正被个人知识库中的存根淹没这套五阶段管线——尤其是independent_sources驱动的涌现式分层提升与_merged/归档的完全可逆剔除——是值得直接落地实践的完整方案。赞分享人工智能RAGAgent 记忆MCP 服务知识管理【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址https://gitcode.com/gh_mirrors/gb/gbrain点击查看免费下载相关推荐CocoIndex 实战把 Markdown 文档目录增量构建成 Neo4j 概念知识图谱CocoIndex 实战把 Markdown 文档目录增量构建成 Neo4j 概念知识图谱 本文以 CocoIndex 仓库中的 docs_to_knowle人工智能大模型RAGAI AgentAgent 记忆数据工程流处理CocoIndex 实战用 LLM 把 Markdown 文档增量构建成 Neo4j 概念知识图谱CocoIndex 实战用 LLM 把 Markdown 文档增量构建成 Neo4j 概念知识图谱 文档是伪装成文件列表的概念之网——每一页都在断言概念间人工智能大模型RAGAI AgentAgent 记忆数据工程流处理Understand-Anything Go 语言提示片段实战从 Goroutine 概念清单到知识图谱分层注入Understand Anything Go 语言提示片段实战从 Goroutine 概念清单到知识图谱分层注入 本篇围绕 go.md https://linAI 技能AI 插件开发工具知识图谱创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考