知识库

核心功能 / 知识增强

RAG 知识库与智能检索

LingMo 的知识库模块让 AI 能够深度融合你的本地私有笔记来提供可信回答。该机制能够在提问时先从本地仓库中召回相关的文字片段,再将其作为强背景信息交给 AI 汇总,彻底杜绝了大模型的幻觉现象。

Vector Search 向量检索 (权重 0.7)
doc_chunk = [0.12, -0.45, 0.89...]
BM25 词频检索 (权重 0.1)
TF-IDF score = log(N/df) * tf
Fuzzy 模糊检索 (权重 0.2)
Rust fuzzy-matcher (Rayon)
HYBRID RERANK RESULT
精准召回的笔记片段

双重重排过滤器融合向量语义与词频,提取高价值本地笔记窗口...

向量相似度 (Vector) + 词频命中 (BM25) + 模糊重排 (Hybrid Rerank) 三层智能搜索召回体系

知识输入的基本定理:质量优于数量

知识库检索的召回率与原始笔记的文件结构、标题精细度紧密相关。干净的 Markdown 文件、分明的标题段落以及高信息密度的词汇,其语义检索召回质量显著超越庞大、冗余的草稿堆。

知识库是如何运行的

  1. 文档解析与流式切块:主动扫描你的工作区文件夹,读取所有合格文本,自动移除噪声,切分成信息内聚的 Chunk 段落。
  2. 高维向量表征 (Embedding):将切块片段送入本地或云端嵌入模型,转化为表示高维语义特征的浮点向量。
  3. 多路混合检索 (Hybrid Search):用户提问后,系统并行触发三路召回:语义向量相似度匹配、传统 BM25 精确字命中、以及抗错别字的 Rust Fuzzy Matcher。
  4. 重排过滤器 (Rerank):运用深度重排模型(Reranker)分析多路召回的候选片段,重新评分排序,筛选出排名前五的黄金上下文。
  5. 情境合成回答 (Synthesis):把整理妥当的片段及来源以强提示词形式塞给 AI 模型,实现真正的“基于事实答复”。

核心检索概念说明

概念名称核心机制最擅长召回的目标
Embedding 向量表征将任意自然语言编码为密集向量,基于余弦距离度量语义相似度。“如何安装”这类的同义词、意图理解、跨语种语义关联。
BM25 词频计算基于词频(TF)和逆文档频率(IDF)打分的概率检索机制。专属名词、特定 API 函数名(如 useLang)、产品型号或时间数字。
Fuzzy Matcher 模糊匹配利用编辑距离和字符间距判定打分的超轻量 Rust 检索器。包含错别字、拼写漏字母、或缩写简称的模糊搜索。
Rerank 混合重排使用交叉编码器(Cross-Encoder)计算查询句与候选句的绝对相关度。在大量粗筛候选片段中,精准挑出语义完全契合的答案切块。

知识库管理建议

🟢 强烈推荐进行索引的材料

  • 长期归档维护的个人知识百科卡片或 Wiki
  • 精简提炼过的技术文档、核心业务说明书、项目汇报
  • 经典论文的逐段批注与结构化解读
  • 从临时记录中精心整合并打好标签的高价值 Markdown

🔴 不推荐直接投入索引的材料

  • 处于剧烈修改中、带有大量 TODO 的草稿笔记,会导致频繁重算索引
  • 纯扫描无 OCR 图层的大体积 PDF,语义层无法直接被分词读取
  • 完全无标题结构、充斥着无意义碎碎念或长会话记录的文件
  • 包含大量敏感密码、私钥等高度敏感文本