核心功能 / 知识增强
RAG 知识库与智能检索
LingMo 的知识库模块让 AI 能够深度融合你的本地私有笔记来提供可信回答。该机制能够在提问时先从本地仓库中召回相关的文字片段,再将其作为强背景信息交给 AI 汇总,彻底杜绝了大模型的幻觉现象。
Vector Search 向量检索 (权重 0.7)
doc_chunk = [0.12, -0.45, 0.89...]
BM25 词频检索 (权重 0.1)
TF-IDF score = log(N/df) * tf
Fuzzy 模糊检索 (权重 0.2)
Rust fuzzy-matcher (Rayon)
HYBRID RERANK RESULT
精准召回的笔记片段
双重重排过滤器融合向量语义与词频,提取高价值本地笔记窗口...
向量相似度 (Vector) + 词频命中 (BM25) + 模糊重排 (Hybrid Rerank) 三层智能搜索召回体系
知识输入的基本定理:质量优于数量
知识库检索的召回率与原始笔记的文件结构、标题精细度紧密相关。干净的 Markdown 文件、分明的标题段落以及高信息密度的词汇,其语义检索召回质量显著超越庞大、冗余的草稿堆。
知识库是如何运行的
- 文档解析与流式切块:主动扫描你的工作区文件夹,读取所有合格文本,自动移除噪声,切分成信息内聚的
Chunk段落。 - 高维向量表征 (Embedding):将切块片段送入本地或云端嵌入模型,转化为表示高维语义特征的浮点向量。
- 多路混合检索 (Hybrid Search):用户提问后,系统并行触发三路召回:语义向量相似度匹配、传统 BM25 精确字命中、以及抗错别字的 Rust Fuzzy Matcher。
- 重排过滤器 (Rerank):运用深度重排模型(Reranker)分析多路召回的候选片段,重新评分排序,筛选出排名前五的黄金上下文。
- 情境合成回答 (Synthesis):把整理妥当的片段及来源以强提示词形式塞给 AI 模型,实现真正的“基于事实答复”。
核心检索概念说明
| 概念名称 | 核心机制 | 最擅长召回的目标 |
|---|---|---|
| Embedding 向量表征 | 将任意自然语言编码为密集向量,基于余弦距离度量语义相似度。 | “如何安装”这类的同义词、意图理解、跨语种语义关联。 |
| BM25 词频计算 | 基于词频(TF)和逆文档频率(IDF)打分的概率检索机制。 | 专属名词、特定 API 函数名(如 useLang)、产品型号或时间数字。 |
| Fuzzy Matcher 模糊匹配 | 利用编辑距离和字符间距判定打分的超轻量 Rust 检索器。 | 包含错别字、拼写漏字母、或缩写简称的模糊搜索。 |
| Rerank 混合重排 | 使用交叉编码器(Cross-Encoder)计算查询句与候选句的绝对相关度。 | 在大量粗筛候选片段中,精准挑出语义完全契合的答案切块。 |
知识库管理建议
🟢 强烈推荐进行索引的材料
- 长期归档维护的个人知识百科卡片或 Wiki
- 精简提炼过的技术文档、核心业务说明书、项目汇报
- 经典论文的逐段批注与结构化解读
- 从临时记录中精心整合并打好标签的高价值 Markdown
🔴 不推荐直接投入索引的材料
- 处于剧烈修改中、带有大量 TODO 的草稿笔记,会导致频繁重算索引
- 纯扫描无 OCR 图层的大体积 PDF,语义层无法直接被分词读取
- 完全无标题结构、充斥着无意义碎碎念或长会话记录的文件
- 包含大量敏感密码、私钥等高度敏感文本