跳到主要内容

AI 系统地图

1. 一句话结论

一个可用的 AI 系统不是单独一个模型,而是由知识和数据、表示与检索、模型推理、上下文编排、工具执行、产品交互以及评估治理共同构成;RAG 和 Agent 分别解决“找到外部知识”和“采取外部行动”的问题。

2. 为什么需要系统地图

日常讨论经常把大语言模型、聊天产品、知识库、Agent 和自动化工作流混为一谈。这会导致两个常见错误:

  • 把模型能力当成完整产品能力。
  • 遇到任何问题都试图通过更换模型解决。

系统地图的作用,是先确认问题发生在哪一层,再选择相应手段。例如:知识陈旧可能需要 RAG,工具调用失败可能需要权限和状态管理,答案不可验证可能需要引用与评估,而不一定需要更大的模型。

3. 核心概念

概念主要作用不等于什么
模型根据输入上下文进行预测、生成、分类或推理完整知识库或业务系统
Token模型处理文本时使用的离散单位完整的字或单词语义
上下文单次推理时提供给模型的信息永久记忆
Embedding把内容映射为可比较的数值向量原文或事实本身
搜索根据查询找到候选内容可靠回答的全部过程
RAG检索外部资料并把相关内容提供给生成模型模型训练或自动事实保证
工具让系统读取或操作外部能力自主决策主体
Agent围绕目标选择步骤、调用工具并根据结果继续执行无限制自动化或无需监督
评估判断系统是否满足任务、质量和安全要求一次主观体验

4. 七个系统层次

知识与数据层

包括 Markdown、数据库、PDF、图片、业务系统和外部 API。这里决定系统能够访问什么事实,以及内容是否准确、授权、及时和结构化。

对 CBL 来说,Git 中的 Markdown 是公开知识原件,R2 将来存放较大的附件和原始资源。索引可以重新生成,但原始知识需要长期治理。

表示与索引层

这一层把原始内容转换成适合查找的形式,包括关键词倒排索引、Embedding、向量索引、元数据索引和知识图关系。

Embedding 用于表达语义相似性,但不保留原文的全部细节。向量数据库保存的是检索表示及其元数据,不应被当作唯一内容存储。

模型与推理层

模型接收上下文并产生输出。不同模型在知识、推理、代码、多模态、成本和速度上有不同取舍。

模型参数中包含训练获得的统计知识,但模型不能保证记住最新事实,也不能自动证明输出来自哪个来源。对知识密集任务,外部检索和引用仍然重要。

上下文与编排层

这一层决定模型在每一步看到什么,包括系统规则、用户问题、历史对话、检索片段、工具结果和输出格式。

上下文不是越多越好。无关内容会增加成本,并可能降低模型对关键证据的关注。编排需要控制顺序、长度、优先级和冲突处理。

工具与 Agent 层

工具让系统查询数据库、浏览网页、执行代码、读取文件或调用业务接口。Agent 在目标约束下选择工具和步骤,并根据每次结果调整后续行动。

可靠 Agent 还需要:

  • 明确的权限和可操作范围。
  • 外部副作用前的确认。
  • 状态记录、重试和失败恢复。
  • 步数、时间和成本限制。
  • 对结果进行验证,而不是只判断工具是否成功返回。

产品与交互层

用户真正接触的是搜索框、问答界面、编辑器、自动化流程或专业工具。产品层需要决定怎样表达不确定性、怎样显示来源、何时让用户确认,以及怎样把结果带回真实工作。

模型质量相近时,良好的任务设计和交互流程往往比增加更多功能更重要。

评估、治理与可观测性层

这一层贯穿整个系统,用于回答:

  • 检索是否找到正确材料。
  • 回答是否受到材料支持。
  • 工具是否完成了真实目标。
  • 系统是否泄露或越权访问数据。
  • 更新后是否出现质量回退。
  • 延迟和成本是否在可接受范围。

没有持续评估,AI 系统只能靠偶然的演示效果判断质量。

5. 三种常见系统形态

直接模型调用

用户问题 → 提示与上下文 → 模型 → 回答

适合写作、改写、分类、摘要和不依赖外部最新事实的任务。结构最简单,但回答主要受模型已有能力和当前输入限制。

RAG 问答

用户问题 → 搜索相关资料 → 组织证据 → 模型 → 带来源回答

适合内部知识、技术文档、产品资料和需要更新来源的问答。它改善知识访问与可追溯性,但检索错误仍会传递给生成阶段。

Agent 工作流

用户目标 → 计划或下一步 → 调用工具 → 检查结果 → 继续或结束

适合需要跨多个步骤读取信息、执行动作和验证结果的任务。Agent 可以在其中使用 RAG,因此二者不是竞争关系。

6. RAG、Agent 与工作流的关系

  • RAG 主要扩展模型可访问的知识。
  • 工具调用 主要扩展模型能够读取或执行的外部能力。
  • Agent 主要管理目标、步骤、工具选择和动态反馈。
  • 固定工作流 用预先设计的步骤换取更高的可预测性。

如果任务步骤稳定,固定工作流通常比开放式 Agent 更容易测试。只有当任务确实需要根据中间结果动态调整时,Agent 的复杂性才有价值。

7. CBL 在系统地图中的位置

CBL 可以逐步形成以下结构:

docs/ Markdown ──→ 公开网站

├────────→ 关键词搜索

└────────→ 切块 / Embedding / 向量检索

用户问题 ──→ 检索与元数据过滤 ──→ 模型 ──→ 带引用回答

未来专业任务 ──→ Agent ──→ CBL 检索 + 计算工具 + 外部数据

建设顺序应是:先有可靠内容,再有搜索,再有 RAG,最后才是能够执行外部动作的 Agent。

8. 系统设计原则

  • 先定义真实任务和成功标准,再选择模型和组件。
  • 保持原始知识与派生索引分离。
  • 把事实来源、模型推断和用户判断明确区分。
  • 对公开与私有知识使用独立权限边界。
  • 对可造成外部影响的工具使用最小权限和确认机制。
  • 为检索、回答和工具执行分别建立评估。
  • 优先采用可测试的固定流程,再逐步增加自主性。

9. 常见误区

  • “换成更强模型就能解决所有问题”:知识、工具、流程和评估问题不会自动消失。
  • “Embedding 就是压缩后的原文”:它是检索表示,不能替代原始内容。
  • “接入向量数据库就是完成 RAG”:还缺少切块、过滤、重排、上下文组织、引用和评估。
  • “Agent 越自主越先进”:自主性会同时扩大错误、成本和权限风险。
  • “模型回答流畅就说明正确”:语言质量与事实可靠性必须分别评估。

10. 与其他主题的关系

11. 参考资料

  1. Attention Is All You Need,Vaswani 等,2017。Transformer 模型架构的原始论文。
  2. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,Lewis 等,2020。参数化模型与外部非参数记忆结合的代表性工作。
  3. ReAct: Synergizing Reasoning and Acting in Language Models,Yao 等,2022。模型推理与外部行动交替执行的代表性工作。
  4. Cloudflare Vectorize: Insert vectors,Cloudflare,访问日期 2026-08-27。用于说明向量、内容引用和元数据的存储关系。

12. 修订记录

  • 2026-08-27:建立 AI 应用的层次、组件和常见系统形态。