AI 系统地图
1. 一句话结论
一个可用的 AI 系统不是单独一个模型,而是由知识和数据、表示与检索、模型推理、上下文编排、工具执行、产品交互以及评估治理共同构成;RAG 和 Agent 分别解决“找到外部知识”和“采取外部行动”的问题。
2. 为什么需要系统地图
日常讨论经常把大语言模型、聊天产品、知识库、Agent 和自动化工作流混为一谈。这会导致两个常见错误:
- 把模型能力当成完整产品能力。
- 遇到任何问题都试图通过更换模型解决。
系统地图的作用,是先确认问题发生在哪一层,再选择相应手段。例如:知识陈旧可能需要 RAG,工具调用失败可能需要权限和状态管理,答案不可验证可能需要引用与评估,而不一定需要更大的模型。
3. 核心概念
| 概念 | 主要作用 | 不等于什么 |
|---|---|---|
| 模型 | 根据输入上下文进行预测、生成、分类或推理 | 完整知识库或业务系统 |
| Token | 模型处理文本时使用的离散单位 | 完整的字或单词语义 |
| 上下文 | 单次推理时提供给模型的信息 | 永久记忆 |
| Embedding | 把内容映射为可比较的数值向量 | 原文或事实本身 |
| 搜索 | 根据查询找到候选内容 | 可靠回答的全部过程 |
| RAG | 检索外部资料并把相关内容提供给生成模型 | 模型训练或自动事实保证 |
| 工具 | 让系统读取或操作外部能力 | 自主决策主体 |
| Agent | 围绕目标选择步骤、调用工具并根据结果继续执行 | 无限制自动化或无需监督 |
| 评估 | 判断系统是否满足任务、质量和安全要求 | 一次主观体验 |
4. 七个系统层次
知识与数据层
包括 Markdown、数据库、PDF、图片、业务系统和外部 API。这里决定系统能够访问什么事实,以及内容是否准确、授权、及时和结构化。
对 CBL 来说,Git 中的 Markdown 是公开知识原件,R2 将来存放较大的附件和原始资源。索引可以重新生成,但原始知识需要长期治理。
表示与索引层
这一层把原始内容转换成适合查找的形式,包括关键词倒排索引、Embedding、向量索引、元数据索引和知识图关系。
Embedding 用于表达语义相似性,但不保留原文的全部细节。向量数据库保存的是检索表示及其元数据,不应被当作唯一内容存储。
模型与推理层
模型接收上下文并产生输出。不同模型在知识、推理、代码、多模态、成本和速度上有不同取舍。
模型参数中包含训练获得的统计知识,但模型不能保证记住最新事实,也不能自动证明输出来自哪个来源。对知识密集任务,外部检索和引用仍然重要。
上下文与编排层
这一层决定模型在每一步看到什么,包括系统规则、用户问题、历史对话、检索片段、工具结果和输出格式。
上下文不是越多越好。无关内容会增加成本,并可能降低模型对关键证据的关注。编排需要控制顺序、长度、优先级和冲突处理。
工具与 Agent 层
工具让系统查询数据库、浏览网页、执行代码、读取文件或调用业务接口。Agent 在目标约束下选择工具和步骤,并根据每次结果调整后续行动。
可靠 Agent 还需要:
- 明确的权限和可操作范围。
- 外部副作用前的确认。
- 状态记录、重试和失败恢复。
- 步数、时间和成本限制。
- 对结果进行验证,而不是只判断工具是否成功返回。
产品与交互层
用户真正接触的是搜索框、问答界面、编辑器、自动化流程或专业工具。产品层需要决定怎样表达不确定性、怎样显示来源、何时让用户确认,以及怎样把结果带回真实工作。
模型质量相近时,良好的任务设计和交互流程往往比增加更多功能更重要。
评估、治理与可观测性层
这一层贯穿整个系统,用于回答:
- 检索是否找到正确材料。
- 回答是否受到材料支持。
- 工具是否完成了真实目标。
- 系统是否泄露或越权访问数据。
- 更新后是否出现质量回退。
- 延迟和成本是否在可接受范围。
没有持续评估,AI 系统只能靠偶然的演示效果判断质量。
5. 三种常见系统形态
直接模型调用
用户问题 → 提示与上下文 → 模型 → 回答
适合写作、改写、分类、摘要和不依赖外部最新事实的任务。结构最简单,但回答主要受模型已有能力和当前输入限制。
RAG 问答
用户问题 → 搜索相关资料 → 组织证据 → 模型 → 带来源回答
适合内部知识、技术文档、产品资料和需要更新来源的问答。它改善知识访问与可追溯性,但检索错误仍会传递给生成阶段。
Agent 工作流
用户目标 → 计划或下一步 → 调用工具 → 检查结果 → 继续或结束
适合需要跨多个步骤读取信息、执行动作和验证结果的任务。Agent 可以在其中使用 RAG,因此二者不是竞争关系。
6. RAG、Agent 与工作流的关系
- RAG 主要扩展模型可访问的知识。
- 工具调用 主要扩展模型能够读取或执行的外部能力。
- Agent 主要管理目标、步骤、工具选择和动态反馈。
- 固定工作流 用预先设计的步骤换取更高的可预测性。
如果任务步骤稳定,固定工作流通常比开放式 Agent 更容易测试。只有当任务确实需要根据中间结果动态调整时,Agent 的复杂性才有价值。
7. CBL 在系统地图中的位置
CBL 可以逐步形成以下结构:
docs/ Markdown ──→ 公开网站
│
├────────→ 关键词搜索
│
└────────→ 切块 / Embedding / 向量检索
↓
用户问题 ──→ 检索与元数据过滤 ──→ 模型 ──→ 带引用回答
未来专业任务 ──→ Agent ──→ CBL 检索 + 计算工具 + 外部数据
建设顺序应是:先有可靠内容,再有搜索,再有 RAG,最后才是能够执行外部动作的 Agent。
8. 系统设计原则
- 先定义真实任务和成功标准,再选择模型和组件。
- 保持原始知识与派生索引分离。
- 把事实来源、模型推断和用户判断明确区分。
- 对公开与私有知识使用独立权限边界。
- 对可造成外部影响的工具使用最小权限和确认机制。
- 为检索、回答和工具执行分别建立评估。
- 优先采用可测试的固定流程,再逐步增加自主性。
9. 常见误区
- “换成更强模型就能解决所有问题”:知识、工具、流程和评估问题不会自动消失。
- “Embedding 就是压缩后的原文”:它是检索表示,不能替代原始内容。
- “接入向量数据库就是完成 RAG”:还缺少切块、过滤、重排、上下文组织、引用和评估。
- “Agent 越自主越先进”:自主性会同时扩大错误、成本和权限风险。
- “模型回答流畅就说明正确”:语言质量与事实可靠性必须分别评估。
10. 与其他主题的关系
11. 参考资料
- Attention Is All You Need,Vaswani 等,2017。Transformer 模型架构的原始论文。
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,Lewis 等,2020。参数化模型与外部非参数记忆结合的代表性工作。
- ReAct: Synergizing Reasoning and Acting in Language Models,Yao 等,2022。模型推理与外部行动交替执行的代表性工作。
- Cloudflare Vectorize: Insert vectors,Cloudflare,访问日期 2026-08-27。用于说明向量、内容引用和元数据的存储关系。
12. 修订记录
- 2026-08-27:建立 AI 应用的层次、组件和常见系统形态。