首页 / 教程专区 / 用 RAG 给大模型「外接知识库」:原理与上云路径
AI 实践

用 RAG 给大模型「外接知识库」:原理与上云路径

📖 12 分钟阅读 · 更新于 2026-07-10
生成式AIRAG大模型

大模型的知识截止于训练时刻,且不了解你的私有数据,于是会「幻觉」——一本正经地编造事实。RAG(检索增强生成)是目前最实用的解法:先从你的知识库中检索相关文档,再让大模型「带着资料」作答。

RAG 的三步流程

RAG 架构详解

一个完整的 RAG 系统包含以下组件:

组件功能常见选择
文档加载器读取 PDF/Word/HTML 等格式LangChain Loader / 自定义
切分器将长文档切成小块递归字符切分 / 语义切分
嵌入模型文本转向量text-embedding-3 / Gecko / Cohere
向量数据库存储和检索向量Pinecone / Weaviate / pgvector
检索器从向量库找相关文档相似度搜索 + 重排序
大模型基于检索结果生成答案GPT-4o / Claude / Gemini
编排框架串联以上流程LangChain / LlamaIndex

向量数据库选择

三大云 RAG 落地方式对比

对比维度AWS BedrockGCP Vertex AIAzure OpenAI
托管 RAG 方案Knowledge BasesRAG Engine / Vertex AI SearchAzure AI Search + OpenAI
向量数据库OpenSearch Serverless (托管)Vertex AI Vector SearchAzure AI Search (内含向量)
嵌入模型Titan Embeddings / Coheretext-embedding-geckotext-embedding-3 (OpenAI)
支持的 LLMClaude / Llama / MistralGemini / Claude / GemmaGPT-4o / GPT-4 / GPT-3.5
文档源S3GCSBlob Storage / SharePoint
代码量最低(几乎零代码)低(少量配置)中等(需组装组件)
权限管理IAMCloud IAMAzure AD + RBAC
按量计费向量存储 + 检索 + LLM 调用向量 + 检索 + LLM 调用Search 单位 + LLM 调用

各云具体接入步骤

AWS Bedrock Knowledge Bases(最简单):1) 上传文档到 S3;2) 在 Bedrock 控制台创建 Knowledge Base,选择 S3 桶和嵌入模型;3) 自动完成切分、向量化、存储;4) 通过 API 或 Bedrock Agents 调用检索+生成。全程无需写向量数据库代码。

GCP Vertex AI RAG Engine:1) 上传文档到 GCS;2) 创建 RAG Corpus,配置切分和嵌入策略;3) 导入文档自动处理;4) 通过 Vertex AI API 执行检索+生成。也可以用 Vertex AI Search 做更精细的搜索体验。

Azure OpenAI + AI Search:1) 上传文档到 Azure Blob;2) 创建 Azure AI Search 索引,启用向量搜索;3) 使用 Azure OpenAI SDK 的 "chat with your data" 功能;4) 或用 Semantic Kernel 编排更复杂流程。组件较多但灵活性最高。

常见问题排查

💡 RAG 不是越多越好——检索召回的噪声会干扰模型。先把文档切分粒度(建议 500-800 token)和检索 topK(建议 3-5)调好,效果提升往往最明显。

常见问题

Q: RAG 和微调(Fine-tuning)哪个好? RAG 适合需要实时更新知识、引用来源、多文档检索的场景。微调适合需要特定风格、格式或领域术语的场景。两者不冲突——可以先微调让模型更懂你的领域,再用 RAG 补充实时知识。

Q: RAG 的成本高吗? 主要成本在 LLM 调用(每次问答约 $0.01-0.05)和向量存储(每百万向量约 $10-50/月)。嵌入模型调用成本很低(每百万 token 约 $0.02-0.13)。相比微调(训练成本 $100-10000+),RAG 的起步成本极低。

← 返回教程专区 订阅获取更多教程