一、概念什么是 RAG 管线四件套把原始文档变成可检索知识需要经过四步原始文档 ──①──→ 标准文档 ──②──→ 文档片段 ──③──→ 嵌入向量 ──④──→ 向量索引 Loader Splitter Embedding VectorStore每一步对应一个组件#组件职责输入输出①Document Loader从数据源加载文档文件路径 / URLlist[Document]②Text Splitter把长文档切成小片段list[Document]list[Document]更短③Embedding Model把文本转成向量strlist[float]④Vector Store存储向量并支持搜索文档 向量相似文档列表四步串起来就是 RAG 的离线索引管线。一句话总结四件套是原始文档 → 可检索知识的 ETL 管线——加载、切分、嵌入、存储每一步都有标准抽象。二、价值为什么需要标准化管线1. 数据源千差万别PDF、Word、Markdown、HTML、Notion、Slack、数据库……格式各异。Document Loader 把所有来源统一成Document(page_content, metadata)。2. 长文档必须切分一个 42K 字符的 PDF 超出多数模型的上下文窗口。即使塞进去模型也会注意力涣散。切分让每个片段独立可检索、大小可控。3. 语义搜索需要向量关键词搜索无法理解同义词。退货和退换意思相近但词不同。嵌入向量把语义映射到空间距离近义词自然靠近。4. 向量库是检索的基石有了向量索引才能毫秒级返回与查询最相似的文档片段。不同向量库Chroma、FAISS、Pinecone各有适用场景但接口统一。核心价值四件套把数据接入变成标准化 ETL 管线让你专注业务而非数据格式。三、用法四件套逐一实战① Document Loader加载数据# PDF from langchain_community.document_loaders import PyPDFLoader docs PyPDFLoader(report.pdf).load() # Markdown from langchain_community.document_loaders import UnstructuredMarkdownLoader docs UnstructuredMarkdownLoader(guide.md).load() # 网页 from langchain_community.document_loaders import WebBaseLoader docs WebBaseLoader(https://example.com/faq).load() # 纯文本 from langchain_community.document_loaders import TextLoader docs TextLoader(notes.txt, encodingutf-8).load() # CSV每行一个文档 from langchain_community.document_loaders import CSVLoader docs CSVLoader(data.csv).load()每个 Loader 返回list[Document]Document 有两个核心字段page_content: str — 文本内容metadata: dict — 元数据来源文件名、页码、URL 等② Text Splitter切分文档from langchain_text_splitters import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size1000, # 每个片段最大 1000 字符 chunk_overlap200, # 相邻片段重叠 200 字符 separators[\n\n, \n, 。, , , , ], # 中文友好 add_start_indexTrue, # 记录每个片段在原文的起始位置 ) chunks splitter.split_documents(docs) print(f原文档: {len(docs)} 个, 切分后: {len(chunks)} 个片段)关键参数chunk_size片段上限。太大→噪声多太小→上下文断裂。经验值 500-1500chunk_overlap重叠区。保证片段边界不丢信息。经验值 chunk_size 的 10-20%separators切分优先级。RecursiveCharacterTextSplitter依次尝试每个分隔符直到片段足够小其他 SplitterSplitter适用场景RecursiveCharacterTextSplitter通用文本推荐默认MarkdownHeaderTextSplitter按标题层级切分 MarkdownPythonCodeTextSplitter按函数/类切分 Python 代码TokenTextSplitter按 token 数切分③ Embedding Model文本转向量from langchain_huggingface import HuggingFaceEmbeddings # 推荐多语言 中文优化 embeddings HuggingFaceEmbeddings( modelBAAI/bge-m3, ) # 嵌入单条文本 vector embeddings.embed_query(退货政策) print(f维度: {len(vector)}) # 通常 768 或 1024 # 批量嵌入 vectors embeddings.embed_documents([退货政策, 换货流程])选型指南模型维度特点安装BAAI/bge-m31024多语言中文优秀langchain-huggingfaceBAAI/bge-small-zh-v1.5512中文专用轻量langchain-huggingfacetext-embedding-3-small1536OpenAI需联网langchain-openai国内用户推荐bge-m3中文效果好、离线可用、免费。④ Vector Store存储 搜索from langchain_chroma import Chroma # 创建 索引一次性 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, collection_namemy_docs, persist_directory./chroma_db, # 持久化到磁盘 ) # 后续加载不用重新索引 vectorstore Chroma( collection_namemy_docs, embedding_functionembeddings, persist_directory./chroma_db, ) # 相似度搜索 docs vectorstore.similarity_search(退货政策, k3) # 带分数 docs_with_scores vectorstore.similarity_search_with_score(退货政策, k3) for doc, score in docs_with_scores: print(f分数: {score:.4f} | {doc.page_content[:80]})向量库选型向量库特点适用场景Chroma嵌入式零配置支持持久化开发/小规模部署FAISSFacebook 开源纯内存极快大规模内存检索Pinecone全托管云服务生产环境、免运维Milvus开源分布式支持 GPU超大规模生产QdrantRust 实现性能好中大规模生产完整管线从文件到可检索 Agentfrom langchain_community.document_loaders import PyPDFLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_chroma import Chroma from langchain.tools.retriever import create_retriever_tool from langchain.agents import create_agent # ① 加载 docs PyPDFLoader(company_policy.pdf).load() # ② 切分 chunks RecursiveCharacterTextSplitter( chunk_size1000, chunk_overlap200 ).split_documents(docs) # ③ 嵌入 ④ 存储 embeddings HuggingFaceEmbeddings(modelBAAI/bge-m3) vectorstore Chroma.from_documents(chunks, embeddings, persist_directory./db) # 接入 Agent retriever_tool create_retriever_tool( vectorstore.as_retriever(search_kwargs{k: 3}), namesearch_docs, description搜索公司政策文档, ) agent create_agent(deepseek:deepseek-chat, tools[retriever_tool]) result agent.invoke({ messages: [{role: user, content: 公司年假多少天}] })四、原理管线各步的内部机制1. Document Loader 的统一接口所有 Loader 继承BaseLoader实现load()→list[Document]class BaseLoader: def load(self) - list[Document]: ... def lazy_load(self) - Iterator[Document]: ... # 懒加载省内存大文件用lazy_load()避免一次性加载到内存。2. RecursiveCharacterTextSplitter 的递归策略原文: 第一章\n\n第一节\n\n内容A...\n\n第二节\n\n内容B... ↓ 尝试用 \n\n 切分 [第一章, 第一节\n\n内容A..., 第二节\n\n内容B...] ↓ 某段超过 chunk_size? 继续用 \n 切 ↓ 还超过? 用 。 切 ↓ 还超过? 用 切 ↓ 还超过? 按字符强制切递归保证优先在语义边界切分只在必要时才暴力切断。3. Embedding 的向量空间嵌入模型把文本映射到高维空间768/1024 维语义相近的文本在空间中距离近退货政策 ──→ [0.12, -0.34, 0.56, ...] 退换货流程 ──→ [0.11, -0.33, 0.55, ...] ← 距离很近 天气预报 ──→ [-0.45, 0.78, -0.23, ...] ← 距离很远相似度用余弦距离或欧氏距离计算。搜索时就是找查询向量最近的 K 个文档向量。4. Vector Store 的索引结构向量库用近似最近邻ANN算法加速搜索算法原理特点HNSW层级导航小世界图速度快、精度高内存占用大IVF倒排索引 聚类可控精度适合大规模PQ乘积量化压缩省内存精度略降Chroma 默认用 HNSWFAISS 支持 IVF PQPinecone 用自研索引。5. 管线性能优化瓶颈优化方向嵌入计算慢批量嵌入 GPU 加速搜索不够准调整 chunk_size / 换嵌入模型 / 加元数据过滤结果太相似用 MMR 搜索 / 调大 fetch_k中文效果差换中文优化的嵌入模型bge-m3索引更新频繁增量 add_documents()不全量重建小结视角一句话概念原始文档→可检索知识的 ETL 管线加载→切分→嵌入→存储价值标准化数据接入让你专注业务而非格式用法Loader 统一来源、Splitter 控制粒度、Embedding 选中文模型、VectorStore 选合适引擎原理递归切分保语义边界、向量空间做语义搜索、ANN 算法加速检索记住一件事四件套中切分Splitter对最终检索质量影响最大——切得不好后面嵌入再好、向量库再快也白搭。
RAG管线四件套:从原始文档到可检索知识
一、概念什么是 RAG 管线四件套把原始文档变成可检索知识需要经过四步原始文档 ──①──→ 标准文档 ──②──→ 文档片段 ──③──→ 嵌入向量 ──④──→ 向量索引 Loader Splitter Embedding VectorStore每一步对应一个组件#组件职责输入输出①Document Loader从数据源加载文档文件路径 / URLlist[Document]②Text Splitter把长文档切成小片段list[Document]list[Document]更短③Embedding Model把文本转成向量strlist[float]④Vector Store存储向量并支持搜索文档 向量相似文档列表四步串起来就是 RAG 的离线索引管线。一句话总结四件套是原始文档 → 可检索知识的 ETL 管线——加载、切分、嵌入、存储每一步都有标准抽象。二、价值为什么需要标准化管线1. 数据源千差万别PDF、Word、Markdown、HTML、Notion、Slack、数据库……格式各异。Document Loader 把所有来源统一成Document(page_content, metadata)。2. 长文档必须切分一个 42K 字符的 PDF 超出多数模型的上下文窗口。即使塞进去模型也会注意力涣散。切分让每个片段独立可检索、大小可控。3. 语义搜索需要向量关键词搜索无法理解同义词。退货和退换意思相近但词不同。嵌入向量把语义映射到空间距离近义词自然靠近。4. 向量库是检索的基石有了向量索引才能毫秒级返回与查询最相似的文档片段。不同向量库Chroma、FAISS、Pinecone各有适用场景但接口统一。核心价值四件套把数据接入变成标准化 ETL 管线让你专注业务而非数据格式。三、用法四件套逐一实战① Document Loader加载数据# PDF from langchain_community.document_loaders import PyPDFLoader docs PyPDFLoader(report.pdf).load() # Markdown from langchain_community.document_loaders import UnstructuredMarkdownLoader docs UnstructuredMarkdownLoader(guide.md).load() # 网页 from langchain_community.document_loaders import WebBaseLoader docs WebBaseLoader(https://example.com/faq).load() # 纯文本 from langchain_community.document_loaders import TextLoader docs TextLoader(notes.txt, encodingutf-8).load() # CSV每行一个文档 from langchain_community.document_loaders import CSVLoader docs CSVLoader(data.csv).load()每个 Loader 返回list[Document]Document 有两个核心字段page_content: str — 文本内容metadata: dict — 元数据来源文件名、页码、URL 等② Text Splitter切分文档from langchain_text_splitters import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size1000, # 每个片段最大 1000 字符 chunk_overlap200, # 相邻片段重叠 200 字符 separators[\n\n, \n, 。, , , , ], # 中文友好 add_start_indexTrue, # 记录每个片段在原文的起始位置 ) chunks splitter.split_documents(docs) print(f原文档: {len(docs)} 个, 切分后: {len(chunks)} 个片段)关键参数chunk_size片段上限。太大→噪声多太小→上下文断裂。经验值 500-1500chunk_overlap重叠区。保证片段边界不丢信息。经验值 chunk_size 的 10-20%separators切分优先级。RecursiveCharacterTextSplitter依次尝试每个分隔符直到片段足够小其他 SplitterSplitter适用场景RecursiveCharacterTextSplitter通用文本推荐默认MarkdownHeaderTextSplitter按标题层级切分 MarkdownPythonCodeTextSplitter按函数/类切分 Python 代码TokenTextSplitter按 token 数切分③ Embedding Model文本转向量from langchain_huggingface import HuggingFaceEmbeddings # 推荐多语言 中文优化 embeddings HuggingFaceEmbeddings( modelBAAI/bge-m3, ) # 嵌入单条文本 vector embeddings.embed_query(退货政策) print(f维度: {len(vector)}) # 通常 768 或 1024 # 批量嵌入 vectors embeddings.embed_documents([退货政策, 换货流程])选型指南模型维度特点安装BAAI/bge-m31024多语言中文优秀langchain-huggingfaceBAAI/bge-small-zh-v1.5512中文专用轻量langchain-huggingfacetext-embedding-3-small1536OpenAI需联网langchain-openai国内用户推荐bge-m3中文效果好、离线可用、免费。④ Vector Store存储 搜索from langchain_chroma import Chroma # 创建 索引一次性 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, collection_namemy_docs, persist_directory./chroma_db, # 持久化到磁盘 ) # 后续加载不用重新索引 vectorstore Chroma( collection_namemy_docs, embedding_functionembeddings, persist_directory./chroma_db, ) # 相似度搜索 docs vectorstore.similarity_search(退货政策, k3) # 带分数 docs_with_scores vectorstore.similarity_search_with_score(退货政策, k3) for doc, score in docs_with_scores: print(f分数: {score:.4f} | {doc.page_content[:80]})向量库选型向量库特点适用场景Chroma嵌入式零配置支持持久化开发/小规模部署FAISSFacebook 开源纯内存极快大规模内存检索Pinecone全托管云服务生产环境、免运维Milvus开源分布式支持 GPU超大规模生产QdrantRust 实现性能好中大规模生产完整管线从文件到可检索 Agentfrom langchain_community.document_loaders import PyPDFLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_chroma import Chroma from langchain.tools.retriever import create_retriever_tool from langchain.agents import create_agent # ① 加载 docs PyPDFLoader(company_policy.pdf).load() # ② 切分 chunks RecursiveCharacterTextSplitter( chunk_size1000, chunk_overlap200 ).split_documents(docs) # ③ 嵌入 ④ 存储 embeddings HuggingFaceEmbeddings(modelBAAI/bge-m3) vectorstore Chroma.from_documents(chunks, embeddings, persist_directory./db) # 接入 Agent retriever_tool create_retriever_tool( vectorstore.as_retriever(search_kwargs{k: 3}), namesearch_docs, description搜索公司政策文档, ) agent create_agent(deepseek:deepseek-chat, tools[retriever_tool]) result agent.invoke({ messages: [{role: user, content: 公司年假多少天}] })四、原理管线各步的内部机制1. Document Loader 的统一接口所有 Loader 继承BaseLoader实现load()→list[Document]class BaseLoader: def load(self) - list[Document]: ... def lazy_load(self) - Iterator[Document]: ... # 懒加载省内存大文件用lazy_load()避免一次性加载到内存。2. RecursiveCharacterTextSplitter 的递归策略原文: 第一章\n\n第一节\n\n内容A...\n\n第二节\n\n内容B... ↓ 尝试用 \n\n 切分 [第一章, 第一节\n\n内容A..., 第二节\n\n内容B...] ↓ 某段超过 chunk_size? 继续用 \n 切 ↓ 还超过? 用 。 切 ↓ 还超过? 用 切 ↓ 还超过? 按字符强制切递归保证优先在语义边界切分只在必要时才暴力切断。3. Embedding 的向量空间嵌入模型把文本映射到高维空间768/1024 维语义相近的文本在空间中距离近退货政策 ──→ [0.12, -0.34, 0.56, ...] 退换货流程 ──→ [0.11, -0.33, 0.55, ...] ← 距离很近 天气预报 ──→ [-0.45, 0.78, -0.23, ...] ← 距离很远相似度用余弦距离或欧氏距离计算。搜索时就是找查询向量最近的 K 个文档向量。4. Vector Store 的索引结构向量库用近似最近邻ANN算法加速搜索算法原理特点HNSW层级导航小世界图速度快、精度高内存占用大IVF倒排索引 聚类可控精度适合大规模PQ乘积量化压缩省内存精度略降Chroma 默认用 HNSWFAISS 支持 IVF PQPinecone 用自研索引。5. 管线性能优化瓶颈优化方向嵌入计算慢批量嵌入 GPU 加速搜索不够准调整 chunk_size / 换嵌入模型 / 加元数据过滤结果太相似用 MMR 搜索 / 调大 fetch_k中文效果差换中文优化的嵌入模型bge-m3索引更新频繁增量 add_documents()不全量重建小结视角一句话概念原始文档→可检索知识的 ETL 管线加载→切分→嵌入→存储价值标准化数据接入让你专注业务而非格式用法Loader 统一来源、Splitter 控制粒度、Embedding 选中文模型、VectorStore 选合适引擎原理递归切分保语义边界、向量空间做语义搜索、ANN 算法加速检索记住一件事四件套中切分Splitter对最终检索质量影响最大——切得不好后面嵌入再好、向量库再快也白搭。