微调是把模型的底子换成你的领域语料但 90% 的业务场景你不需要微调。你只需要让模型在回答的时候去翻你公司内部的文档、产品手册、客服记录——这叫 RAGRetrieval-Augmented Generation检索增强生成。RAG 是 2024-2026 年所有 AI 应用项目的事实默认方案。OpenAI 的 GPTs、Anthropic 的 Projects、阿里云百炼、智谱的「知识库」——背后全是 RAG。但 90% 的 RAG 项目困在「检索」这一步而不是生成。这篇文章会跟你说三样东西一条能照着走的 RAG 路径——从 0 到能上线的最小可用版本一份实操最小代码清单——5 个文件就能跑通一次一张避坑表——按卡死严重度排序的 7 个常见坑先把RAG拆开RAG 检索 增强 生成三个动作。检索Retrieval用户问一个问题系统先去你的文档库里找相关的几段文本。增强Augmented把这几段文本塞进 prompt 里作为模型的参考资料。生成Generation模型基于这些参考资料输出最终答案。看起来就 3 步。但每一步都有坑。90% 的项目在这 3 步里踩到至少 1 个坑最终答案质量就崩了。把这 3 步归拢到用什么技术步骤技术选型国内推荐检索向量检索 / 关键词检索 / 混合检索Milvus / 阿里云 DashVector / 腾讯云 VectorDB增强prompt 组装、rerank阿里云通用 rerank、bge-reranker生成LLM 调用GLM-5 / Qwen / DeepSeek / Kimi ……RAG 之前先做一次诚实的盘点动手之前先做一次诚实的盘点。这一步能省掉 80% 的人至少一周时间。1.1 你的数据是什么形态数据形态决定切分策略。数据形态该用什么切分为什么几百页 PDF 产品手册按章节切每段600-800字左右章节天然有边界几千条客服对话一问一答切每段 200-400 字单轮对话是独立知识单元几万条 SQL 文档按表结构切每段 1 张表结构化文档按 schema 切100 篇技术博客按段落切每段 400-600 字长文按主题段切Markdown 文档树按标题层级切markdown 标题是天然切点很多RAG 项目一开始就「切错」。切太粗检索出来的段落太长模型抓不住重点。切太细检索出来的段落太碎模型看不到上下文。切错位置把一句话从中间切开模型读到一半不知道在讲什么。1.2 你的查询是哪种不同查询需要不同的检索策略。查询类型该用什么例子事实型FAQ关键词检索 向量检索“你们的退款政策是什么”概念型解释向量检索为主“什么是 QLoRA”比较型向量检索 rerank“A 和 B 哪个更适合我”多步推理型RAG Agent“基于这份合同帮我算下到期金额”实时型RAG 搜索 API“今天的新闻头条”查询类型决定后续是否需要 Agent 编排。简单 FAQ 用单轮 RAG 就能解决多步推理需要把 RAG 接进 Agent 循环里。1.3 你的容忍度是多少容忍度方案成本能接受 70% 准确率、偶尔答错纯向量检索 LLM几百到几千元必须 90% 准确率混合检索 rerank 答案验证几千元到几万元必须 99% 准确率金融/医疗RAG 微调 规则兜底 人工审核几十万到几百万RAG 不是万能的。RAG 能解决知识截止、“知识错误”、“幻觉”但解决不了逻辑混乱、“胡说八道”。配合答案验证、人工兜底才能真正落地。2. 工具链近 2 年事实上的标准2.1 LangChain干什么LLM 应用最主流的开发框架核心组件DocumentLoader/TextSplitter/Embedding/VectorStore/Retriever/Chain优势组件全、社区大、文档多劣势抽象层太厚性能调优不直观2.2 LlamaIndex干什么专门做 RAG 的框架比 LangChain 更聚焦核心组件SimpleDirectoryReader/NodeParser/VectorStoreIndex/QueryEngine优势RAG 场景设计更合理索引策略丰富劣势通用 Agent 能力不如 LangChain2.3 向量数据库国内选择Milvus开源自部署Qdrant开源自部署阿里云 DashVector云服务按量付费腾讯云 VectorDB云服务按量付费Chroma适合小规模 Demo怎么选100 万条以内用 Chroma100 万-1 亿条用 Milvus/Qdrant上亿条用云服务2.4 Embedding 模型干什么把文本变成向量数字序列国内选择bge-large-zh-v1.5智源中文最强开源 embeddingtext2vec-base-chinese哈工大M3E开源中文场景表现优秀怎么选中文场景默认 bge-large-zh英文用 OpenAI text-embedding-34 个工具的分工图 1 · 按项目规模选Demo / 生产级 RAG / 云服务一站式简单 RAG Demo →LangChain Chroma bge GLM-5生产级 RAG →LlamaIndex Milvus bge Qwen3.5云服务一站式 →阿里云百炼DashVector bge 通义一站式实操跑通你的第一个 RAG我把打开电脑到跑通第一次 RAG切成 7 步。langchain下每一步都给最小可执行代码。第 1 步环境# 推荐环境Python 3.10 conda create -n rag python3.10 -y conda activate rag pip install langchain langchain-community chromadb sentence-transformers zhipuai第 2 步准备数据# 把你的文档放进 ./docs 文件夹 # 支持 pdf / txt / md / docx from langchain_community.document_loaders import DirectoryLoader loader DirectoryLoader(./docs, glob**/*.md, show_progressTrue) docs loader.load() print(f加载 {len(docs)} 个文档)这一步是大部分人踩坑的开始。3 个常见踩坑坑 1PDF 加载出来是乱码 → 装pymupdf或pdfplumber坑 2表格被破坏 → 用专门的 table extractor坑 3扫描版 PDF 没文字 → 先 OCR第 3 步切分文档from langchain.text_splitter import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size500, # 每段最大 500 字符 chunk_overlap50, # 段间重叠 50 字符保留上下文 separators[ , , 。, , ], # 中文友好切分符 ) chunks splitter.split_documents(docs) print(f切分成 {len(chunks)} 个段落)3 个关键参数chunk_size根据你的数据形态选。FAQ 200-400产品手册 800-1200技术文档 500-800chunk_overlap10%-20% 的 chunk_size。太小上下文断裂太大检索冗余separators中文场景必须包含。。第 4 步Embedding 入库from langchain_community.embeddings import HuggingFaceBgeEmbeddings from langchain_community.vectorstores import Chroma # 中文 embedding embeddings HuggingFaceBgeEmbeddings( model_nameBAAI/bge-large-zh-v1.5, model_kwargs{device: cuda}, # 没 GPU 就改成 cpu encode_kwargs{normalize_embeddings: True}, ) # 入库 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, persist_directory./chroma_db, ) vectorstore.persist() print(入库完成)国内环境特别提示HuggingFace 模型下载可能慢建议用国内镜像或者用魔搭 modelscope 下载第 5 步检索# 检索 top 5 retriever vectorstore.as_retriever( search_typesimilarity, search_kwargs{k: 5}, ) results retriever.invoke(你们的退款政策是什么) for i, doc in enumerate(results): print(f --- 结果 {i1} ---) print(doc.page_content[:200])关键参数k检索返回多少段。太少漏掉太多稀释。FAQ 用 3-5复杂问题用 8-10score_threshold可以加search_kwargs{score_threshold: 0.7}过滤掉太不相关的结果第 6 步增强 生成from langchain.prompts import PromptTemplate from zhipuai import ZhipuAI # Prompt 模板 template 你是专业客服助手。请基于以下参考资料回答用户问题。 如果参考资料里没有答案请直接说我不清楚请联系人工客服。 参考资料 {context} 用户问题{question} 你的回答 prompt PromptTemplate(templatetemplate, input_variables[context, question]) # 调用智谱 GLM-4 client ZhipuAI(api_key你的智谱 API key) def rag_query(question): # 检索 docs retriever.invoke(question) context .join([d.page_content for d in docs]) # 生成 response client.chat.completions.create( modelglm-4-flash, messages[{ role: user, content: prompt.format(contextcontext, questionquestion) }], temperature0.3, ) return response.choices[0].message.content # 测试 print(rag_query(你们的退款政策是什么))3 个 prompt 技巧明确说不知道避免幻觉。如果参考资料里没有答案请直接说我不清楚给参考资料标记让模型知道哪些是引用方便溯源temperature 调低RAG 场景用 0.2-0.4过高会自由发挥第 7 步评估 上线别直接上线。用 50-100 个测试问题验证。test_questions [ {q: 你们的退款政策是什么, expected_keywords: [7天, 无理由]}, {q: 如何联系客服, expected_keywords: [电话, 在线]}, # ... 准备 50-100 个 ] correct 0 for item in test_questions: answer rag_query(item[q]) if all(kw in answer for kw in item[expected_keywords]): correct 1 print(f准确率{correct}/{len(test_questions)} {correct/len(test_questions)*100:.1f}%)评估指标召回率Recall检索出来的段落里有多少包含正确答案准确率Precision生成的答案里有多少包含期望关键词幻觉率Hallucination Rate答案里有多少内容是参考资料里没有的这 7 步跑通RAG 项目就走完了 80%。剩下 20% 是优化切分策略调优、embedding 升级、rerank 加入、prompt 工程。进阶你想从 Demo 到生产路径在这里跑通最小可用版本之后往上走有 3 条路。图 2 · 3 个核心指标 · 上线前必跑 50-100 题4.1 检索质量优化混合检索BM25关键词 向量检索。单独向量检索会漏掉专业术语rerank用专门的重排序模型对 top-k 重新打分。bge-reranker-large 是中文最强开源 rerankquery 改写用 LLM 把用户的口语化问题改写成多个候选查询多路召回向量 关键词 结构化查询如 SQL并行召回再合并4.2 切分策略优化语义切分用 embedding 计算段落相似度在语义断点处切开而不是按固定字符数结构化切分对 markdown 按标题、对代码按函数、对表格按行small-to-big检索时用小段落生成时把小段落所属的大段落一起给模型4.3 评估体系建设人工盲评准备 100 个测试问题原 RAG vs 改进 RAG 各跑一次让人盲选LLM-as-Judge用更强的模型做裁判对比答案质量业务指标真实用户满意度、问题解决率、转人工率RAG 最贵的环节不是搭起来是评估。多数团队的 RAG 准确率评估靠我看着好像还行这是错觉。新手最容易踩的 7 个坑按卡死严重度从高到低排序图 3 · 7 个常见坑 · 90% 的人卡在前 3 个坑现象解决切分错了检索出来的段落看不懂用语义切分按标题层级切先人工看 20 段没做 reranktop-1 经常不是最相关的加 bge-reranker-large没限定不知道模型自由发挥胡说八道prompt 明确参考资料没答案就说不知道k 太大检索 10 段模型被淹没k 调到 3-5配 rerankembedding 模型没选对中文检索召回率低中文必用 bge-large-zh不要用 OpenAI text-embedding-3没做混合检索专业术语搜不到加 BM25向量 关键词双路召回没评估就上线用户投诉答非所问50-100 题测试集上线前必跑写在最后RAG 是连接器不是魔法RAG 是一个连接器。它把模型的通用能力和你的领域知识接起来。RAG 能接上的知识截止、领域术语、产品文档、客服话术、规章制度、内部 wiki。RAG 接不上的实时数据需要搜索 API、结构化查询需要 SQL、多步推理需要 Agent、专业判断需要微调或 RLHF。微调是把模型重新训练RAG 是让模型查资料。99% 的业务场景先用 RAG不够再微调。给第一次搭 RAG 的人 3 条建议先跑通 1 次再优化。切分比 embedding 重要。同样的数据切分策略好准确率能高 20 个百分点评估是入场券不是选做题。50-100 题测试集上线前必跑。RAG 答错一道题用户就觉得AI 不行一个能接上你自己知识库的 LLM比一个什么都会答但什么都答不准的 LLM有用 100 倍。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RAG 到底是怎么把大模型「接入企业」的——一份能直接跑通的检索增强生成实战
微调是把模型的底子换成你的领域语料但 90% 的业务场景你不需要微调。你只需要让模型在回答的时候去翻你公司内部的文档、产品手册、客服记录——这叫 RAGRetrieval-Augmented Generation检索增强生成。RAG 是 2024-2026 年所有 AI 应用项目的事实默认方案。OpenAI 的 GPTs、Anthropic 的 Projects、阿里云百炼、智谱的「知识库」——背后全是 RAG。但 90% 的 RAG 项目困在「检索」这一步而不是生成。这篇文章会跟你说三样东西一条能照着走的 RAG 路径——从 0 到能上线的最小可用版本一份实操最小代码清单——5 个文件就能跑通一次一张避坑表——按卡死严重度排序的 7 个常见坑先把RAG拆开RAG 检索 增强 生成三个动作。检索Retrieval用户问一个问题系统先去你的文档库里找相关的几段文本。增强Augmented把这几段文本塞进 prompt 里作为模型的参考资料。生成Generation模型基于这些参考资料输出最终答案。看起来就 3 步。但每一步都有坑。90% 的项目在这 3 步里踩到至少 1 个坑最终答案质量就崩了。把这 3 步归拢到用什么技术步骤技术选型国内推荐检索向量检索 / 关键词检索 / 混合检索Milvus / 阿里云 DashVector / 腾讯云 VectorDB增强prompt 组装、rerank阿里云通用 rerank、bge-reranker生成LLM 调用GLM-5 / Qwen / DeepSeek / Kimi ……RAG 之前先做一次诚实的盘点动手之前先做一次诚实的盘点。这一步能省掉 80% 的人至少一周时间。1.1 你的数据是什么形态数据形态决定切分策略。数据形态该用什么切分为什么几百页 PDF 产品手册按章节切每段600-800字左右章节天然有边界几千条客服对话一问一答切每段 200-400 字单轮对话是独立知识单元几万条 SQL 文档按表结构切每段 1 张表结构化文档按 schema 切100 篇技术博客按段落切每段 400-600 字长文按主题段切Markdown 文档树按标题层级切markdown 标题是天然切点很多RAG 项目一开始就「切错」。切太粗检索出来的段落太长模型抓不住重点。切太细检索出来的段落太碎模型看不到上下文。切错位置把一句话从中间切开模型读到一半不知道在讲什么。1.2 你的查询是哪种不同查询需要不同的检索策略。查询类型该用什么例子事实型FAQ关键词检索 向量检索“你们的退款政策是什么”概念型解释向量检索为主“什么是 QLoRA”比较型向量检索 rerank“A 和 B 哪个更适合我”多步推理型RAG Agent“基于这份合同帮我算下到期金额”实时型RAG 搜索 API“今天的新闻头条”查询类型决定后续是否需要 Agent 编排。简单 FAQ 用单轮 RAG 就能解决多步推理需要把 RAG 接进 Agent 循环里。1.3 你的容忍度是多少容忍度方案成本能接受 70% 准确率、偶尔答错纯向量检索 LLM几百到几千元必须 90% 准确率混合检索 rerank 答案验证几千元到几万元必须 99% 准确率金融/医疗RAG 微调 规则兜底 人工审核几十万到几百万RAG 不是万能的。RAG 能解决知识截止、“知识错误”、“幻觉”但解决不了逻辑混乱、“胡说八道”。配合答案验证、人工兜底才能真正落地。2. 工具链近 2 年事实上的标准2.1 LangChain干什么LLM 应用最主流的开发框架核心组件DocumentLoader/TextSplitter/Embedding/VectorStore/Retriever/Chain优势组件全、社区大、文档多劣势抽象层太厚性能调优不直观2.2 LlamaIndex干什么专门做 RAG 的框架比 LangChain 更聚焦核心组件SimpleDirectoryReader/NodeParser/VectorStoreIndex/QueryEngine优势RAG 场景设计更合理索引策略丰富劣势通用 Agent 能力不如 LangChain2.3 向量数据库国内选择Milvus开源自部署Qdrant开源自部署阿里云 DashVector云服务按量付费腾讯云 VectorDB云服务按量付费Chroma适合小规模 Demo怎么选100 万条以内用 Chroma100 万-1 亿条用 Milvus/Qdrant上亿条用云服务2.4 Embedding 模型干什么把文本变成向量数字序列国内选择bge-large-zh-v1.5智源中文最强开源 embeddingtext2vec-base-chinese哈工大M3E开源中文场景表现优秀怎么选中文场景默认 bge-large-zh英文用 OpenAI text-embedding-34 个工具的分工图 1 · 按项目规模选Demo / 生产级 RAG / 云服务一站式简单 RAG Demo →LangChain Chroma bge GLM-5生产级 RAG →LlamaIndex Milvus bge Qwen3.5云服务一站式 →阿里云百炼DashVector bge 通义一站式实操跑通你的第一个 RAG我把打开电脑到跑通第一次 RAG切成 7 步。langchain下每一步都给最小可执行代码。第 1 步环境# 推荐环境Python 3.10 conda create -n rag python3.10 -y conda activate rag pip install langchain langchain-community chromadb sentence-transformers zhipuai第 2 步准备数据# 把你的文档放进 ./docs 文件夹 # 支持 pdf / txt / md / docx from langchain_community.document_loaders import DirectoryLoader loader DirectoryLoader(./docs, glob**/*.md, show_progressTrue) docs loader.load() print(f加载 {len(docs)} 个文档)这一步是大部分人踩坑的开始。3 个常见踩坑坑 1PDF 加载出来是乱码 → 装pymupdf或pdfplumber坑 2表格被破坏 → 用专门的 table extractor坑 3扫描版 PDF 没文字 → 先 OCR第 3 步切分文档from langchain.text_splitter import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size500, # 每段最大 500 字符 chunk_overlap50, # 段间重叠 50 字符保留上下文 separators[ , , 。, , ], # 中文友好切分符 ) chunks splitter.split_documents(docs) print(f切分成 {len(chunks)} 个段落)3 个关键参数chunk_size根据你的数据形态选。FAQ 200-400产品手册 800-1200技术文档 500-800chunk_overlap10%-20% 的 chunk_size。太小上下文断裂太大检索冗余separators中文场景必须包含。。第 4 步Embedding 入库from langchain_community.embeddings import HuggingFaceBgeEmbeddings from langchain_community.vectorstores import Chroma # 中文 embedding embeddings HuggingFaceBgeEmbeddings( model_nameBAAI/bge-large-zh-v1.5, model_kwargs{device: cuda}, # 没 GPU 就改成 cpu encode_kwargs{normalize_embeddings: True}, ) # 入库 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, persist_directory./chroma_db, ) vectorstore.persist() print(入库完成)国内环境特别提示HuggingFace 模型下载可能慢建议用国内镜像或者用魔搭 modelscope 下载第 5 步检索# 检索 top 5 retriever vectorstore.as_retriever( search_typesimilarity, search_kwargs{k: 5}, ) results retriever.invoke(你们的退款政策是什么) for i, doc in enumerate(results): print(f --- 结果 {i1} ---) print(doc.page_content[:200])关键参数k检索返回多少段。太少漏掉太多稀释。FAQ 用 3-5复杂问题用 8-10score_threshold可以加search_kwargs{score_threshold: 0.7}过滤掉太不相关的结果第 6 步增强 生成from langchain.prompts import PromptTemplate from zhipuai import ZhipuAI # Prompt 模板 template 你是专业客服助手。请基于以下参考资料回答用户问题。 如果参考资料里没有答案请直接说我不清楚请联系人工客服。 参考资料 {context} 用户问题{question} 你的回答 prompt PromptTemplate(templatetemplate, input_variables[context, question]) # 调用智谱 GLM-4 client ZhipuAI(api_key你的智谱 API key) def rag_query(question): # 检索 docs retriever.invoke(question) context .join([d.page_content for d in docs]) # 生成 response client.chat.completions.create( modelglm-4-flash, messages[{ role: user, content: prompt.format(contextcontext, questionquestion) }], temperature0.3, ) return response.choices[0].message.content # 测试 print(rag_query(你们的退款政策是什么))3 个 prompt 技巧明确说不知道避免幻觉。如果参考资料里没有答案请直接说我不清楚给参考资料标记让模型知道哪些是引用方便溯源temperature 调低RAG 场景用 0.2-0.4过高会自由发挥第 7 步评估 上线别直接上线。用 50-100 个测试问题验证。test_questions [ {q: 你们的退款政策是什么, expected_keywords: [7天, 无理由]}, {q: 如何联系客服, expected_keywords: [电话, 在线]}, # ... 准备 50-100 个 ] correct 0 for item in test_questions: answer rag_query(item[q]) if all(kw in answer for kw in item[expected_keywords]): correct 1 print(f准确率{correct}/{len(test_questions)} {correct/len(test_questions)*100:.1f}%)评估指标召回率Recall检索出来的段落里有多少包含正确答案准确率Precision生成的答案里有多少包含期望关键词幻觉率Hallucination Rate答案里有多少内容是参考资料里没有的这 7 步跑通RAG 项目就走完了 80%。剩下 20% 是优化切分策略调优、embedding 升级、rerank 加入、prompt 工程。进阶你想从 Demo 到生产路径在这里跑通最小可用版本之后往上走有 3 条路。图 2 · 3 个核心指标 · 上线前必跑 50-100 题4.1 检索质量优化混合检索BM25关键词 向量检索。单独向量检索会漏掉专业术语rerank用专门的重排序模型对 top-k 重新打分。bge-reranker-large 是中文最强开源 rerankquery 改写用 LLM 把用户的口语化问题改写成多个候选查询多路召回向量 关键词 结构化查询如 SQL并行召回再合并4.2 切分策略优化语义切分用 embedding 计算段落相似度在语义断点处切开而不是按固定字符数结构化切分对 markdown 按标题、对代码按函数、对表格按行small-to-big检索时用小段落生成时把小段落所属的大段落一起给模型4.3 评估体系建设人工盲评准备 100 个测试问题原 RAG vs 改进 RAG 各跑一次让人盲选LLM-as-Judge用更强的模型做裁判对比答案质量业务指标真实用户满意度、问题解决率、转人工率RAG 最贵的环节不是搭起来是评估。多数团队的 RAG 准确率评估靠我看着好像还行这是错觉。新手最容易踩的 7 个坑按卡死严重度从高到低排序图 3 · 7 个常见坑 · 90% 的人卡在前 3 个坑现象解决切分错了检索出来的段落看不懂用语义切分按标题层级切先人工看 20 段没做 reranktop-1 经常不是最相关的加 bge-reranker-large没限定不知道模型自由发挥胡说八道prompt 明确参考资料没答案就说不知道k 太大检索 10 段模型被淹没k 调到 3-5配 rerankembedding 模型没选对中文检索召回率低中文必用 bge-large-zh不要用 OpenAI text-embedding-3没做混合检索专业术语搜不到加 BM25向量 关键词双路召回没评估就上线用户投诉答非所问50-100 题测试集上线前必跑写在最后RAG 是连接器不是魔法RAG 是一个连接器。它把模型的通用能力和你的领域知识接起来。RAG 能接上的知识截止、领域术语、产品文档、客服话术、规章制度、内部 wiki。RAG 接不上的实时数据需要搜索 API、结构化查询需要 SQL、多步推理需要 Agent、专业判断需要微调或 RLHF。微调是把模型重新训练RAG 是让模型查资料。99% 的业务场景先用 RAG不够再微调。给第一次搭 RAG 的人 3 条建议先跑通 1 次再优化。切分比 embedding 重要。同样的数据切分策略好准确率能高 20 个百分点评估是入场券不是选做题。50-100 题测试集上线前必跑。RAG 答错一道题用户就觉得AI 不行一个能接上你自己知识库的 LLM比一个什么都会答但什么都答不准的 LLM有用 100 倍。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】