文章目录LangSmith 完全指南LangChain 官方 AI 应用开发平台什么是 LangSmithLangSmith 能做什么一、Tracing调用链追踪Trace 的层级结构二、Debugging调试三、Evaluation评估自动评分四、Dataset数据集五、Experiment实验六、Prompt Management七、Playground八、Monitoring线上监控九、Analytics统计分析LangSmith 的工作流程与 LangChain 的关系与传统可观测性工具的区别一个简单的接入示例使用 LangSmith 需要 API Key 吗LangSmith 的优点LangSmith 的局限性总结LangSmith 完全指南LangChain 官方 AI 应用开发平台随着大语言模型LLM和 AI Agent 的普及开发流程已经发生了很大的变化。过去开发 Web 应用时我们会使用日志LoggingAPMApplication Performance MonitoringDebugger单元测试性能分析工具而开发 AI 应用时仅靠这些传统工具已经远远不够。例如为什么 Agent 做出了这个决策Prompt 是如何一步步变化的Tool 为什么调用失败RAG 检索到了哪些文档LLM 消耗了多少 Token哪一步响应最慢两个 Prompt 哪个效果更好为了解决这些问题LangChain 官方推出了 LangSmith。它并不是一个 LLM也不是一个 Agent 框架而是一套专门用于AI 应用开发、调试、测试、评估和监控的平台。什么是 LangSmithLangSmith 是 LangChain 官方推出的LLMOpsLarge Language Model Operations平台。官方网站https://smith.langchain.com它类似于 AI 应用领域的Web 开发中的 Chrome DevTools后端开发中的 Jaeger微服务中的 ZipkinKubernetes 中的 Grafana Tempo数据科学中的 MLflow部分能力类似简单来说LangSmith 可以记录 AI 应用运行过程中发生的一切。例如用户问题 │ ▼ Prompt Template │ ▼ Retriever从知识库向量数据库中“找资料”为大模型LLM提供回答问题的“参考上下文” │ ▼ Vector Database │ ▼ LLM │ ▼ Tool │ ▼ Agent │ ▼ 最终回答整个调用链都会被记录下来。LangSmith 能做什么官方主要提供以下几类能力LangSmith │ ├── Tracing调用链追踪 ├── Debugging调试 ├── Evaluation评估 ├── Prompt ManagementPrompt 管理 ├── Playground在线测试 ├── Dataset数据集 ├── Experiment实验 ├── Monitoring线上监控 └── Analytics统计分析下面分别介绍。一、Tracing调用链追踪这是 LangSmith 最核心的功能。每一次 AI 调用都会形成一条 Trace。例如User │ ▼ Agent │ ├── Planner │ ├── Search Tool │ │ │ │ ▼ │ Tavily一个专为 AI 代理AI Agents和大型语言模型LLMs设计的搜索引擎 API │ ├── Retriever │ │ ▼ │ Qdrant │ ├── LLM │ ▼ Answer点击任意节点可以查看输入 Prompt输出内容Tool 参数Token 数延迟是否报错这对于排查复杂 Agent 非常重要。Trace 的层级结构LangSmith 使用树状结构记录调用。例如Run ├── Chain │ ├── Prompt │ ├── LLM │ └── Parser ├── Tool │ ├── HTTP │ └── JSON Parser └── Retriever每个节点都可以展开查看。相比传统日志print(start) print(prompt) print(response) print(tool)Trace 更容易理解整个调用流程。二、Debugging调试AI 开发最难调试。例如为什么回答错误是 Prompt还是 Retriever还是 Tool还是模型LangSmith 可以查看Prompt ↓ LLM ↓ Tool ↓ Response每一步的数据。例如Prompt 你是一名招聘专家... ----------------- Tool Input { keyword:Python } ----------------- Tool Output 20 Jobs ----------------- LLM Output 推荐岗位如下...定位问题非常方便。三、Evaluation评估传统软件是否通过测试AI 软件回答质量如何这就需要 Evaluation。例如Question ↓ Model A ↓ Score ↓ Model B ↓ Score可以比较GPT-4.1ClaudeGeminiDeepSeek哪一个回答更好。自动评分LangSmith 支持AccuracyRelevanceCorrectnessGroundednessToxicityHallucination也可以自定义评分器。例如Question ↓ Answer ↓ Judge LLM ↓ Score这种方式称为LLM-as-a-Judge。四、Dataset数据集很多人会维护测试数据。例如Question Expected AnswerLangSmith 可以管理这些 Dataset。例如QuestionExpected北京首都是北京224以后每次修改 PromptPrompt V1 ↓ Dataset ↓ Score ↓ Prompt V2立即知道是否退化。五、Experiment实验开发 Prompt 时Prompt A ↓ Dataset ↓ Evaluation然后Prompt B ↓ Dataset ↓ EvaluationLangSmith 会自动比较正确率TokenCostLatency方便选择最佳方案。六、Prompt ManagementPrompt 往往越来越复杂。例如System Prompt Few-shot在提示中嵌入少量通常3-10个输入-输出示例引导模型捕捉任务模式。 Variables ExamplesLangSmith 提供 Prompt 管理能力。支持版本管理历史记录回滚在线修改类似 Git 管理 Prompt。七、PlaygroundPlayground 是在线测试环境。例如Prompt ↓ 修改 ↓ 运行 ↓ 观察结果不用重新部署程序。非常适合 Prompt Engineering。八、Monitoring线上监控上线之后最重要的是AI 是否正常LangSmith 提供请求数量TokenCostErrorLatency例如Today 12000 Requests Average Latency 1.2s Token 2M Errors 0.5%帮助快速发现线上问题。九、Analytics统计分析LangSmith 可以统计模型调用次数 ↓ Token ↓ 花费 ↓ 成功率 ↓ 响应时间例如Claude 45% GPT-4 35% Gemini 20%帮助分析成本和性能。LangSmith 的工作流程一个典型流程如下用户请求 │ ▼ Prompt │ ▼ Retriever │ ▼ Vector DB │ ▼ Tool │ ▼ LLM │ ▼ Output │ ▼ Trace │ ▼ Evaluation │ ▼ Experiment │ ▼ Deploy │ ▼ Monitoring可以看出它贯穿了 AI 应用从开发到上线的整个生命周期。与 LangChain 的关系很多初学者容易混淆。实际上LangChain │ ▼ 开发 AI Workflow LangGraph │ ▼ 开发 Agent LangSmith │ ▼ 开发、测试、调试、监控三者定位不同。项目作用LangChain构建 LLM 应用和工作流LangGraph构建具有状态和流程控制的 AI AgentLangSmith调试、评估、测试、监控 AI 应用可以理解为LangChain LangGraph 负责 写程序 LangSmith 负责 观察程序与传统可观测性工具的区别很多开发者会问既然已经有 Grafana、Jaeger、OpenTelemetry为什么还需要 LangSmith原因在于关注点不同。工具关注对象GrafanaCPU、内存、磁盘、网络等基础设施指标Prometheus指标采集与告警Jaeger / Tempo微服务请求链路OpenTelemetry通用应用可观测性数据采集标准LangSmithLLM、Prompt、Agent、Tool、Retriever 等 AI 应用行为举个例子Jaeger 可以告诉你HTTP 请求耗时 300 ms而 LangSmith 可以告诉你Prompt 你是一名招聘专家…… ↓ 调用 GPT-4 ↓ 消耗 2,341 Tokens ↓ Retriever 返回了 8 篇文档 ↓ 第 3 篇文档与问题无关 ↓ 模型最终产生了幻觉回答这类 AI 语义级的信息是传统 APM 无法直接提供的。因此在生产环境中LangSmith 常与 OpenTelemetry、Prometheus、Grafana 等工具配合使用而不是相互替代。一个简单的接入示例安装pipinstalllangsmith langchain配置环境变量exportLANGSMITH_API_KEYlsv2_pt_xxxxxxxxxxxxxxxxxexportLANGSMITH_TRACINGtrueexportLANGSMITH_PROJECTmy-agent之后运行 LangChain 或 LangGraph 应用符合支持条件的调用便会自动上传 Trace 到 LangSmith 平台无需在业务代码中添加大量日志。使用 LangSmith 需要 API Key 吗需要。首次使用时需要登录 LangSmith 官网。创建 API Key。配置LANGSMITH_API_KEY环境变量。开启LANGSMITH_TRACINGtrue。之后应用运行时即可将 Trace 上传到 LangSmith。对于仅在本地运行且不需要 Trace、评估或监控的简单程序则可以不接入 LangSmith。LangSmith 的优点提供完整的 AI 调用链可视化。支持 Prompt、Retriever、Tool、Agent 等 AI 组件的深度调试。内置数据集、评估、实验管理方便持续优化模型和 Prompt。与 LangChain、LangGraph 集成紧密也支持接入其他 LLM 框架。提供线上监控和成本分析适合生产环境使用。LangSmith 的局限性云平台功能需要注册账号并配置 API Key。高级功能和大规模使用可能涉及付费。对 LangChain 生态支持最完善虽然支持开放标准但其他框架的集成体验可能略逊一筹。它关注的是 AI 应用本身仍需要结合日志、监控和 APM 等传统工具才能构建完整的生产可观测性体系。总结LangSmith 是 LangChain 官方推出的 AI 应用开发平台它不仅仅是一个日志系统而是一套覆盖开发、调试、测试、评估、实验、部署和监控全生命周期的 LLMOps 工具。随着 AI Agent、RAG 和复杂工作流的普及应用内部的推理路径、Prompt 演化、工具调用和检索过程越来越难以通过传统日志定位问题。LangSmith 通过可视化 Trace、自动评估、数据集管理和线上监控帮助开发者快速发现问题、验证优化效果并持续提升 AI 应用的稳定性和质量。如果你正在使用LangChain或LangGraph开发 AI 应用LangSmith 几乎已经成为官方推荐的配套工具即使使用其他框架只要希望提升 AI 系统的可观测性和迭代效率LangSmith 也值得纳入你的技术栈。
LangSmith介绍(LLMOps平台)Tracing调用链追踪、日志系统
文章目录LangSmith 完全指南LangChain 官方 AI 应用开发平台什么是 LangSmithLangSmith 能做什么一、Tracing调用链追踪Trace 的层级结构二、Debugging调试三、Evaluation评估自动评分四、Dataset数据集五、Experiment实验六、Prompt Management七、Playground八、Monitoring线上监控九、Analytics统计分析LangSmith 的工作流程与 LangChain 的关系与传统可观测性工具的区别一个简单的接入示例使用 LangSmith 需要 API Key 吗LangSmith 的优点LangSmith 的局限性总结LangSmith 完全指南LangChain 官方 AI 应用开发平台随着大语言模型LLM和 AI Agent 的普及开发流程已经发生了很大的变化。过去开发 Web 应用时我们会使用日志LoggingAPMApplication Performance MonitoringDebugger单元测试性能分析工具而开发 AI 应用时仅靠这些传统工具已经远远不够。例如为什么 Agent 做出了这个决策Prompt 是如何一步步变化的Tool 为什么调用失败RAG 检索到了哪些文档LLM 消耗了多少 Token哪一步响应最慢两个 Prompt 哪个效果更好为了解决这些问题LangChain 官方推出了 LangSmith。它并不是一个 LLM也不是一个 Agent 框架而是一套专门用于AI 应用开发、调试、测试、评估和监控的平台。什么是 LangSmithLangSmith 是 LangChain 官方推出的LLMOpsLarge Language Model Operations平台。官方网站https://smith.langchain.com它类似于 AI 应用领域的Web 开发中的 Chrome DevTools后端开发中的 Jaeger微服务中的 ZipkinKubernetes 中的 Grafana Tempo数据科学中的 MLflow部分能力类似简单来说LangSmith 可以记录 AI 应用运行过程中发生的一切。例如用户问题 │ ▼ Prompt Template │ ▼ Retriever从知识库向量数据库中“找资料”为大模型LLM提供回答问题的“参考上下文” │ ▼ Vector Database │ ▼ LLM │ ▼ Tool │ ▼ Agent │ ▼ 最终回答整个调用链都会被记录下来。LangSmith 能做什么官方主要提供以下几类能力LangSmith │ ├── Tracing调用链追踪 ├── Debugging调试 ├── Evaluation评估 ├── Prompt ManagementPrompt 管理 ├── Playground在线测试 ├── Dataset数据集 ├── Experiment实验 ├── Monitoring线上监控 └── Analytics统计分析下面分别介绍。一、Tracing调用链追踪这是 LangSmith 最核心的功能。每一次 AI 调用都会形成一条 Trace。例如User │ ▼ Agent │ ├── Planner │ ├── Search Tool │ │ │ │ ▼ │ Tavily一个专为 AI 代理AI Agents和大型语言模型LLMs设计的搜索引擎 API │ ├── Retriever │ │ ▼ │ Qdrant │ ├── LLM │ ▼ Answer点击任意节点可以查看输入 Prompt输出内容Tool 参数Token 数延迟是否报错这对于排查复杂 Agent 非常重要。Trace 的层级结构LangSmith 使用树状结构记录调用。例如Run ├── Chain │ ├── Prompt │ ├── LLM │ └── Parser ├── Tool │ ├── HTTP │ └── JSON Parser └── Retriever每个节点都可以展开查看。相比传统日志print(start) print(prompt) print(response) print(tool)Trace 更容易理解整个调用流程。二、Debugging调试AI 开发最难调试。例如为什么回答错误是 Prompt还是 Retriever还是 Tool还是模型LangSmith 可以查看Prompt ↓ LLM ↓ Tool ↓ Response每一步的数据。例如Prompt 你是一名招聘专家... ----------------- Tool Input { keyword:Python } ----------------- Tool Output 20 Jobs ----------------- LLM Output 推荐岗位如下...定位问题非常方便。三、Evaluation评估传统软件是否通过测试AI 软件回答质量如何这就需要 Evaluation。例如Question ↓ Model A ↓ Score ↓ Model B ↓ Score可以比较GPT-4.1ClaudeGeminiDeepSeek哪一个回答更好。自动评分LangSmith 支持AccuracyRelevanceCorrectnessGroundednessToxicityHallucination也可以自定义评分器。例如Question ↓ Answer ↓ Judge LLM ↓ Score这种方式称为LLM-as-a-Judge。四、Dataset数据集很多人会维护测试数据。例如Question Expected AnswerLangSmith 可以管理这些 Dataset。例如QuestionExpected北京首都是北京224以后每次修改 PromptPrompt V1 ↓ Dataset ↓ Score ↓ Prompt V2立即知道是否退化。五、Experiment实验开发 Prompt 时Prompt A ↓ Dataset ↓ Evaluation然后Prompt B ↓ Dataset ↓ EvaluationLangSmith 会自动比较正确率TokenCostLatency方便选择最佳方案。六、Prompt ManagementPrompt 往往越来越复杂。例如System Prompt Few-shot在提示中嵌入少量通常3-10个输入-输出示例引导模型捕捉任务模式。 Variables ExamplesLangSmith 提供 Prompt 管理能力。支持版本管理历史记录回滚在线修改类似 Git 管理 Prompt。七、PlaygroundPlayground 是在线测试环境。例如Prompt ↓ 修改 ↓ 运行 ↓ 观察结果不用重新部署程序。非常适合 Prompt Engineering。八、Monitoring线上监控上线之后最重要的是AI 是否正常LangSmith 提供请求数量TokenCostErrorLatency例如Today 12000 Requests Average Latency 1.2s Token 2M Errors 0.5%帮助快速发现线上问题。九、Analytics统计分析LangSmith 可以统计模型调用次数 ↓ Token ↓ 花费 ↓ 成功率 ↓ 响应时间例如Claude 45% GPT-4 35% Gemini 20%帮助分析成本和性能。LangSmith 的工作流程一个典型流程如下用户请求 │ ▼ Prompt │ ▼ Retriever │ ▼ Vector DB │ ▼ Tool │ ▼ LLM │ ▼ Output │ ▼ Trace │ ▼ Evaluation │ ▼ Experiment │ ▼ Deploy │ ▼ Monitoring可以看出它贯穿了 AI 应用从开发到上线的整个生命周期。与 LangChain 的关系很多初学者容易混淆。实际上LangChain │ ▼ 开发 AI Workflow LangGraph │ ▼ 开发 Agent LangSmith │ ▼ 开发、测试、调试、监控三者定位不同。项目作用LangChain构建 LLM 应用和工作流LangGraph构建具有状态和流程控制的 AI AgentLangSmith调试、评估、测试、监控 AI 应用可以理解为LangChain LangGraph 负责 写程序 LangSmith 负责 观察程序与传统可观测性工具的区别很多开发者会问既然已经有 Grafana、Jaeger、OpenTelemetry为什么还需要 LangSmith原因在于关注点不同。工具关注对象GrafanaCPU、内存、磁盘、网络等基础设施指标Prometheus指标采集与告警Jaeger / Tempo微服务请求链路OpenTelemetry通用应用可观测性数据采集标准LangSmithLLM、Prompt、Agent、Tool、Retriever 等 AI 应用行为举个例子Jaeger 可以告诉你HTTP 请求耗时 300 ms而 LangSmith 可以告诉你Prompt 你是一名招聘专家…… ↓ 调用 GPT-4 ↓ 消耗 2,341 Tokens ↓ Retriever 返回了 8 篇文档 ↓ 第 3 篇文档与问题无关 ↓ 模型最终产生了幻觉回答这类 AI 语义级的信息是传统 APM 无法直接提供的。因此在生产环境中LangSmith 常与 OpenTelemetry、Prometheus、Grafana 等工具配合使用而不是相互替代。一个简单的接入示例安装pipinstalllangsmith langchain配置环境变量exportLANGSMITH_API_KEYlsv2_pt_xxxxxxxxxxxxxxxxxexportLANGSMITH_TRACINGtrueexportLANGSMITH_PROJECTmy-agent之后运行 LangChain 或 LangGraph 应用符合支持条件的调用便会自动上传 Trace 到 LangSmith 平台无需在业务代码中添加大量日志。使用 LangSmith 需要 API Key 吗需要。首次使用时需要登录 LangSmith 官网。创建 API Key。配置LANGSMITH_API_KEY环境变量。开启LANGSMITH_TRACINGtrue。之后应用运行时即可将 Trace 上传到 LangSmith。对于仅在本地运行且不需要 Trace、评估或监控的简单程序则可以不接入 LangSmith。LangSmith 的优点提供完整的 AI 调用链可视化。支持 Prompt、Retriever、Tool、Agent 等 AI 组件的深度调试。内置数据集、评估、实验管理方便持续优化模型和 Prompt。与 LangChain、LangGraph 集成紧密也支持接入其他 LLM 框架。提供线上监控和成本分析适合生产环境使用。LangSmith 的局限性云平台功能需要注册账号并配置 API Key。高级功能和大规模使用可能涉及付费。对 LangChain 生态支持最完善虽然支持开放标准但其他框架的集成体验可能略逊一筹。它关注的是 AI 应用本身仍需要结合日志、监控和 APM 等传统工具才能构建完整的生产可观测性体系。总结LangSmith 是 LangChain 官方推出的 AI 应用开发平台它不仅仅是一个日志系统而是一套覆盖开发、调试、测试、评估、实验、部署和监控全生命周期的 LLMOps 工具。随着 AI Agent、RAG 和复杂工作流的普及应用内部的推理路径、Prompt 演化、工具调用和检索过程越来越难以通过传统日志定位问题。LangSmith 通过可视化 Trace、自动评估、数据集管理和线上监控帮助开发者快速发现问题、验证优化效果并持续提升 AI 应用的稳定性和质量。如果你正在使用LangChain或LangGraph开发 AI 应用LangSmith 几乎已经成为官方推荐的配套工具即使使用其他框架只要希望提升 AI 系统的可观测性和迭代效率LangSmith 也值得纳入你的技术栈。