本文分享了Krafton首席AI官Kangwook Lee在UC Berkeley BLISS研讨会上的演讲内容探讨了构建真正好用的LLM Agent的难点与解决方案。文章从LLM Agent的核心循环出发详细介绍了上下文工程、Skills、Compaction、多Agent、递归语言模型、Ralph循环等关键技术并分析了虚假完成等常见问题。此外还讨论了测试时扩展、记忆驱动的自我进化等高级技巧。文章强调构建实用LLM Agent需要在上下文工程上做文章解决虚假完成问题并利用记忆机制实现跨任务的连续性。LLM Agent 到底是什么说白了就三步循环观察 → 思考 → 行动不断重复直到任务完成。Agent 读取环境信息推理该做什么调工具执行然后把结果喂回来继续下一轮。这个核心循环很简单后面所有的优化、所有踩过的坑本质上都是在这个循环上做文章。从最简单的形态说起最基础的就是单次工具调用没有循环一锤子买卖给个任务LLM 想一想调一个工具结束。适合帮我搜一下 X、帮我算一下 Y这类简单需求。context task_instruction generated_tokens LLM(context) thoughts, action parse(generated_tokens) exec(action)加上 while 循环就变成真正的 Agent 了——任务没完成就一直跑每轮把输出追加到历史里作为下一轮输入。这里有个细节值得注意输出output不是简单的下一个状态而是执行过程中观察到的一切——日志、信号、副作用甚至奖励信号。比如执行编译命令输出就是完整的编译日志加上成功/失败标记。token_history task_instruction while task not completed: generated_tokens LLM(token_history) thoughts, action parse(generated_tokens) output exec(action) token_history [thoughts, action, output]上下文工程真正的核心竞争力随着循环推进历史记录越积越长最终把上下文窗口塞满。计算开销和 KV 缓存内存都线性增长而大部分历史内容其实已经没用了。这就引出了上下文工程把历史存储和实际喂给 LLM 的内容分开每一轮都精心准备刚好够用的上下文而不是把所有历史一股脑塞进去。token_history task_instruction while task not completed: context context_build(token_history, external_info) generated_tokens LLM(context) ...动态切换工具工具列表定义在系统提示里上下文工程允许每一轮动态调整可用工具集。比如一个编程 Agent开始用文件浏览工具中间切换到编辑工具最后换成测试工具——按阶段按需加载不用一次全开着。Skills按需加载的技能包Skills 是结构化的提示词 工具集 指令组合包需要的时候才加载进上下文。为什么不直接写成一个超长系统提示因为上下文窗口有限Skills 的逻辑是需要什么用什么不需要的不占空间。下面是 Claude Code 里一个真实的 Skill# /commit —— 创建 git 提交的技能 # 当用户要求提交更改时 # 1. 运行 git status 和 git diff 查看所有变更 # 2. 分析差异概括变更性质新功能、修 bug、重构、文档等 # 3. 起一个简洁的提交信息1-2 句重点写为什么而不是做了什么 # 4. 暂存相关文件避免包含密钥、.env 等 # 5. 创建提交 # 可用工具: Bash(git status), Bash(git diff), Bash(git add), Bash(git commit)一个 Skill 就是一个文本文件Agent 在调试代码时根本不会看到/commit这个 Skill。更妙的是Skills 本身可以被 Agent 写入、更新甚至在多个 Agent 之间共享——更新 Skill 就等于更新提示词这是一种去中心化的持续学习方式。不过要注意Skills 也是最容易过拟合测试集的手段。针对特定任务定制的 Skill 可以刷高评分但不代表通用能力真的提升了。Compaction上下文满了就压缩不同场景有不同的压缩策略。编程 Agent 可以扔掉冗长的编译日志只保留成功/失败结果ML 研究 Agent 只保留验证损失而不保存完整训练曲线实在没办法了就用另一个 LLM 来做摘要压缩。核心思路都一样把没用的扔掉只留关键信息。KV 缓存的约束上下文工程改变了每一轮的输入但如果前缀变了KV 缓存就会失效需要重新计算代价不小。Manus 2025 年提出的解法是掩码法从一开始就把所有信息放进系统提示通过 logit masking 来屏蔽暂时不需要的部分而不是动态添加删除。前缀始终不变KV 缓存一直有效。初始提示词虽然长了但多轮循环下来收益相当可观。临时上下文Ephemeral Context另一个技巧是把当前轮特有的信息追加在稳定前缀之后这部分临时上下文用完即丢不会存入历史。while task not completed: context token_history log # log 是临时的不会存入历史 generated_tokens LLM(context) thoughts, action parse(generated_tokens) output exec(action) token_history [thoughts, action, result] # 只保留结果PUBG Ally 就用了这个方案——敌人位置、血量、安全区这些信息当下关键但下一轮就没意义了没必要永远保留。顺便说一下PUBG Ally 是一个完全跑在玩家本地 GPU 上的实时游戏 Agent集成了语音STT SLM TTS、战术建议、实战辅助全部本地推理。多 Agent 和子 Agent本质是上下文隔离可以把多 Agent 理解成面向对象编程里的对象隔离。如果让同一个 Agent 既写代码又做 Code ReviewReview 的判断会被写代码时的思路所干扰确认偏误。分成两个 Agent、各自拥有干净的上下文问题就解决了code LLM_Agent(code it) review LLM_Agent(review it, code) # 或者迭代式 while True: code LLM_Agent(code it, review) review LLM_Agent(review it, code)子 Agent 的逻辑也一样主 Agent 不直接读取一个巨大的文件而是派一个子 Agent 去读子 Agent 把摘要返回给主 Agent自己的上下文直接丢弃。主 Agent 只看到简洁的结论上下文保持整洁。递归语言模型用程序来调度 Agent假设 LLM 计划处理 file000.txt 到 file099.txt在实际执行中它可能中途漏掉 file078.txt——记忆不可靠。解决方案是让 LLM 直接写一段程序来调度子 Agent程序保证每个文件都被处理LLM 不再需要靠记忆来跟踪进度summary run_program( for file in files: result LLM_Agent(summarize file) return result )这对规模较小的模型效果尤为显著——程序结构弥补了模型在长程追踪上的短板。最大的生产问题虚假完成讲到这里前面覆盖了上下文工程、Skills、Compaction、多 Agent、递归语言模型——现在到了最关键的问题Agent 怎么知道自己该停了有三种情况有外部校验器的可验证任务好处理、固定时间/预算限制也好处理、以及最常见的——LLM 自己决定是否完成。这最后一种问题最大。在 Terminal-Bench-2 这个需要深度专业知识的基准测试上配合 Claude Opus 4.6 的基线 Agent 在时间限制内提交了 5 次结果5 次全错且每次都充满信心地认为自己完成了。大约 80% 的失败都源于虚假完成False Completion。Ralph 循环一个直接的解法加一个外层循环让一个全新的 Agent 来验证工作是否真的完成了。每次内层循环都从干净的上下文开始但面对的是同一个世界状态。只有当新 Agent 什么都没改动才真正退出while True: # 外层循环 token_history [] while True: # 内层循环上下文干净 ... if action done: break output, answer_not_changed exec(action) token_history [thoughts, action, output] if answer_not_changed: break # 新 Agent 也认为没什么可改了Terminus-KIRA 的方案Ralph 循环有效但需要完整重启内层循环开销不小。Terminus-KIRA 的变体更轻量正常跑的同时单独维护一份只包含动作和输出、不含思考过程的历史。当 Agent 觉得完成了让一个只看做了什么、看不到怎么想的的独立验证者再确认一遍token_history task_instruction token_history_wo_thoughts [] while True: ... if action done: # 只用动作输出的历史再验证一次去掉思考过程的干扰 generated_tokens LLM(token_history_wo_thoughts) thoughts, action parse(generated_tokens) if action done: break # 两个都同意才算真完成 output exec(action) token_history [thoughts, action, output] token_history_wo_thoughts [action, output] # 只记录做了什么去掉思考过程的干扰验证者的判断更客观而且不需要完整重启一轮循环。AutoResearch虚假完成不是问题的情况Andrej Karpathy 的 AutoResearch 火了之后很多人问它为什么不需要 Ralph 循环。答案很简单这是一个进度可度量的任务。目标是训练出验证损失更低的模型。损失到底有没有降数据说了算Agent 根本没办法虚报完成。整个提示词的核心逻辑就是永远不停——看 git 状态改 train.py提交跑实验读结果好就保留不好就 reset记录继续循环。“一旦实验循环开始不要停下来询问用户是否继续。用户可能已经睡着了或者离开了电脑期望 Agent 一直工作直到被手动停止。按每个实验约 5 分钟算一晚上能跑 100 个实验用户醒来就看到结果。进度验证损失是可以直接衡量的虚假完成几乎不可能发生。AlphaEvolve 和 AdaEvolve 也是同样的模式。自动强化学习 Agent和 AutoResearch 类似但更进一步用于 RL 工程。不只是调超参数Agent 还要自主设计奖励函数来避免 reward hacking。KRAFTON 团队用一个 b-boying 蜘蛛做了演示Agent 自主设计奖励函数、训练 RL 策略、不断迭代最终达到超人表现。测试时扩展多跑几次选最好的测试时扩展Test-Time Scaling的思路是跑多个候选再挑最好的。但用在 Agent 上有几个难题整个 Agent 循环跑多次成本极高Agent 输出不是固定选项没法直接投票而且当成功率低于 50% 时多数人投票反而选出了错的那个。直接让 LLM 从所有候选里挑最有希望的本质上是隐式多数投票成功率低的时候会适得其反。BTL 成对比较的思路是每次只让 LLM 比较两个候选不让它同时看到所有人从而避免多数偏误for i in range(N): history[i] LLM_agent(task_instruction) for (i, j) in [N] x [N]: y[i,j] LLM(哪个更有希望 history[i] history[j]) s BTL_solver(y) # Bradley-Terry-Luce 模型 return argmax(s)初步测试结果Agent单次基线BTL 最优提升Terminus-KIRA76.281.35.1Terminus-262.967.04.1OpenSage GPT-5.378.481.12.7BTL 方法确实比简单计分略胜一筹而且每对可以比较多次比较本身也是一种测试时算力投入。OpenClaw靠记忆自我进化OpenClaw 的核心是在基础 Agent 循环和 Ralph 循环之上加了记忆更新。每次任务结束后Agent 更新自己的记忆而这个记忆在下一次任务开始时就已经加载进来了token_history system_prompt memory task_instruction while True: ... if action done: memory memory_update(thought_history) # 自我进化 break ...记忆更新可以很有创意——总结本次会话、更新 Agent 的身份认知、积累跨任务的性格和经验。这是一种真正意义上的持续学习任务与任务之间有了连续性。记忆在真实产品里的样子inZOI是全球第一款搭载本地 LLM Agent 的游戏销量超过 100 万份。开发团队尝试过让 AI 角色自主进化性格但发现角色性格很容易极端化最终选择了让用户自定义人格的方案来保证稳定性。PUBG Ally的记忆则集中在友谊和过去的游戏经历上。“还记得我们那次赢的比赛吗”——有了这样的记忆队友才有了真实感而不只是一个指令执行器。还有哪些没解决的问题主动性Agent 什么时候该主动找用户说话什么时候该自己去做快速反应System 1 / System 2 架构怎么落地蒸馏把 LLM Agent 压缩成 SLM Agent不是简单的知识蒸馏有离策略、模型共享等难题多模态语音转文字再转语音信息在每个环节都有损耗多模态应该是模型的核心能力而不是外挂评测Agent 输出复杂、不确定性高怎么可靠地评估是个大问题规划LLM 的探索/利用权衡做得很差外部搜索机制是目前的补丁最后说几句LLM Agent 的核心循环本身很简单但让它在生产环境里真正跑起来每个环节都有讲究。上下文工程是最核心的设计空间虚假完成是最常见的生产问题记忆机制让 Agent 真正拥有了跨任务的连续性。整个领域还非常早期——作者用的比喻是通信技术的 1950 年代。从真实问题出发去做工程而不是从 benchmark 出发去刷分——这句话值得反复想想。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取
构建实用LLM Agent:从新手到高手的进阶指南(收藏版)
本文分享了Krafton首席AI官Kangwook Lee在UC Berkeley BLISS研讨会上的演讲内容探讨了构建真正好用的LLM Agent的难点与解决方案。文章从LLM Agent的核心循环出发详细介绍了上下文工程、Skills、Compaction、多Agent、递归语言模型、Ralph循环等关键技术并分析了虚假完成等常见问题。此外还讨论了测试时扩展、记忆驱动的自我进化等高级技巧。文章强调构建实用LLM Agent需要在上下文工程上做文章解决虚假完成问题并利用记忆机制实现跨任务的连续性。LLM Agent 到底是什么说白了就三步循环观察 → 思考 → 行动不断重复直到任务完成。Agent 读取环境信息推理该做什么调工具执行然后把结果喂回来继续下一轮。这个核心循环很简单后面所有的优化、所有踩过的坑本质上都是在这个循环上做文章。从最简单的形态说起最基础的就是单次工具调用没有循环一锤子买卖给个任务LLM 想一想调一个工具结束。适合帮我搜一下 X、帮我算一下 Y这类简单需求。context task_instruction generated_tokens LLM(context) thoughts, action parse(generated_tokens) exec(action)加上 while 循环就变成真正的 Agent 了——任务没完成就一直跑每轮把输出追加到历史里作为下一轮输入。这里有个细节值得注意输出output不是简单的下一个状态而是执行过程中观察到的一切——日志、信号、副作用甚至奖励信号。比如执行编译命令输出就是完整的编译日志加上成功/失败标记。token_history task_instruction while task not completed: generated_tokens LLM(token_history) thoughts, action parse(generated_tokens) output exec(action) token_history [thoughts, action, output]上下文工程真正的核心竞争力随着循环推进历史记录越积越长最终把上下文窗口塞满。计算开销和 KV 缓存内存都线性增长而大部分历史内容其实已经没用了。这就引出了上下文工程把历史存储和实际喂给 LLM 的内容分开每一轮都精心准备刚好够用的上下文而不是把所有历史一股脑塞进去。token_history task_instruction while task not completed: context context_build(token_history, external_info) generated_tokens LLM(context) ...动态切换工具工具列表定义在系统提示里上下文工程允许每一轮动态调整可用工具集。比如一个编程 Agent开始用文件浏览工具中间切换到编辑工具最后换成测试工具——按阶段按需加载不用一次全开着。Skills按需加载的技能包Skills 是结构化的提示词 工具集 指令组合包需要的时候才加载进上下文。为什么不直接写成一个超长系统提示因为上下文窗口有限Skills 的逻辑是需要什么用什么不需要的不占空间。下面是 Claude Code 里一个真实的 Skill# /commit —— 创建 git 提交的技能 # 当用户要求提交更改时 # 1. 运行 git status 和 git diff 查看所有变更 # 2. 分析差异概括变更性质新功能、修 bug、重构、文档等 # 3. 起一个简洁的提交信息1-2 句重点写为什么而不是做了什么 # 4. 暂存相关文件避免包含密钥、.env 等 # 5. 创建提交 # 可用工具: Bash(git status), Bash(git diff), Bash(git add), Bash(git commit)一个 Skill 就是一个文本文件Agent 在调试代码时根本不会看到/commit这个 Skill。更妙的是Skills 本身可以被 Agent 写入、更新甚至在多个 Agent 之间共享——更新 Skill 就等于更新提示词这是一种去中心化的持续学习方式。不过要注意Skills 也是最容易过拟合测试集的手段。针对特定任务定制的 Skill 可以刷高评分但不代表通用能力真的提升了。Compaction上下文满了就压缩不同场景有不同的压缩策略。编程 Agent 可以扔掉冗长的编译日志只保留成功/失败结果ML 研究 Agent 只保留验证损失而不保存完整训练曲线实在没办法了就用另一个 LLM 来做摘要压缩。核心思路都一样把没用的扔掉只留关键信息。KV 缓存的约束上下文工程改变了每一轮的输入但如果前缀变了KV 缓存就会失效需要重新计算代价不小。Manus 2025 年提出的解法是掩码法从一开始就把所有信息放进系统提示通过 logit masking 来屏蔽暂时不需要的部分而不是动态添加删除。前缀始终不变KV 缓存一直有效。初始提示词虽然长了但多轮循环下来收益相当可观。临时上下文Ephemeral Context另一个技巧是把当前轮特有的信息追加在稳定前缀之后这部分临时上下文用完即丢不会存入历史。while task not completed: context token_history log # log 是临时的不会存入历史 generated_tokens LLM(context) thoughts, action parse(generated_tokens) output exec(action) token_history [thoughts, action, result] # 只保留结果PUBG Ally 就用了这个方案——敌人位置、血量、安全区这些信息当下关键但下一轮就没意义了没必要永远保留。顺便说一下PUBG Ally 是一个完全跑在玩家本地 GPU 上的实时游戏 Agent集成了语音STT SLM TTS、战术建议、实战辅助全部本地推理。多 Agent 和子 Agent本质是上下文隔离可以把多 Agent 理解成面向对象编程里的对象隔离。如果让同一个 Agent 既写代码又做 Code ReviewReview 的判断会被写代码时的思路所干扰确认偏误。分成两个 Agent、各自拥有干净的上下文问题就解决了code LLM_Agent(code it) review LLM_Agent(review it, code) # 或者迭代式 while True: code LLM_Agent(code it, review) review LLM_Agent(review it, code)子 Agent 的逻辑也一样主 Agent 不直接读取一个巨大的文件而是派一个子 Agent 去读子 Agent 把摘要返回给主 Agent自己的上下文直接丢弃。主 Agent 只看到简洁的结论上下文保持整洁。递归语言模型用程序来调度 Agent假设 LLM 计划处理 file000.txt 到 file099.txt在实际执行中它可能中途漏掉 file078.txt——记忆不可靠。解决方案是让 LLM 直接写一段程序来调度子 Agent程序保证每个文件都被处理LLM 不再需要靠记忆来跟踪进度summary run_program( for file in files: result LLM_Agent(summarize file) return result )这对规模较小的模型效果尤为显著——程序结构弥补了模型在长程追踪上的短板。最大的生产问题虚假完成讲到这里前面覆盖了上下文工程、Skills、Compaction、多 Agent、递归语言模型——现在到了最关键的问题Agent 怎么知道自己该停了有三种情况有外部校验器的可验证任务好处理、固定时间/预算限制也好处理、以及最常见的——LLM 自己决定是否完成。这最后一种问题最大。在 Terminal-Bench-2 这个需要深度专业知识的基准测试上配合 Claude Opus 4.6 的基线 Agent 在时间限制内提交了 5 次结果5 次全错且每次都充满信心地认为自己完成了。大约 80% 的失败都源于虚假完成False Completion。Ralph 循环一个直接的解法加一个外层循环让一个全新的 Agent 来验证工作是否真的完成了。每次内层循环都从干净的上下文开始但面对的是同一个世界状态。只有当新 Agent 什么都没改动才真正退出while True: # 外层循环 token_history [] while True: # 内层循环上下文干净 ... if action done: break output, answer_not_changed exec(action) token_history [thoughts, action, output] if answer_not_changed: break # 新 Agent 也认为没什么可改了Terminus-KIRA 的方案Ralph 循环有效但需要完整重启内层循环开销不小。Terminus-KIRA 的变体更轻量正常跑的同时单独维护一份只包含动作和输出、不含思考过程的历史。当 Agent 觉得完成了让一个只看做了什么、看不到怎么想的的独立验证者再确认一遍token_history task_instruction token_history_wo_thoughts [] while True: ... if action done: # 只用动作输出的历史再验证一次去掉思考过程的干扰 generated_tokens LLM(token_history_wo_thoughts) thoughts, action parse(generated_tokens) if action done: break # 两个都同意才算真完成 output exec(action) token_history [thoughts, action, output] token_history_wo_thoughts [action, output] # 只记录做了什么去掉思考过程的干扰验证者的判断更客观而且不需要完整重启一轮循环。AutoResearch虚假完成不是问题的情况Andrej Karpathy 的 AutoResearch 火了之后很多人问它为什么不需要 Ralph 循环。答案很简单这是一个进度可度量的任务。目标是训练出验证损失更低的模型。损失到底有没有降数据说了算Agent 根本没办法虚报完成。整个提示词的核心逻辑就是永远不停——看 git 状态改 train.py提交跑实验读结果好就保留不好就 reset记录继续循环。“一旦实验循环开始不要停下来询问用户是否继续。用户可能已经睡着了或者离开了电脑期望 Agent 一直工作直到被手动停止。按每个实验约 5 分钟算一晚上能跑 100 个实验用户醒来就看到结果。进度验证损失是可以直接衡量的虚假完成几乎不可能发生。AlphaEvolve 和 AdaEvolve 也是同样的模式。自动强化学习 Agent和 AutoResearch 类似但更进一步用于 RL 工程。不只是调超参数Agent 还要自主设计奖励函数来避免 reward hacking。KRAFTON 团队用一个 b-boying 蜘蛛做了演示Agent 自主设计奖励函数、训练 RL 策略、不断迭代最终达到超人表现。测试时扩展多跑几次选最好的测试时扩展Test-Time Scaling的思路是跑多个候选再挑最好的。但用在 Agent 上有几个难题整个 Agent 循环跑多次成本极高Agent 输出不是固定选项没法直接投票而且当成功率低于 50% 时多数人投票反而选出了错的那个。直接让 LLM 从所有候选里挑最有希望的本质上是隐式多数投票成功率低的时候会适得其反。BTL 成对比较的思路是每次只让 LLM 比较两个候选不让它同时看到所有人从而避免多数偏误for i in range(N): history[i] LLM_agent(task_instruction) for (i, j) in [N] x [N]: y[i,j] LLM(哪个更有希望 history[i] history[j]) s BTL_solver(y) # Bradley-Terry-Luce 模型 return argmax(s)初步测试结果Agent单次基线BTL 最优提升Terminus-KIRA76.281.35.1Terminus-262.967.04.1OpenSage GPT-5.378.481.12.7BTL 方法确实比简单计分略胜一筹而且每对可以比较多次比较本身也是一种测试时算力投入。OpenClaw靠记忆自我进化OpenClaw 的核心是在基础 Agent 循环和 Ralph 循环之上加了记忆更新。每次任务结束后Agent 更新自己的记忆而这个记忆在下一次任务开始时就已经加载进来了token_history system_prompt memory task_instruction while True: ... if action done: memory memory_update(thought_history) # 自我进化 break ...记忆更新可以很有创意——总结本次会话、更新 Agent 的身份认知、积累跨任务的性格和经验。这是一种真正意义上的持续学习任务与任务之间有了连续性。记忆在真实产品里的样子inZOI是全球第一款搭载本地 LLM Agent 的游戏销量超过 100 万份。开发团队尝试过让 AI 角色自主进化性格但发现角色性格很容易极端化最终选择了让用户自定义人格的方案来保证稳定性。PUBG Ally的记忆则集中在友谊和过去的游戏经历上。“还记得我们那次赢的比赛吗”——有了这样的记忆队友才有了真实感而不只是一个指令执行器。还有哪些没解决的问题主动性Agent 什么时候该主动找用户说话什么时候该自己去做快速反应System 1 / System 2 架构怎么落地蒸馏把 LLM Agent 压缩成 SLM Agent不是简单的知识蒸馏有离策略、模型共享等难题多模态语音转文字再转语音信息在每个环节都有损耗多模态应该是模型的核心能力而不是外挂评测Agent 输出复杂、不确定性高怎么可靠地评估是个大问题规划LLM 的探索/利用权衡做得很差外部搜索机制是目前的补丁最后说几句LLM Agent 的核心循环本身很简单但让它在生产环境里真正跑起来每个环节都有讲究。上下文工程是最核心的设计空间虚假完成是最常见的生产问题记忆机制让 Agent 真正拥有了跨任务的连续性。整个领域还非常早期——作者用的比喻是通信技术的 1950 年代。从真实问题出发去做工程而不是从 benchmark 出发去刷分——这句话值得反复想想。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取