Exploring State Tracking Capabilities of Large Language Models

Exploring State Tracking Capabilities of Large Language Models 文章总结与翻译一、主要内容本文聚焦大型语言模型(LLMs)的状态跟踪能力,即模型基于一系列观察或输入,持续维护和更新系统状态内部表示的能力。为隔离状态跟踪核心功能与其他干扰因素,作者设计了三个标准化基准任务(LinearWorld、HandSwap、Lights),通过控制实验评估了不同代际、不同规模LLMs在不同更新深度(最多10步)下的表现,并分析了思维链(CoT)、实体数量、更新类型等因素的影响。核心发现包括:新一代大模型(GPT-4o、Llama3 70B)在状态跟踪任务中表现优异,尤其结合CoT后能在深层更新中保持高准确率;旧代模型(GPT-3.5、Mixtral)和小型模型(Llama3 8B)在更新深度超过2步后性能显著下降,但能理解任务本身;CoT通过将输入窗口作为临时记忆存储中间状态,大幅提升模型状态跟踪能力;模型在整数位移类更新任务中的表现优于实体交换类任务,且对数学运算的熟练度与状态跟踪性能相关。二、创新点构建了三个结构清晰、可复现的基准任务,通过简化场景和控制变量,精准隔离状态跟踪能力的评估,可作为LLM部署时的合理性检验工具;系统分析了模型规模、更新深度、CoT机制、任务类型等多因素对状态跟踪的影响,揭示了不同代际LLMs在该能力上的关键差异;发现LLMs可通过自然语言训练天然习得一定状态跟踪能力,且CoT能有效弥补Transformer架构在串行任务处理上的固有局限;