当 Agent 缺少状态:从 HMM/LDS 重建认知架构
核心观点速览
- Agent 缺的不是记忆,是状态估计能力;语言模式匹配与环境状态追踪属于不同认知层次。
- HMM 与 LDS 是针对特定环境结构的信念更新范式,提供可解释的状态表示,而非通用序列建模工具。
- 序列理解的本质是从历史中提炼压缩可靠的信念状态;设计时需严格匹配环境本质与模型假设。
当 Agent 缺少状态:从 HMM/LDS 重建认知架构
今天的大语言模型驱动的 Agent 能流畅对话、调用工具,甚至完成多步任务。但它们普遍存在一个隐蔽的认知断层:擅长从历史文本中检索片段,却难以构建并维护关于外部环境的、持续演化的内部状态。这种缺失根植于架构层面,与模型规模或训练数据无关。语言模式匹配与环境状态追踪,本就是两种不同层次的认知能力。
人类在部分可观测的环境中行动时,不会记住每一帧视觉输入或传感器读数。大脑始终维持着一个压缩的信念状态:我在哪里?周围有什么?哪些变量在变化?这个信念超越了原始数据的简单副本,成为支撑预测、规划和决策的动态模型。正是这种状态估计能力,让我们能在信息不完整时依然做出合理推断。
当前主流 Agent 架构恰恰缺少这一层。它们把环境交互简化为上下文窗口的拼接,将“记忆”等同于“存储”。Agent 能复述过去发生了什么,却无法回答“现在世界处于什么状态”或“下一步最可能变成什么样”。一旦任务涉及长时程依赖、隐变量推理或真实物理环境交互,这种断层就会暴露无遗。
要弥合断层,我们需要回到序列建模的源头。隐马尔科夫模型(HMM)与线性动态系统(LDS)被深度学习浪潮暂时遮蔽,却从未过时。它们专注于一个问题:如何从嘈杂、部分的观测中,还原出驱动一切变化的潜在状态?理解它们旨在补全 Agent 认知架构中缺失的基石——这恰是复古表象下的真实意图。
真实世界没有“全知视角”
强化学习的经典框架 MDP 假设 Agent 在任何时刻都能准确获知环境的完整状态。但真实世界的交互几乎总是部分可观测的。机器人看到的只是相机视野内的像素,而非整个房间的布局;对话系统接收到的只是用户当前的话语,而非其未言明的意图;自动驾驶车辆感知到的是传感器噪声中的片段信号,而非所有交通参与者的精确位置与未来轨迹。Agent 接收到的观测 $o_t$ 永远不等于真实状态 $s_t$。
当状态不可直接观测时,MDP 的马尔科夫性质在观测空间上失效。POMDP 正是为描述这类问题而生,其核心挑战是在每一步维护关于真实状态的合理信念。这个信念状态取代了 MDP 中的确定性状态,成为决策的真正输入。你可以把它理解为 Agent 对世界的“最佳猜测”——它不再执着于“我在哪”的确定答案,而是维护一张“我可能在哪些位置、各自概率多少”的地图。(注:严格求解这种猜测在计算上通常不可行,实践中多用近似方法。)
决策质量依赖于信念的准确性,而信念本身的可靠性又受限于状态转移模型 $P(s’|s,a)$ 与观测模型的真实性。若环境动力学建模错误,即使信念更新算法完美,所得信念也会系统性偏离真实状态。因此,状态估计不是可选附加模块,而是认知架构的前置条件。它解决的是比“如何行动”更基础的问题:“我现在认为世界是什么样的?”只有这个问题有了可靠答案,规划、推理和学习才有所依托。HMM 与 LDS 正是回答这个问题的两种经典范式,共同构成理解序列依赖与环境交互的理论起点。
离散语义 vs 连续物理:选对信念更新范式
HMM 与 LDS 共享同一个核心思想:环境存在无法直接观测的潜在状态序列,任务是从噪声观测中反推这个序列。但它们并非通用序列建模工具,而是针对特定环境结构的专用范式。选择哪一个,取决于环境本质是否匹配模型的先验假设。
HMM 的价值在于对已离散化的语义结构提供可解释的信念表示。它用有限隐藏类别概括环境本质模式,比如“房间A”“走廊”“门口”。每个隐藏状态以固定概率生成观测并转移。这种抽象天然适合结构化、语义明确的环境。对 Agent 而言,HMM 提供分类式信念:不确定此刻处于哪个语义节点,但可以给出每个节点的可能性分布。它的优势是可解释性强、计算高效,能与符号推理无缝对接。但它从根本上不适用于原始连续信号的滤波问题。离散化是建模选择,不是万能钥匙;强行对连续动态做离散切分,反而会引入系统性偏差。
LDS 则假设潜在状态连续、服从线性高斯动态。它用向量空间中的点表示状态,用线性方程描述演化。在线性高斯假设成立且模型参数已知的前提下,Kalman Filter 是最优状态估计器,通过融合预测与校正得到最小方差估计。这种连续表征更适合物理世界中的位置、速度等变量。LDS 提供度量式信念:不仅知道大概在哪,还能量化不确定性的大小与方向。一旦偏离线性高斯假设,其最优性不再保证,需依赖 EKF、UKF 等局部近似方法,或粒子滤波等非参数蒙特卡洛方法。
两者互补,但有严格适用边界。选择哪一种,取决于你的 Agent 面对的是语义离散的世界,还是物理连续的世界。例如,若你在做对话意图追踪且意图集合有限明确,HMM 类的离散化是自然起点;若你在做 IMU 姿态估计或机器人定位,LDS 及其非线性扩展才是正解。错配范式比不用状态估计更危险。
三条可落地的状态估计设计准则
理解 HMM 与 LDS 的真正价值,在于将其核心思想内化为 Agent 架构的设计准则,补全 Transformer 主导范式中被忽视的认知维度。
第一,区分观测记忆与信念记忆。当前许多 Agent 将长期记忆简化为向量检索或滑动窗口拼接,本质仍是观测级存储。受状态估计启发,信念记忆才是规划与推理的工作内存。对话 Agent 若缓存全部历史消息,本质仍是观测堆叠;不如维护关于用户意图、情绪和任务阶段的离散信念状态(类似 HMM 的离散化思想,但需注意对话意图常具开放性与组合结构)。具身导航 Agent 同理,与其保存原始点云序列,不如持续更新包含位置、地图不确定性的连续信念。
第二,让状态表示受环境结构约束。深度学习常让神经网络自由学习任意状态表示,容易导致缺乏可解释性或物理一致性。状态空间的结构应先验反映环境本质。若环境有明确语义分区,强制离散化是合理选择,但这并非 HMM 自动学习的能力,而是人为设定的抽象;若环境服从已知动力学,将线性或近线性动态作为结构先验嵌入网络(如 Deep Kalman Filter 或 SSM),能显著提升样本效率与泛化能力。状态表示虽可通过数据学习参数,但其结构应是对环境生成机制的有约束近似,而非完全无先验的黑箱向量。但这条原则在实践中有个麻烦:信念状态的可解释性与端到端性能往往此消彼长。强制离散化能让调试更直观,却可能损失连续动态中的细微模式;而让网络自由学习虽能捕捉复杂关系,又常导致状态空间难以解释、难与符号规划对接。我们至今没有好的办法同时拿到两者,只能在具体任务中做取舍。
第三,用信念质量指标补充任务成功率评估。Agent 可能在训练分布上表现良好,但内部状态估计完全错误,靠统计捷径而非真实理解完成任务。可发展的评估维度包括:信念校准度(预测不确定性是否匹配实际误差)、状态自洽性(滤波残差是否无规律,即无系统性未建模动态)、扰动鲁棒性(观测短暂缺失时信念是否合理衰减而非崩溃)。这些指标比端到端性能更能揭示 Agent 是否真正理解环境。
这些原则不替代 Transformer,而是为其提供认知骨架。
从记住文本到理解世界
HMM 和 LDS 最值得带走的不是数学形式,而是一个立场:理解序列就是理解生成序列的潜在过程。Transformer 让我们误以为“记住足够多的过去”就等于“理解了现在”,但 Agent 在真实环境中的挫败反复提醒我们,原始观测历史只是素材,从中提炼出的信念状态才是支撑推理的意义载体。在 POMDP 框架下,信念本身就是对历史的压缩充分统计量——既是记忆的高效形式,也是状态的动态估计。我们反对的不是记忆本身,而是将记忆等同于未加工的观测堆叠。
这意味着 Agent 研究焦点应从“预测下一个 token”转向“维持对世界的准确信念”。它要求我们在大语言模型之上或之内,重建负责状态估计的认知层——可以是显式概率滤波器,可以是内化为结构先验的状态空间架构,也可以是评估与训练的新标准。下一代 Agent 的竞争,可能不在于谁的上下文窗口更长,而在于谁的信念状态更准。