当大模型“忘记”中间内容时,我们在失去什么
当大模型“忘记”中间内容时,我们在失去什么
你一定遇到过这样的场景:把一份几十页的技术文档喂给大模型,开头和结尾它都能准确复述,但中间某个关键接口的参数定义却开始胡言乱语。即便上下文窗口扩到百万Token,“Lost in the Middle”依然顽固存在。
这并非单一机制所致。自回归架构的因果掩码偏置、训练中形成的U型位置注意力偏差、Attention Sink对首Token的过度依赖——三者叠加,导致中间区域的语义依赖在推断中被系统性弱化。概率图模型的独特价值,不在于解释这些偏置的成因,而在于它提供了一套结构化损失函数的设计语言,将分散的架构缺陷转化为统一的可优化目标。没有这套语言,修复手段只是孤立trick;有了它,我们才能系统推导、验证并组合这些手段。
本文用PGM的工程透镜重新审视大模型:长上下文依赖为何瓦解?推理路径如何诊断?更重要的是,这套设计语言能带来哪些有明确实现路径但需权衡代价的启示,以及哪些尚未成熟的研究方向。如果你也曾对着Attention Map皱眉,怀疑模型“看到了所有Token却没理解它们之间的关系”,这篇文章就是为你写的。
词嵌入:让动态图成为可能的工程使能器
传统PGM在语言任务前撞上了一堵墙:高维离散空间的相似度计算不可行。“汽车”和“轿车”在图中是两个完全独立的节点,要让模型知道它们语义相近,只能手动加边或依赖共现统计。词汇表扩大到十万级时,这种方式立刻崩溃——稀疏性让绝大多数节点对无连接,未见过的词组合概率归零。这正是关联规则时代的遗留病灶。
词嵌入的真正价值,在于它重构了图节点的语义空间。当每个词被映射到低维连续向量后,相似度通过向量距离隐式表达,不再依赖显式边或共现计数。即使“汽车”和“轿车”从未同现,只要上下文分布相似,向量就会自动靠近。图结构中的“潜在依赖”得以被数据驱动地推断出来。