炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
这项由耶鲁大学主导的研究以预印本形式发布于2026年7月,论文编号为arXiv:2607.17674,有兴趣深入了解的读者可通过这一编号在arXiv平台查询完整论文。
当你向一个聪明的朋友请教数学题时,他可能会用代入法,也可能用画图法,还可能用反证法——每次给出的路子都不一样,却都能解出正确答案。现在的大型语言模型(也就是那些能和你对话的AI,比如ChatGPT背后的技术)其实也有类似的能力:它们在解决同一道问题时,内部其实悄悄掌握着好几种不同的策略,只是这些策略被混在一起,外人看不出来,连AI自己也无法明确"选择"某种策略。
耶鲁大学的研究团队提出了一个很有意思的问题:能不能给这个"黑盒子"动一场手术,把里面那些隐藏的解题策略一一"解剖"出来,贴上标签,然后在需要的时候按需调用?这听起来像是一个很酷的想法,但实现起来却遇到了一个出人意料的棘手难题。研究团队最终开发出了一套全新的训练方法,成功让AI模型把隐藏的策略"显形",并且验证了这套方法在多个算法任务上的有效性。
一、为什么AI的策略是"隐形"的,这又有什么问题?
以证明"偶数的平方还是偶数"这道数学题为例。一个训练过的语言模型可能会用归纳法写出证明,也可能用反证法,还可能用代入字母直接推导。这三种方式在数学上都是正确的,但思路完全不同。然而,从外面看这个AI模型,你只会看到它随机地、混乱地混合使用这些策略,每次生成的答案用的是哪种路子,完全取决于它"当时的心情",没有任何显式的开关让你控制。
更深的问题在于,这种混乱并不只是表面现象。语言模型在内部存储策略的方式,就像一锅杂烩汤——鸡肉、蔬菜、调料全都搅在一起,你没有办法只舀出鸡肉,也没有办法调大某种调料的比例。研究团队把这个现象叫做"策略的隐式纠缠"。
这个问题的后果是实际的。比如,如果你想让AI专门用某种更高效的策略来解决某类问题,你做不到——因为你无法直接"拨动"策略开关。再比如,研究人员想要理解AI是否真的"会"某种方法,而不只是碰巧输出了看起来像那种方法的文字,也很难区分。在AI安全领域,如果某些推理路径存在潜在风险,你也没有简单的方式把它们单独识别出来并加以限制。
正因为此,研究团队希望给语言模型配一个"策略调色板"——一个显式的变量,能够代表"现在用哪种策略",并且在使用时能够稳定地、跨问题地保持同一种含义。
二、把策略"解剖"出来,数学上该怎么表达?
研究团队把这个任务形式化为一个数学问题。他们用pθ(y|x)来表示一个已经训练好的语言模型的"回答分布"——给定问题x,模型生成回答y的概率。目标是把这个混杂的分布"分解"成两个部分。
第一部分叫"路由器",它负责读取问题,然后给出一个隐变量z的分布——你可以把z理解为"策略编号",就像调色板上的颜色编号。第二部分叫"生成器",它接受问题和策略编号,然后生成对应策略下的回答。这两部分合在一起,叫做"路由器-生成器分解"。
整个框架的核心要求有两点。第一,分解之后的模型,如果你对所有可能的策略求平均,得到的回答分布应该和原来的模型几乎一样——换句话说,不能为了分解策略而改变AI的实际行为。第二,这个策略变量z必须是"真正有用"的:改变z应该真的改变生成器用的策略,而且同一个z值,不管用在哪道题上,都应该代表同一种策略。
第二个要求比听起来要苛刻得多。研究团队区分了两种不同的对齐程度:一种叫"局部策略分离",意思是对于同一道题,不同的z值能让AI用不同的策略;另一种叫"跨输入语义一致性",意思是同一个z值,用在不同的题目上,产生的都是同一种策略。后者才是真正意义上的"策略变量",前者只能算是"题目专属的回答索引"。研究团队把跨输入语义一致性称为"类比一致性",并把它作为主要的评估指标。
三、最直觉的方法为什么会失败?
看到这个问题,你可能会想:机器学习里有一个成熟的技术叫"变分自编码器"(VAE),不就是专门用来学习隐变量的吗?直接套用不就行了?
研究团队详细分析了这条路,并指出它在这里会彻底失败,而且失败的方式非常微妙。
传统VAE的做法是用一个叫"证据下界"(ELBO)的损失函数来训练模型:既要让模型生成的内容和训练数据匹配,又要让隐变量的分布保持合理。在传统场景下,这个方法很有效,因为模型一开始什么都不会,必须依靠隐变量来理解数据。
但在这里,情况完全不同。这次的"生成器"是从一个已经训练好的大型语言模型初始化的,而这个原始模型已经能够完美地回答各种问题——根本不需要任何策略变量的帮助。这就像让一个已经把所有食谱都背下来的厨师,再去学习"先放盐还是先放油"的标签系统。这位厨师会想:我已经知道怎么做菜了,何必去理会这个标签系统?于是他直接无视标签,继续用自己的方式做菜,而损失函数也无法察觉任何问题——因为菜做出来还是那么好吃。
在数学上,这叫做"潜在变量坍塌"(posterior collapse):模型学会了对所有的z值都输出相同的回答,等于彻底忽略了策略变量。标准的ELBO损失对此毫无惩罚,因为它只关心最终的回答分布是否正确,而不关心z是否真的被用上了。
研究团队通过实验证实了这一点(见原论文图3):用标准变分训练,模型的回答质量(分布忠实度)确实稳步上升,但策略对齐程度始终接近零,同时后验分布和先验分布之间的KL散度也迅速坍塌,意味着z携带的信息量越来越少。简单说,模型变得越来越会回答问题,但策略变量彻底变成了摆设。
四、研究团队的解法:让原始模型"监督"自己
面对这个棘手的问题,研究团队提出了一个精妙的思路:与其让模型从零开始学习"什么是有用的",不如让原始模型充当一个"参照系",告诉训练过程:哪些地方是策略选择真正发生的地方,那些地方才是策略变量应该着力解释的地方。
这个思路叫做"模型导向的重建压力"。具体来说,研究团队的方法有两个相互配合的核心机制。
第一个机制是"全局归一化"。标准的训练损失是用绝对的负对数概率来衡量重建质量,但在这里,重建损失被除以了原始模型本身的平均损失。这意味着训练目标变成了:在原始模型已经能解释的基础上,策略变量还能额外解释多少比例的不确定性?这就像衡量一个新助手的价值,不是看他完成了多少工作,而是看他在已有员工基础上新贡献了多少。
第二个机制更加精妙,叫做"词元级惊异度加权"。在生成一段回答时,不是每个词的预测都同等重要。有些词在给定上下文后几乎是必然的,比如数学推导的第一步写"设n为偶数"之后,下一个词几乎肯定是"则";但有些词是真正的"分叉点",比如在第一步之后,接下来是用归纳法还是直接代入,就是一个真正的策略选择。
研究团队发现,这些"分叉点"恰好对应着原始模型不确定性最高的位置——用原始模型来预测这些词时,损失特别大,说明原始模型在这里"看到"了多种可能性。于是,研究团队把重建损失集中在这些高惊异度的位置上,用一个可调节的权重参数γ控制集中程度。这样,策略变量就被迫去解释那些"真正难以预测"的词,而这些词正好是策略选择发生的地方。
这个设计有一个数学上的优雅之处:当生成器完全复制原始模型的行为(即z完全没用)时,归一化后的重建损失恰好等于1。这意味着训练目标可以被解读为"策略变量解释了多少比例的原始模型损失",相当于一个分数型的信息增益指标,而不是绝对的损失值。
五、怎么验证这套方法真的有效?
研究团队设计了一个专门的"多策略算法基准测试",包含六类任务,每类任务都有多种合法的解题步骤。这六类任务分别是:列表求和(可以从左到右加,也可以配对相加)、排序算法(冒泡、插入、归并等)、网格路径规划(先右再下、先下再右、交替等)、线性方程求解(先减后除、先除后减等)、进制转换(反复除法、分解法等)以及多位数加法(从右到左进位、从左到右部分求和等)。
每个任务生成的数据都包含问题、解题过程和对应的"参考策略标签"。关键的一点是,这些策略标签在训练期间被完全隐藏,只在评估阶段才被用来检验策略变量是否真的对应了正确的策略。这就像考试时老师不告诉你标准答案是什么,等你做完后再对照检验。
实验分两个阶段:先用基准测试数据训练一个语言模型(作为"基础模型"pθ),再在这个固定的基础模型上训练路由器-生成器分解框架。训练时只用基础模型生成的样本,不用任何策略标签。
评估时,研究团队用两个主要指标衡量分解的质量。一个是"分布忠实度",衡量分解后的模型是否还能生成正确的解题过程,不能因为分解而破坏了AI的基本能力。另一个是"策略对齐度",用"类比一致性"来量化:从一道题中采样策略变量z,然后把同样的z用到另一道题上,生成的回答是否用了同一种策略?如果是,就说明z真的携带了跨问题的策略语义。
六、实验结果:策略信息本来就在那里,只是需要"解锁"
实验结果从几个角度给出了清晰的图景。
首先,研究团队在训练任何分解框架之前,先用一个简单的线性探针(就是一个很浅的分类器)来检验:原始模型的内部表示里,策略信息存在吗?答案是肯定的(原论文图5)。在大多数任务上,策略标签都可以从原始模型的隐藏状态中高精度地被解码出来,尤其是在解题过程中策略特征最明显的位置。这说明目标结构确实存在于基础模型中,只是没有被显式暴露出来。
接下来是方法对比。研究团队在Qwen2.5这个开源语言模型的0.5B和1.5B两个版本上进行了测试,对比了标准ELBO训练、β-ELBO变体(给KL项加权的改进版本),以及他们提出的各个变体:只有全局归一化的版本、只有高惊异度词元加权的版本、两者结合的版本,以及作为对照的低惊异度词元加权版本。
结果非常清晰(原论文图6):标准ELBO和β-ELBO两种变分训练方法,分布忠实度都很高,但策略对齐度几乎停留在较低水平,验证了前面分析的潜在变量坍塌问题。相比之下,研究团队提出的模型导向重建方法(全局归一化加上高惊异度加权)在保持高分布忠实度的同时,策略对齐度显著更高。特别能说明问题的是那个"反向对照"实验:把高惊异度加权换成低惊异度加权(即重点关注那些原始模型已经很确定的词),策略对齐度明显下降,进一步证实了"让z解释策略选择的分叉点"这一设计思路的有效性。
从潜在变量的几何结构来看(原论文图7和图9),训练过程中,所有任务的策略变量从一开始的混沌云团,逐渐分离成按任务和策略有组织的区域,非常直观地展示了策略结构被"解锁"的过程。
研究团队还发现了一个有趣的现象:在多任务设置下,同一个潜在空间区域对不同任务可能代表不同的策略——也就是说,策略变量的含义是任务条件化的,而不是一个全局统一的策略词典。这在直觉上也说得通:排序任务的"策略1"和方程求解任务的"策略1"本来就是不同的东西,但在同一类任务内部,策略语义是稳定一致的。
七、理论保证:什么条件下这套方法一定会找到正确策略?
除了实验验证,研究团队还给出了一套理论分析,试图回答一个更根本的问题:在什么数学条件下,这个训练框架能够在理论上保证找到与目标策略对齐的分解?
理论分析的核心思路是这样的。研究团队把整个变分训练目标拆解成几个有明确含义的部分:第一部分是不可约的条件熵(这是无论如何都无法降低的信息量);第二部分是策略变量z和回答y之间的条件互信息(即z解释了多少关于y的额外信息);第三部分是生成器和路由器的拟合误差;第四部分是一个惩罚复杂分解方式的正则项。
通过数学推导,他们证明:最小化整个训练损失,等价于在给定编码器时,找到让"条件互信息减去拟合复杂度"这个分数最大化的编码器。这个"剖面分数"的意义在于:一个好的编码器不只是要让z包含很多关于y的信息(这很容易用表面特征实现),还要让对应的路由器-生成器分解足够简单,能够被已有的模型架构有效表示。
在这个框架下,研究团队证明了:如果目标策略(参考策略)对应的分解比所有"坏的"分解都更简单(即有更低的"剖面复杂度"),并且这个优势超过了坏分解可能具有的信息量优势,那么训练过程在理论上会收敛到与目标策略对齐的解。他们还区分了"弱恢复"(对每道具体的题能区分策略)和"强恢复"(跨题目的z语义也一致)两个层次,并指出强恢复需要额外的条件:模型类别或复杂度惩罚必须偏好全局一致的标签系统,而不只是每题局部一致就够了。
理论部分还给出了有限样本的收敛速率:当样本量n与策略变量的"恢复难度"(由所谓的"剖面分数差距"量化)的平方成反比时,经验损失的最小值点也会以高概率接近正确的策略分解。这给实际应用提供了一定的理论背书,尽管研究团队也坦承,理论和实际训练动力学之间的精确联系还需要进一步研究。
八、更广泛的意义:这套方法能用在哪里?
研究团队在论文中讨论了这项研究的几个潜在应用方向。
在可解释性方面,策略对齐的分解提供了一种比逐词分析更高层次的模型行为描述方式。通过检查路由器在不同问题上的输出分布,研究人员可以了解模型在面对某类问题时"偏向"使用哪些策略,以及这些策略在模型规模或训练数据变化后如何演变。
在可控性方面,一旦有了显式的策略变量,就可以在生成时直接"调节"策略选择,而不需要重新训练整个模型。比如,如果你发现对于某类数学题,归纳法比直接代入法更可靠,就可以直接"锁定"对应的z值,让模型专门用归纳法生成回答。
在强化学习后训练(RLVR)方面,研究团队指出,目前常见的后训练方法(用奖励信号优化模型)有一个公认的局限:它倾向于把已经擅长的策略做得更好,而不会主动探索模型目前还不常用的策略。有了策略变量,就可以在强化学习阶段有目的地从各种策略中采样,覆盖更广泛的解题空间,有助于发现和强化那些原本被"压制"在分布尾部的优秀策略。
在安全性方面,策略层面的控制提供了比词元层面更有可解释性的干预接口。如果某些推理路径存在风险,可以通过调整策略分布来降低其使用概率,而不需要直接干涉模型的底层参数。
当然,研究团队也明确指出了这项研究的局限性。目前所有实验都在人工设计的算法任务上进行,这些任务的策略是明确定义的,可以通过程序解析验证。在更开放的自然语言推理场景下,什么算"一种策略"本身就是一个模糊的问题,如何评估策略对齐度也还没有好的答案。此外,理论分析仍然处于初步阶段,很多实际训练中观察到的现象还缺乏严格的理论解释。
说到底,这项研究干了一件相当有意思的事情:它证明了,那些看起来随机混乱的AI回答背后,其实存在着有组织的策略结构,并且这种结构可以被系统化地"解锁"出来——只要用正确的训练信号告诉模型"这些策略分叉点才是你该关注的地方"。更重要的是,这套方法不需要任何人工标注的策略标签,完全依靠原始模型自身的不确定性模式来引导学习过程。
这对普通用户意味着什么?短期内,你可能不会直接感受到这项研究的影响。但从稍长的时间线来看,这类研究是让AI系统变得更透明、更可控的基础性工作。当你未来使用某个AI助手,并且能够明确告诉它"用这种方法"而不只是期待它随机碰运气时,背后可能正是这类研究的积累在发挥作用。
有兴趣深入了解的读者,可以通过arXiv:2607.17674查阅这篇论文的完整版本,其中包含详细的实验设置、数学推导以及丰富的可视化结果。
Q&A
Q1:语言模型的"策略纠缠"问题是什么意思,会带来什么实际影响?
A:语言模型在解答同一类问题时,内部其实掌握了多种不同的解题路径,比如数学证明中的归纳法、反证法、代入法等。但这些策略全都混合存储在模型参数里,没有明确的标识。这导致模型每次选择用哪种策略基本是随机的,用户无法主动控制,研究者也很难判断模型是否真的"理解"某种方法,还是只是表面上输出了看起来像那种方法的文字。
Q2:变分自编码器方法用在语言模型策略分解上为什么会失败?
A:传统变分自编码器训练的核心假设是:模型一开始什么都不会,必须借助隐变量才能学会生成数据。但这里的语言模型已经预训练过了,不需要策略变量就能给出完美回答。因此,模型会直接忽略策略变量,对所有策略值都给出相同的回答,策略变量变成了摆设。标准的损失函数无法惩罚这种行为,因为它只检查最终输出是否正确,不关心策略变量是否真正被使用。
Q3:耶鲁大学的多策略算法基准测试包含哪些任务,为什么需要这类基准?
A:该基准包含六类任务:列表求和、排序算法、网格路径规划、线性方程求解、进制转换和多位数加法。每类任务都有多种合法的解题步骤,并带有隐藏的参考策略标签。之所以需要这类基准,是因为在开放性语言任务中,"什么是一种策略"本身就很模糊,也难以自动验证。算法任务的解题步骤可以被程序精确解析,研究者可以直接检查AI生成的解题过程属于哪种策略,从而客观衡量策略变量是否真正对齐了真实策略。
上一篇:香港宏福苑火灾跨部门调查最终报告:大火或由烟头引起,而易燃物加剧了火势蔓延
下一篇:没有了