" 博士学位论文激励计划 "(原优秀博士学位论文奖)是对博士研究生学位论文的一项重大奖励,由各大学会通过严格评选后颁布。中国计算机学会、中国自动化学会、中国人工智能学会等各大学会每年都会颁布该奖项。该奖项的目的是促进学术研究的卓越性,并鼓励产出高质量的博士论文。博士研究生如果能够荣获该奖项,则表明其学术研究生涯早期的成果受到了很高的认可。
本文主要介绍优秀博士学位论文《神经符号系统的非确定性管理研究》。作者为南京大学计算机科学与技术专业李泽南,指导教师为吕建教授、马晓星教授。该论文聚焦于神经符号系统走向工程化应用的核心瓶颈,如何有效管理神经网络部件固有的非确定性。论文从软件工程的独特视角出发,以三种不同的神经符号系统构造技术范式为背景,围绕非确定性的刻画、控制与消解三个层面,系统构建了神经符号系统的非确定性管理理论与方法体系,有效推动了神经符号融合与可信软件自动化的发展。
本文的作者为王一鸣,审校为龚裕涛,黄忠祥。
一、论文介绍
1.1 背景与挑战
如何有效地结合连接主义的神经网络模型与符号主义的形式逻辑推理,是人工智能乃至整个计算机科学的重要问题之一。神经符号系统通过基于神经网络的预测与基于符号规则的演绎,分别模拟了丹尼尔·卡尼曼教授所述的人类两种推理模式,即基于归纳的、不确定的快速"系统1"推理,以及基于逻辑的、精确的缓慢"系统2"推理,旨在结合两种模式的优势,提升整体系统的处理能力、可信程度与执行效率。
然而从软件工程的角度看,传统软件的复杂性应对方法都基于软件组件原则上可以自由复用、无限组合的能力之上。然而神经符号系统在拓展了处理高维对象与不确定问题能力的同时,其神经网络部件固有的非确定性也动摇了传统软件工程应对系统复杂性的基础。妥善解决这一问题是推动神经符号系统走向工程化应用的关键。具体而言,论文提出三大挑战。
其一,神经网络部件无法像传统软件那样提供确定且独立于部署环境的规约,使得经典的软件测试、调试与回归等质量保障技术在概念层面失去适用基础。
其二,神经网络模块与符号推理模块组合训练时极易引发模式崩塌与推理捷径问题,其根源在于缺乏有效的非确定性控制。
其三,数据驱动的学习范式难以从根本上消除非确定性,无法满足高安全场景对可信输出的严格要求。
为了解决这些挑战,论文以非确定性管理为核心研究问题,在以下几个方面实现了突破。
( 1 )非确定性刻画方法的建立:论文率先指出神经网络部件无法提供确定性规约这一根本问题,提出针对具体操作部署场景的非确定性刻画方法,并据此构建了面向非确定性的质量保障技术体系。
( 2 )非确定性控制策略的提出:针对端到端神经符号学习中的模式崩塌问题,论文将其建模为双层博弈优化问题,通过信息熵正则化实现训练过程中的非确定性控制,有效避免了推理捷径。
( 3 )非确定性消解范式的探索:论文提出了通过非确定的神经符号系统生成可被自动验证的确定性符号内容的新范式,结合大语言模型与自动定理证明器,实现了完全可验证的数学推理。
1.2 方法
本文以非确定性管理为理论主线,沿三种不同的神经符号系统构造范式层层递进地展开研究。第一部分为神经网络模型质量保障研究篇,聚焦于非确定性的精确刻画。第二部分为"端到端"神经符号学习研究篇,聚焦于非确定性的有效控制。第三部分为可信符号内容生成研究篇,聚焦于非确定性的可靠消解。
( 1 ) 神经网络模型质量保障- 非确定性刻画
针对神经网络模型在具体部署场景下的准确率评估问题,论文借鉴传统软件结构覆盖率的同质性与多样性理念,提出利用模型表示空间对输入空间进行聚类划分,并设计了一种基于方差约减的条件采样策略(CAE)。如图1所示,该方法通过估计各聚类的条件方差,迭代式地选择最具代表性的样本进行标注,从而在极有限的标注预算下精确估计模型的操作域准确率。

图1 操作域准确率估计算法
针对领域迁移导致的模型信心失准问题,论文提出了一种基于高斯过程的贝叶斯信心校准方法(GPC)。如图2所示,该方法利用高斯核函数刻画样本在表示空间中分类正确性的局部相关性,在各聚类内建立高斯过程模型以估计信心误差的概率分布,并基于预测方差指导样本标注选择,有效校准了模型在操作域上的预测信心。

图2 操作域信心校准算法
针对模型升级中的回归错误问题,作者将预测误差分解为两层不确定性,通过方差估计即图3所示的算法,以及通过温度缩放技术即图4所示的算法,对齐新旧模型的非确定性,实现帕累托改进,即不牺牲新模型准确率的前提下显著减少回归错误。

图3 通过方差估计减少回归错误算法

图4 通过温度缩放减少回归错误算法
( 2 ) 端到端神经符号学习- 非确定性控制
针对训练中易陷入"推理捷径"即模型学得符合约束但非预期的符号接地的问题,作者将神经符号学习建模为双层优化问题。对模糊逻辑方法引入对偶变量梯度上升,而对模型计数方法引入玻尔兹曼分布模拟退火,通过熵正则化有效控制训练过程,避免模式崩塌。
接下来,为实现神经网络与符号模块的端到端协同训练,作者采用基数约束表示逻辑规则,将符号约束的搜索转化为可微的优化问题,并通过差分凸规划的逐次凸逼近实现布尔约束的可微化,如图5所示。结合信赖域修正技术防止约束退化,论文设计了一种非零和博弈框架来建模两个模块的协同训练过程,实现了真正意义上的"端到端"神经符号学习。

图5 可微约束合成算法
( 3 ) 可信符号内容生成- 非确定性消解
针对大语言模型缺乏严格逻辑推理能力的问题,作者以数学定理证明为应用场景,设计了两类神经符号框架。
其一是基于"符号等价性"与"语义一致性"的自动形式化框架,如图6所示。该框架利用定理证明器识别候选形式化结果之间的逻辑同质性,通过逆形式化评估语义一致性,选择最优候选。

图6 自然语言数学题的自动形式化框架
其二是针对竞赛级不等式题目的神经符号框架LIPS(LLM-based inequality prover with symbolic reasoning),如图7所示。该框架将大语言模型的数学直觉与符号方法编码的领域特定技巧相结合,即符号方法处理"放缩"等需要精准公式推导的步骤,而大语言模型则处理"等价变换"等需要数学直觉的步骤,并结合符号规则对中间证明目标进行修剪和排序。该框架在了在161个竞赛级不等式上评估,达到国际奥林匹克竞赛金牌水平,显著优于现有大语言模型和符号方法,且无需额外训练数据。

图7 神经符号不等式证明器LIPS框架
1.3 实验结果
该研究在大量仿真数据集和真实数据集上进行了广泛的实验验证。
在神经网络模型质量保障篇中,研究人员在涵盖图像识别与自然语言处理、不同操作域规模、不同分类难度与不同模型复杂度的六个任务上进行了验证。结果表明,条件采样方法CAE相比简单随机采样可节约32.9%--64.6%的样本标注成本,且远优于基于置信度和基于惊讶充分性的分层采样方法。高斯过程校准方法GPC在全部六个任务上均取得最优的得分,可避免约一半的信心损失,仅使用10%操作域样本即可消除71%--97%的高置信度错误预测。在模型升级的六个任务上,温度缩放方法在完全不牺牲准确率的情况下,平均减少48.1%的回归错误,且仅需极少量的无标签数据即可收敛。
在"端到端"神经符号学习篇中,所提方法在手写数字识别任务中以98.8%的准确率正确学得逻辑规则约束,而现有方法均陷入推理捷径。在手写公式识别任务中取得98.6%的符号准确率与90.7%的计算准确率,显著优于MAPO、NGS等基线。在视觉数独任务中以500个训练样本即达到95.4%的准确率,展现出极高的样本效率。在链式XOR、Nonogram等符号推理任务上亦大幅领先SATNet等已有方法。
在大语言模型可信符号内容生成篇中,所构建的神经符号系统能够解决高中竞赛级数学问题,并在多个数学竞赛的161个具有挑战性的不等式题目上取得最先进的性能,在特定领域如不等式证明,达到国际奥林匹克竞赛金牌水平,且无需额外的训练数据。
1.4 结论
尽管神经符号系统被视为迈向下一代人工智能的必经之路,但神经网络固有的非确定性动摇了传统软件工程应对系统复杂性的基础,制约了神经符号系统的工程化应用。为解决这一问题,论文以非确定性管理为核心,从神经网络模型质量保障、"端到端"神经符号学习、大语言模型可信符号内容生成三个层面开展系统研究,在非确定性的刻画、控制与消解三个方面均取得了创新性突破。
论文的三个部分彼此互为基础和应用验证,有机衔接,共同为神经符号系统的非确定性管理构建了系统完整的理论与方法体系,为推动可信软件自动化与神经符号融合技术的实用化奠定了坚实的基础。
二、作者简介
李泽南,在南京大学先后获得软件工程硕士学位和计算机科学博士学位,博士期间师从马晓星教授和吕建教授。研究方向集中在神经符号人工智能、定理证明、数学推理和形式化验证。
个人主页:https://lizn-zn.github.io/#homepage
三、导师简介
1. 吕建,计算机软件专家、南京大学教授,中国科学院院士。主要从事软件方法学研究,研究方向包括软件基础理论与方法、网构软件方法学和新型软件平台及其应用。
2. 马晓星,南京大学计算机科学与技术系教授,南京大学计算机软件研究所副所长,主要从事计算机软件技术研究,研究方向包括智能软件工程、自适应软件系统、人机物融合软件系统等。