【论文阅读】Explainable Early Stopping for Action Unit Recognition

在训练深度神经网络(DNN)时,避免过拟合的常见技术是在专用的验证数据分区上监控性能,并在性能饱和时停止训练。这种方法只关注模型的行为,而完全忽略了模型内部发生了什么。

在本文中,我们使用代数拓扑来分析DNN在训练AU识别时的功能图的拓扑结构。我们将标准的带耐心的早期停止(ESP)1与迄今为止提出的仅有的两种基于拓扑的早期停止算法进行比较,即拓扑早期停止(TES)3和通过神经持久性实现的早期停止(ESNP)17

拓扑早期停止(TES)3和通过神经持久性实现的早期停止(ESNP)17。两者都使用代数拓扑(更具体地说是持久同调)来计算所谓的贝蒂数曲线,该曲线在基于分析网络定义的拓扑空间中计算不同尺度上的空腔数量。在训练期间的每个周期中计算这种网络拓扑度量,并用作早期停止的标准。ESNP计算贝蒂数曲线的积分,并在它饱和时停止。另一方面,TES观察贝蒂数曲线峰值的密度,并在它开始向更高密度方向后退时停止。

3 Ciprian A Corneanu, Meysam Madadi, Sergio Escalera, and Aleix MMartinez. What does it mean to learn in deep networks? and, how does one detect adversarial attacks? In Proceedings ofthe IEEE Conference on Computer Vision and Pattern Recognition, pages 4757--4766, 2019.

17 Bastian Rieck, Matteo Togninalli, Christian Bock, Michael Moor, MaxHorn, Thomas Gumbsch, and Karsten Borgwardt. Neural persistence:A complexity measure for deep neural networks using algebraic topology. arXiv preprint arXiv:1812.09764, 2018.

常规方法,计算两个神经元之间相关性,构造PD

DNN中的泛化学习通过在功能拓扑中创建一维、二维和三维空腔来定义,并且这些空腔从更高密度向更低密度移动3。过拟合表现为这些空腔在功能二元图中向更高密度回归。这一通用原则如图2(b)所示,是拓扑早期停止(TES)标准3的基础。在这里,我们将这一分析扩展到对象识别和标准网络架构之外

相关推荐
m4Rk_1 天前
【论文阅读】Agent 记忆机制(27):MemRefine——用 LLM 事实判断将长期记忆压缩到固定预算
论文阅读·人工智能·学习
DuHz2 天前
论文解读:用于数据分析的极值点对称模态分解方法 (Extreme-point Symmetric Mode Decomposition,ESMD)
论文阅读·算法·信息与通信·信号处理
EQUINOX12 天前
GPT1-GPT3技术综述
论文阅读·人工智能·python·深度学习·gpt-3
m4Rk_2 天前
【论文阅读】Agent 记忆机制(26):Infini Memory——将长期记忆维护成可读写的主题文档
论文阅读·人工智能·学习·开源·github
chnyi6_ya3 天前
论文阅读笔记 | The Script is All You Need: 对话到电影级视频生成的 Agentic 框架
论文阅读·笔记
iiiiii113 天前
【论文阅读笔记】Reparameterization Proximal Policy Optimization (RPO):将PPO的稳定性引入可微分强化学习
论文阅读·人工智能·笔记·深度学习·机器学习·机器人·具身智能
实验如有神祝女士4 天前
不同参数规模大模型在医学翻译场景的适配差异
论文阅读·人工智能·深度学习·学习·算法·语言模型·论文笔记
IT阿瑞4 天前
学术论文 PDF 翻译:双栏、公式、图注的三个处理难点
论文阅读·人工智能·ai
chnyi6_ya5 天前
论文阅读笔记 | One Sentence, One Drama: 基于多智能体系统的个性化短剧生成
论文阅读·笔记
小马哥crazymxm5 天前
Arxiv论文周选 (2026-W28)
论文阅读·人工智能·科技