技术栈
泛化能力
weixin_44021329
1 天前
深度学习
·
dropout
·
正则化
·
过拟合
·
泛化能力
深度学习正则化方法详解|Dropout / BN / L1&L2 正则
过拟合是深度学习训练中高频遇到的问题:模型在训练集效果很好,但在测试集泛化能力差。正则化就是一套抑制过拟合、提升模型泛化能力的技术。本文梳理三种最核心正则方案:Dropout、BN 批量归一化、L1/L2 范数惩罚,讲清原理、作用、区别、适用场景。
RedAnts110
4 个月前
泛化能力
·
复古大模型
·
预训练范式
·
数据迷信
1931年的大模型能写代码?GPT之父的“穿越“实验,撕开了AI界最大的谎言
摘要GPT之父Alec Radford团队用百年前的数据训练了一个130亿参数的"古董"大模型talkie-1930-13b。这个从未见过计算机的模型,仅用250个样本微调后就能为现代Python库打补丁,在SWE-bench基准达到4.5%通过率,与"吃下整个互联网"的现代模型仅差1个百分点。这场"穿越"实验揭示了一个惊人真相:大模型的能力,或许根本不是来自海量数据,而是来自某种更深层的东西。
具身智能之心
9 个月前
具身智能
·
泛化能力
NeurIPS‘25 | 港大×达摩院HiMaCon:泛化失败不在于策略学习不足,而在于缺乏“操作概念“
论文标题:HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data
我是有底线的