Transformer思想根源PDP:Parallel Distributed Processing读书笔记

真理总是简单又朴素

一、Parallel Distributed Processing

In the examples we have considered, a number of different pieces of information must be kept in mind at once. Each plays a part , constraining others and being constrained by them. What kinds of mechanisms seem well suited to these task demands? Intuitively, these tasks seem to require mechanisms in which each aspect of the information in the situation can act on other aspects, simultaneously influencing other aspects and being influenced by them. To articulate these intuitions, we and others have turned to a class of models we call Parallel Distributed Processing (PDP) models. These models assume that information processing takes place through the interactions of a large number of simple processing elements called units , each sending excitatory and inhibitory signals to other units.

在论文之前的例子中已经提到过,信息的不同片段在同一时刻需要同时存在大脑中,每个部分之间互相约束,同时作用,这种就是平行分布处理,这些模型认为,信息处理是通过简单处理单元之间的相互作用来完成的,每个单元都会向其他单元发送兴奋或者抑制信号。

认知过程本身就是大量信息互相约束的过程!

这段是PDP的思想的提出,第一次提出unit的含义,同时又告诉我们,unit 的含义是不固定的,不同模型里的unit可以表示完全不同层次的信息。

In stilI other cases, units stand not for particular hypotheses or goals , but for aspects of these things. Thus a hypothesis about the identity of a word, for example, is itself distributed in the activations of a large number of units.

最重要的是这句,unit不表示完整概念,而表示概念的一部分,这是后来深度学习最重要的思想。例如单词Dog,Dog不是一个节点,而是被分散到很多unit上的,例如unit1,unit2,unii3...,每个unit的激活值为0.7,0.2,0.3...,这整个模式才表示Dog,这个叫分布式表示。

认知,记忆,语言,推理,不一定存储再单个符号节点种,而可以存储在大量简单单元形成的分布式表示里。

二、认知上层是串行,底层是并行

人类思考的过程是,认知层(你感受到的),到想法A,到想法B,到想法 ,整个过程是串行状态的转换,但是在底层,10完个神经元同时计算,收敛,形成状态A,再次并行计算,收敛,形成状态B。

结论:人类思维看起来像一个一个符号状态在变化,但这些状态很可能是大量神经元并行相互作用后产生的"涌现结果",而不是大脑内部真的存在一个逐条执行规则的符号程序。

三、概念、规则等是神经元活动涌现出来的宏观现象

微观结构:在PDP中指神经元、激活值、连接权重、并行传播,例如10000个unit相互连接,激活不断变化

宏观结构:例如记忆,概念,规则,推理,语法,目标。传统认知科学研究的是宏观层,人如何推理,人如何记忆,人如何学习规则,PDP认为,这些现象,可能都来自更底层的机制,所以必须研究微观结构,因为,宏观认知模型中的各种对象,其实只是微观结果涌现性质的近似描述。

有时候,这种由底层神经元涌现的近似描述可以很充足且准确的描述一宏观过程,或者一个 宏观机制,但是有时候这种近似描述会失败,因为认知具有灵活性,泛化能力,开发性。

四、交互激活模式

在PDP模型里面,每个unit单元都有一个激活值,这个激活值大致表示,该单元所代表的事物出现在当前感知输入中的可能程度。激活值不是独立存在的,不同假设之间会相互影响,如果两个假设彼此一致,那么它们应该相互支持,相互激活。如果两个假设相互矛盾,那么它们应该削弱彼此。

五、PDP知识存储

在PDP中,直接被存储的是单元强度,这些强度可以重新生成模式,在PDP中,记忆不是被存储在某个神经元里,而是分布在整个网络的连接权重之中,神经元只是访问这些记忆模式的入口,而不是记忆本身存储的位置。

六、分布式表征

知识不是存储在某个专门用于某个模式的单元的连接里,而是分布在大量单元之间的连接中,即分布式表征。在分布式连接模型中,单个神经元不再承接固定意义,真正的知识体现在多个单元的联合激活模式中,而学习的目标就是调整连接权重,使得在特定输入条件下,能够稳定地激活正确的模式。

相关推荐
镜象科技2 小时前
AI情感大模型应用场景全解:从校园到医院再到企业的落地地图
人工智能
Joshua-a3 小时前
工程数学-理解卷积的含义_线性时不变系统的冲激响应与卷积
人工智能·深度学习
song5013 小时前
React Native for OpenHarmony 实战:三方库 react-native-css-transformer 的鸿蒙化适配指南
css·人工智能·深度学习·react native·transformer
老金带你玩AI7 小时前
ChatGPT dots,到底能替你操多少心?
人工智能
AliCloudROS8 小时前
计算巢 X DeepSeek Harness — 云端智能体工作台
人工智能·阿里云
深蓝AI8 小时前
GitHub的Push一年涨4.9倍:AI Agent为什么逼它重做Git存储?
人工智能·github
stereohomology9 小时前
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览
人工智能·llm
运维行者_9 小时前
网络性能监控怎么做?从自动发现到根因分析的4个环节
运维·服务器·网络·人工智能·支持向量机
Su米苏9 小时前
Spring AI 中MCP 与普通 @Tool的区别
java·人工智能·spring
美狐美颜sdk9 小时前
直播APP源码可以直接接入视频美颜sdk吗?技术方案详解
android·人工智能·音视频·美颜sdk·直播美颜sdk