【2】大语言模型基础认知

深度塌陷:何凯明 残差连接

监督学习:标注数据,学习特征判断标签

非监督学习:非标注数据(可能是残缺的数据,缺少中间一段问题、图片遮盖住了一部分等)

强化学习:对行为进行约束或者增强时,采用强化学习(正反馈和负反馈机制)

对比维度 监督学习 非监督学习
数据类型 带标签 (Labeled) 无标签 (Unlabeled)
学习目标 预测未知数据的标签/数值 发现数据的内在结构和模式
反馈机制 有直接反馈(预测对错可知) 无直接反馈(需人工评估)
典型任务 分类、回归 聚类、降维、关联规则
数据成本 高(需人工标注) 低(仅需收集数据)
应用场景 垃圾邮件过滤、语音识别 客户分群、推荐系统、数据压缩

神经网络:分层的信息处理,深度只代表不同的维度。例如:【1,2,3,4,5,6】层次:数量、等差序列、

统计量【min,max,avg...】、下一组数据可能是【7,8,9...】等。

对比维度 传统神经网络 (如 CNN/RNN) Transformer
核心优点 1. 局部特征提取强 :CNN 在图像等网格数据上表现卓越,能高效捕捉空间局部模式。 2. 序列建模有记忆 :RNN/LSTM 具备内在的时序记忆机制,适合短序列或流式数据处理。 3. 资源相对友好:参数量和计算复杂度通常低于同规模的 Transformer,推理部署门槛较低。 1. 全局依赖捕捉 :自注意力机制能直接建模任意两个位置的关系,彻底解决长距离依赖问题。 2. 高度并行化 :无需像 RNN 那样逐步处理,可一次性处理整个序列,训练效率极高。 3. 架构通用性强:同一套架构可无缝迁移至文本、图像、音频、视频等多模态任务,泛化能力极强。
核心缺点 1. 长距离依赖困难 :RNN 存在梯度消失/爆炸问题,难以有效捕捉长序列中的远距离关联。 2. 串行处理瓶颈 :RNN 必须按顺序逐步计算,无法充分利用 GPU 并行算力,训练速度慢。 3. 跨模态扩展难:CNN/RNN 通常针对特定数据类型设计,难以像 Transformer 一样实现统一的多模态架构。 1. 计算复杂度呈平方级 :自注意力机制的计算量和显存占用随序列长度平方级增长,超长文本处理成本极高。 2. 数据饥渴症严重 :缺乏 CNN/RNN 的归纳偏置,需要海量数据才能充分学习,小数据集上易过拟合。 3. 推理开销大:生成阶段需反复计算历史 token 的注意力,KV Cache 占用大量显存,推理延迟和成本较高。

来自月之暗面(Moonshot AI)的Kimi,来自字节跳动的豆包,来自字节跳动的火山,来自腾讯的元宝

国外的主流大模型:GLM、LLama、GPT、Claude、Gemini等

多模态大语言模型:多个场景融合

相关推荐
郝学胜-神的一滴2 分钟前
AI 编程智能体 02:AI智能体到底是什么
开发语言·人工智能·python·程序人生·pycharm
天一生水water3 分钟前
超参分析入门教程
人工智能
LaughingZhu12 分钟前
Product Hunt 每日热榜 | 2026-10-01
数据库·人工智能·深度学习·神经网络·搜索引擎
橘和柠14 分钟前
CUDA 与 N 卡驱动安装
人工智能
悟天特斯15 分钟前
边缘计算:让智慧园区的治理能力“下沉“到最后一公里
人工智能·边缘计算
宋哥转AI17 分钟前
AgentScope Java 实战 05:Spring Boot 整合——11 个官方 starter 的自动装配路线
人工智能·ai·ai编程
I Am a robert girl27 分钟前
从一张图到碎裂瞬间:FracGen 如何用物理信号“导演“物体撕裂
人工智能·深度学习·计算机视觉·生成模型·视频生成·物理仿真·断裂模拟
能源革命27 分钟前
AI 日报 · 2026-10-01
人工智能
量子-Alex29 分钟前
【大模型强化学习后训练】强化学习后训练算力应投向何处?模型规模、搜索、学习与反馈
人工智能·学习
u13013033 分钟前
GitHub 热榜项目:日榜(2026-10-01)
人工智能·github