Day25 - 大模型的三大架构

大模型

  • 大语言模型
  • Large Language Models(LLMs)
  • 参数量:B Billion 十亿
    • 类脑设计:参数看作脑细胞,脑细胞越多,越聪明
    • 数学视角:y=F(x),参数看作自变量,自变量越多,函数越复杂,越能映射复杂的关系
  • 训练平台:
    • 工程上:不可能脱离GPU,而且需要高性能GPU
  • 训练数据:
    • 预训练:18T语料
      • 18T表示18万亿,一本红楼梦约50万token,18T语料相当于3600万本红楼梦
  • 训练时长
    • 原来:3 ~ 6个月
    • 现在:1 ~ 2个月

质的变化

本质:天下大势,分久必合,合久必分

小模型时代:

  • 单一职责原则
    • 一个场景:
      • 单独一个模型
      • 单独一个数据集
      • 单独训练
      • 单独评估
      • 单独部署
      • 单独维护
  • 一个系统:
    • 挂了很多微服务
    • 挂了很多的小模型

大模型时代:AGI(Artificial General Intelligence)

  • 大一统
    • 一个系统:
      • 挂了一个大模型
        • 通过指令遵循,可以同时解决不同的问题
      • 多模态大模型

生成式人工智能 VS 判别式人工智能

Generative AI

创作性

如何进行人机协同是下一步的重点

具身机器人

大语言模型的架构

  • 架构一:Encoder - Decoder架构
    • 直接把 transformer 变厚即可
    • T5:Text to Text transfer Transformer
    • Google
    • 最正确、最正统、最没有歧义的路线,但死的最快。
      • 革命性的东西往往不按常理出牌,transformer的诞生代替了Seq2Seq,而Seq2Seq是全世界公认的生成式算法。
    • 首次提出:指令编码的基础理念
  • 架构二:Decoder - Only 架构
    • 把模型的复杂度降低
    • 除了GLM之外,这种架构是唯一的
      • LLaMA架构
        • LLaMA2
      • 千问系列
      • 豆包
      • 星火
      • kimi
  • 架构三:GLM(Prefix-Encoder-Only )架构
    • 融合 BERT 和 GPT 的优势,提出了一种混合结构
    • 理解上文:双向编码器的优势(BERT)
    • 生成下文:强大的自回归能力(GPT)
相关推荐
fthux6 小时前
装闭 RenoPit 源码解析(07):装修闭坑知识库与AI Prompt构建
人工智能·ai·开源·github·open source·renopit
zyplayer-doc7 小时前
VuePress类静态文档站和动态知识库怎么选:两种技术路线的适用场景
javascript·人工智能·后端·安全·智能手机
KKKlucifer8 小时前
拨开接口黑盒迷雾:运营商第三方合作接口安全审计与准入管控落地实践
网络·人工智能·安全
梦梦代码精8 小时前
连锁品牌数字化:从门店扩张到用户资产运营的技术底座
大数据·人工智能·低代码·docker·开源·代码规范
咕噜咕噜啦啦8 小时前
vLLM框架
人工智能·qwen·vllm
启雀AI8 小时前
AI 驱动的视频课程自动摘要与知识点提取:ASR + LLM 流水线工程实践
人工智能·阿里云·华为云·音视频·培训saas平台
Mac的实验室8 小时前
2026年8月最新实操:谷歌Gmail邮箱手机号注册扫码发短信提示“无法验证”怎么办?(附100%成功绕过指南)
人工智能
MindUp9 小时前
AI辅助PPT生成工具的内容组织能力实测:8款产品的文档解析与排版效果对比
人工智能
寒草9 小时前
【寒草呈献】当巴菲特走进 AI 投研助手
人工智能·架构