【NLP 71、常见大模型的模型结构对比】

三到五年的深耕,足够让你成为一个你想成为的人

------ 25.5.8

模型名称 位置编码 Transformer结构 多头机制 Feed Forward层设计 归一化层设计 线性层偏置项 激活函数 训练数据规模及来源 参数量 应用场景侧重
GPT-5 (OpenAI) RoPE动态相对编码 混合专家架构(MoE) 128头 MoE专家路由 RMSNorm GeGLU 超10万亿token(互联网+专有数据) 1.8万亿 金融风控、医疗诊断、多媒体生成
DeepSeek-V3 ALiBi 稀疏MoE架构 64头 稀疏激活 LayerNorm SwiGLU 5万亿token(学术论文+代码库) 6710亿 STEM科研、代码开发、教育题库
Google Gemini Ultra 绝对位置编码 时空注意力架构 256头 多模态跨模态融合 GroupNorm ReLU 8万亿token(视频+文本多模态数据) 1.2万亿 工业质检、实验室自动化、视频分析
百度文心一言4.0 绝对位置编码 搜索增强架构 96头 动态知识注入 RMSNorm GELU 4万亿token(百度搜索+古籍数据库) 2600亿 舆情分析、古籍处理、金融投研
华为盘古3.0 ALiBi 分层架构(L0-L2) 128头 行业知识蒸馏 LayerNorm GeGLU 行业专有数据(气象、矿山、制药) 1.1万亿 气象预测、矿山安全、药物研发
Anthropic Claude 3 RoPE 分步验证架构 64头 道德对齐模块 RMSNorm Swish 3万亿token(伦理对齐数据集) 5200亿 法律文书、心理咨询、学术辅助
阿里通义千问 旋转位置编码 MoE+3D生成架构 128头 多模态融合 LayerNorm SwiGLU 6万亿token(电商数据+3D模型库) 1.1万亿 电商客服、供应链优化、3D建模
星火大模型(科大讯飞) 相对位置编码 端云协同架构 96头 语音增强模块 RMSNorm GELU 2.5万亿token(教育+医疗专有数据) 890亿 教育辅导、医疗慢病管理、方言交互
豆包大模型(字节) 动态窗口编码 稀疏MoE+轻量化 32头 情感交互模块 LayerNorm ReLU 3万亿token(短视频+社交语料) 420亿 短视频生成、移动端实时推理
悟道大模型 双向相对编码 中英双语预训练架构 256头 多模态生成 GroupNorm GeGLU 7万亿token(多语言+文化遗产数据) 1.75万亿 文化遗产数字化、工业设计
相关推荐
lucky_lyovo41 分钟前
自然语言处理NLP---预训练模型与 BERT
人工智能·自然语言处理·bert
什么都想学的阿超11 小时前
【大语言模型 01】注意力机制数学推导:从零实现Self-Attention
人工智能·语言模型·自然语言处理
失散131 天前
自然语言处理——02 文本预处理(下)
人工智能·自然语言处理
什么都想学的阿超1 天前
【大语言模型 02】多头注意力深度剖析:为什么需要多个头
人工智能·语言模型·自然语言处理
MARS_AI_2 天前
云蝠智能VoiceAgent:AI赋能售后服务场景的创新实践
人工智能·语言模型·自然语言处理·人机交互·信息与通信
亚里随笔2 天前
稳定且高效:GSPO如何革新大型语言模型的强化学习训练?
人工智能·机器学习·语言模型·自然语言处理·llm·rlhf
数据知道2 天前
机器翻译:模型微调(Fine-tuning)与调优详解
人工智能·自然语言处理·机器翻译
未来之窗软件服务2 天前
自建知识库,向量数据库 体系建设(五)之 中文分词库 HanLP ——仙盟创梦IDE
自然语言处理·中文分词·仙盟创梦ide·东方仙盟
skywalk81633 天前
LLaMA Factory 是一个简单易用且高效的大型语言模型(Large Language Model)训练与微调平台。
人工智能·语言模型·自然语言处理
Websites3 天前
Hyperf 百度翻译接口实现方案
开发语言·自然语言处理·php·自动翻译