语言模型

江畔柳前堤1 小时前
人工智能·分布式·深度学习·算法·目标检测·机器学习·语言模型
大语言模型分布式训练:从并行策略到万卡工程的系统梳理摘要:训练一个 70B 参数的 LLM,FP16 精度下仅模型权重就需要 140 GB 显存,叠加优化器状态、梯度与激活值后总需求超过 300 GB——这远超单张 H100 80 GB 的物理极限。分布式训练不是"锦上添花",而是大模型时代的基础设施。本文以 2026 年工业界最新实践为锚点,系统梳理 LLM 分布式训练的完整技术栈:从底层并行策略的数学本质,到 ZeRO、3D/5D 并行的工程实现,再到通信优化、容错机制与框架选型,力求为读者建立一张可操作、可决策、可演进的技术全景图。
江畔柳前堤2 小时前
服务器·人工智能·windows·目标检测·语言模型·自然语言处理·软件工程
HBM:大语言模型时代的「算力血液」——从内存墙到带宽革命的深度拆解作者按:2026年,全球半导体市场规模逼近1.7万亿美元,其中内存板块同比增长298%。但出货量仅多了8%,均价暴涨268%。这组数字背后,是一个被彻底改写的产业逻辑——HBM(High Bandwidth Memory,高带宽内存)从GPU的"配角"跃升为AI基础设施的"命脉"。本文试图从第一性原理出发,系统梳理HBM在LLM领域的技术本质、核心作用、演进路径与产业格局。
极昆仑智慧12 小时前
人工智能·语言模型·数据分析
智能问数五级成熟度模型:从“能问“到“能协作“的演进路径摘要:2026年智能问数赛道完成了从"能不能用"到"准不准"的市场验证,但行业缺少一个统一的评估框架来衡量产品的进化阶段。本文提出智能问数五级成熟度模型(L1-L5),从推理能力、上下文持续性、行动闭环等维度定义每个层级的能力标准,帮助技术选型者建立系统的评估视角。
doubt。14 小时前
人工智能·深度学习·机器学习·语言模型·json·prompt
大模型prompt工程Zero-Shot与Few-Shot以及json格式笔记跟着黑马程序员大模型RAG与Agent智能体项目实战教程,基于主流的LangChain技术从大模型提示词到实战项目学习记录的
Dawson Zhu1 天前
人工智能·语言模型·架构·制造·agi
基于Palantir Foundry构建半导体制造AI友好型数据中台:从良率分析场景谈起标签:#数据中台 #半导体制造 #Palantir #数据架构 #工业智能 #MLOps半导体制造是典型的数据密集型行业。一座12英寸晶圆厂每天产生的数据量在TB级别,涵盖MES工单、FDC设备参数、YMS良率数据、QMS缺陷记录等多个系统。近年来,业界尝试引入大语言模型(LLM)和AI Agent辅助良率分析和设备调优,但实际推进时往往遇到一个共性瓶颈:数据基础设施与AI的交互方式不匹配。
大模型任我行2 天前
人工智能·语言模型·自然语言处理·论文笔记
谷歌:扩散模型实现极速文本生成📖标题:DiffusionGemma Technical Report 🌐来源:arXiv, 2608.00146v1
硅谷秋水2 天前
人工智能·深度学习·计算机视觉·语言模型·机器人
人工智能医疗健康机器人研究综述与分析融合人工智能(AI)的医疗健康机器人已成为现代精准医疗的核心基础设施,覆盖外科手术介入、精准放射治疗、康复辅具、院内护理物流、老年长期照护全场景。本文对主流商用机器人平台与学术原型系统进行标准化分类梳理,分析美敦力、强生医疗、安科锐、Caresyntax 等头部企业代表平台的技术架构、临床流程与性能边界。基于 2018—2026 年18 篇同行评议综述与行业白皮书,将医疗机器人划分为五大标准化品类:手术机器人系统、智能放疗机器人、康复辅具机器人、院内物流陪护机器人、外科智能数据平台;并针对大语言模型(LL
A小码哥2 天前
人工智能·语言模型
Qwen3.8-Max 模型亮点是阿里巴巴于 2026年8月3日 正式发布的新一代基座大模型。作为千问系列中规模最大、性能最强的旗舰版本,本次更新在模型架构、核心能力以及商业生态上均实现了显著突破。以下是本次更新的核心亮点及对应的测试指标数据:
硅谷秋水3 天前
深度学习·机器学习·计算机视觉·语言模型·机器人
WAM-Nav:用于统一视觉导航的非对称潜世界动作建模26年6月来自南大、中科院自动化所、中科院大学、中科第五记(FiveAges)、国防大学和极佳科技(GigaAI)的论文“WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation”。
大模型任我行3 天前
人工智能·语言模型·自然语言处理·论文笔记
Meta:动态批大小提升训练效率📖标题:Towards joint scaling laws with optimal batch size schedules 🌐来源:arXiv, 2607.27731v1
Zkaisen3 天前
人工智能·语言模型·自然语言处理
第三章 · 大语言模型基础(详尽展开版)📌 本章定位:前两章讲了“智能体是什么、怎么发展来的”。本章彻底聚焦一个问题——现代智能体的“大脑”(大语言模型)到底是怎么工作的? 学完这章,你要建立一条清晰的技术链:
小白说大模型4 天前
人工智能·语言模型·自然语言处理
LLM(大语言模型)到底是怎么工作的?你有没有想过,当你向 ChatGPT 提问时,它到底是怎么“理解”你的问题,又是怎么组织出那些看起来像模像样的回答的?它真的在思考吗?还是说,它只是某种超级复杂的“鹦鹉学舌”?
牧竹子4 天前
语言模型
大模型-新手安装Ollama以及大模型调用这里我用的是个人笔记本配置在官网选择对应的版本下载 https://ollama.com/download
weixin_446260855 天前
人工智能·语言模型·自然语言处理
通过恶意输入操控大语言模型行为的MCP环境搭建及应用研究https://github.com/harishsg993010/damn-vulnerable-MCP-server
大鱼>7 天前
gpt·语言模型·transformer
从零实现Transformer:手写自注意力到GPT-2级别语言模型2017年,“Attention Is All You Need” 论文以一句"Attention Is All You Need"宣告了 NLP 新时代的到来。Transformer 不依赖 RNN 的序列递归,用纯粹的注意力机制实现了并行训练,支撑了 GPT-4、Claude、Gemini 等所有现代大模型。
张小泡泡5 天前
论文阅读·人工智能·语言模型·自然语言处理·自动化·微调
AUTO_EVAL:面向大语言模型的多层次自动化评测框架github.com/zhangshuwei932-ai/AUTO_EVAL — MIT License,欢迎 Star 与贡献。
zzzll11116 天前
人工智能·语言模型·自然语言处理
Ollama:本地运行大型语言模型的轻量级解决方案Ollama 是一个开源工具,允许开发者在本地计算机上轻松运行、管理和部署大型语言模型(LLM)。它通过将模型权重、配置和数据打包到一个统一的 Modelfile 中,简化了本地 LLM 的获取和运行过程。用户只需一条简单的命令行指令,即可启动一个功能完整的模型服务。
如此这般英俊6 天前
数据结构·人工智能·python·语言模型·自然语言处理·prompt
手搓Claude Code-第十章 system_prompt例如:还记得上一章末尾那个有关prompt的问题吗?紧接着本章就是在解决它。如果你写过最简单的 LLM Agent,你的system prompt大概长这样:
liyunlong-java6 天前
语言模型
部署Qwen2.5-VL-3B-Instruc视觉模型的教程libgl1 和 libglib2.0-0 是 OpenCV / Pillow 处理图像时的运行时依赖,缺失会导致多模态图片预处理报错。
leoZ2316 天前
java·人工智能·spring·生成对抗网络·语言模型·自然语言处理·llama
本地跑大模型实战(七):llama.cpp 性能调优,让推理更快更省本文是《本地大模型搭应用实战》系列第 7 篇。前面六篇解决了"能不能用"——部署、量化、API、tool call、RAG、agent。本篇解决"用得爽不爽"。同一台机器同一个模型,配置不同,token/s 能差好几倍。