llm推理

白拾16 天前
系统优化·llm推理·高吞吐·量化压缩·flexgen 论文分享·模型卸载·icml 2023
【ICML 2023】FlexGen:单 GPU 上的大语言模型高吞吐生成推理|从大模型推理系统优化视角本文解读 ICML 2023 论文《FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU》。该论文提出 FlexGen 高吞吐生成推理引擎,通过融合GPU/CPU/磁盘三级内存聚合、线性规划卸载策略搜索与4-bit 权重与 KV cache 压缩,让 1750 亿参数的 OPT-175B 模型在一张 16GB 消费级显卡上完成高吞吐生成,其特别之处在于把「在哪存、何时算、谁来算」形式
AI精钢4 个月前
大模型·llm推理·kv cache·deepseek·ai工程
DeepSeek KV Cache 入门解读:98% 命中率背后的工程逻辑最近 Reddit 上有一个帖子引发了不少关注:一位开发者用 Claude 的 developer mode 对接 DeepSeek API 做 Web 开发,单日消耗了约 8900 万 tokens,总费用只有 4.39 元人民币(约 $0.64),缓存命中率高达 98.07%。
d1z8885 个月前
llama·显卡·llm推理·推理引擎
(二十一)32天GPU测试从入门到精通-LLaMA 系列模型测试day19LLaMA 系列是最具影响力的开源大语言模型,从 LLaMA 到 LLaMA 3,推动了整个开源 AI 社区的发展。2023 年 2 月,Meta 发布了第一代 LLaMA,虽然仅限研究许可,但其出色的性能引发了开源社区的广泛关注。随后,LLaMA 2 于 2023 年 7 月发布,开放了商业使用许可,真正开启了开源 LLM 的黄金时代。2024 年 2 月,LLaMA 3 发布,带来了架构升级和性能飞跃,成为当时开源最强模型。
阿里云大数据AI技术2 年前
人工智能·tag·llm推理
TAG:BladeLLM 的纯异步推理架构作者:张子鹏 PAI引擎团队随着 GQA/MLA/MoE 等模型结构不断发展,大语言模型的推理逐步解除了显存限制,逐渐向着高并发、高吞吐的方向发展。推理引擎的运行时开销也变得不可忽视。主流 LLM 推理框架的运行时开销大致来自:
Baihai IDP2 年前
人工智能·深度学习·缓存·llm·transformer·白海科技·llm推理
LLM 推理优化探微 (2) :Transformer 模型 KV 缓存技术详解编者按:随着 LLM 赋能越来越多需要实时决策和响应的应用场景,以及用户体验不佳、成本过高、资源受限等问题的出现,大模型高效推理已成为一个重要的研究课题。为此,Baihai IDP 推出 Pierre Lienhart 的系列文章,从多个维度全面剖析 Transformer 大语言模型的推理过程,以期帮助读者对这个技术难点建立系统的理解,并在实践中做出正确的模型服务部署决策。
我是有底线的