大模型推理

论文复现现场3 小时前
模型量化·vllm·大模型推理·awq·算家云·rtx3090
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战更新时间:2026 年 9 月 20 日 适用环境:Linux、NVIDIA RTX 3090 24GB、Docker、CUDA 驱动
程序猿编码2 天前
c++·神经网络·transformer·大模型推理
零依赖纯手写:C++ 实现完整神经网络,张量反向传播全打通这是一套完全从零实现的基础神经网络库,全程采用纯C++编写,不依赖任何外部机器学习框架,完整覆盖多维张量运算、模块化网络层、前向传播、手动反向传播、损失函数计算全链路。
论文复现现场3 天前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
澳鹏Appen6 天前
人工智能·大语言模型·智能体·大模型推理
AppenTalk | 当AI推理不再只是模型的事:Dan Roth谈智能体的真正边界Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与“推理”的形式意义之间存在根本区别。
Albart5758 天前
大模型·llm·vllm·大模型推理·幻觉·重复输出
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战摘要:面向大模型应用开发者的排障实战指南。全文以"现象 → 根因 → 参数 → 实战 → 方法论"为主线,系统讲解 12 个采样参数的作用机制、典型取值与风险,给出"复读机、无限死循环、幻觉编造"三大高频问题的可落地处方,并附 OpenAI、HuggingFace、vLLM 三套可直接复用的代码与 6 大平台的参数命名对照表。
ocean210314 天前
人工智能·面试·大模型推理·ai部署
2025-2026年AI部署与MLOps大厂面试高频问题本文基于八股精2025-2026 年约 355 条 AI部署与MLOps 方向的真实面试记录,梳理了字节跳动、腾讯、快手、百度、京东、Shopee 虾皮等公司在大模型部署与推理优化岗位的考察侧重,并附上各家的高频真题示例,供备战该方向的求职者参考。
DevOps老兵17 天前
人工智能·kubernetes·helm·vllm·大模型推理·ai infra
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
智码看视界17 天前
大模型推理·推理加速·a100·tensorrt-llm·fp8量化
AI 推理优化实践-TensorRT-LLM 部署:A100 上 Llama-3-70B 吞吐量提升 8 倍先看 HuggingFace transformers 默认推理路径的瓶颈:问题清单:TensorRT-LLM 就是为消灭这些瓶颈而生的。
白拾1 个月前
强化学习·大模型推理·arxiv 2026·logos 论文分享·围棋ai·专家知识注入
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos(Language-Oriented Go System),通过融合启发式规则合成专家数据、长 CoT 混合冷启动与GRPO 自探索强化学习,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B
weixin_440213291 个月前
vllm·大模型推理·decode·kv cache·prefill·llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
程序猿编码1 个月前
人工智能·深度学习·lstm·transformer·大模型推理
扔掉特征工程!我用三个LSTM“栈“写了一个依存句法分析器,句子结构一眼看穿做自然语言处理的人,迟早会遇到一个头疼的问题:怎么让机器理解句子的语法结构?比如这句话:“我喜欢自然语言处理。” 人一眼就能看出来——"喜欢"是核心动词,"我"是它的主语,"自然语言处理"是它的宾语。但机器呢?它看到的只是一串token ID,没有任何结构信息。
白拾1 个月前
大模型推理·高效推理·kv cache·稀疏注意力·h2o 论文分享·neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
HyperAI超神经1 个月前
人工智能·深度学习·生物信息学·大模型推理·生物医学
在线教程|ProteinGym 第一名!VenusREM 用「检索增强」预测蛋白突变影响,加速蛋白质设计蛋白质工程正在从「试错筛选」走向「计算预筛选」——在湿实验前用计算方法评估突变对蛋白质功能的影响,从而缩小候选范围、降低实验成本。但蛋白质突变空间巨大、结构与功能关系复杂,如何兼顾预测效率与准确性,一直是该领域的核心挑战。
清风lsq4 个月前
vllm·大模型推理
大模型-vllm 自投机解码可行性分析用户希望实现一种"外部 Drafter + 内部 Target 验证"的投机解码变体方案:客户端运行独立的推理模型(例如 ASR drafter),生成草稿 token
清风lsq4 个月前
人工智能·vllm·大模型推理
大模型-解析vllm lora 模块文档版本:2026-05-27 代码路径:vllm/lora/ 覆盖文件:models.py, worker_manager.py, request.py, lora_weights.py, peft_helper.py
清风lsq4 个月前
人工智能·vllm·大模型推理
大模型-vllm 投机解码实现https://docs.vllm.ai/en/latest/examples/features/speculative_decoding/?h=speculative+decoding
清风lsq4 个月前
人工智能·vllm·大模型推理
大模型-vllm 实现lora解析https://docs.vllm.ai/en/latest/design/lora_resolver_plugins/
LarryHai65 个月前
人工智能·aot·cot·tot·大模型推理·大模型思维链
AI 大模型思维链原理:从COT到AOT,解锁大模型的推理潜力一、引言:大模型推理的核心困境与思维链的诞生近年来,大语言模型在自然语言理解、生成、对话等领域取得突破性进展,但在数学计算、逻辑推理、多步骤决策、复杂问题分析等任务中,仍频繁出现 “看似简单却答错” 的现象。例如简单的加减乘除、常识推理、步骤推导,模型常常直接给出错误答案,而非推导过程出错。
lin_dec+5 个月前
nlp·transformer·vllm·大模型推理·kv cache
KV Cache:大模型推理加速的关键技术目录1、为什么需要 KV Cache?先搞懂大模型的文本生成模式2、不使用 KV Cache 时,到底有多少冗余计算?
wdf80886 个月前
人工智能·深度学习·大模型推理·无人机影像
算力随行:UltraLAB便携工作站如何将多卡深度学习带入户外与现场在人工智能研发的日常图景中,算力与场景之间似乎总隔着一道无形的墙。我们习惯了将深度学习训练与恒温机房里的机架式服务器画上等号,忍受着风扇的轰鸣和调试时往返于工位与机房的低效。然而,当模型需要走出实验室——在野外地质勘探现场实时分析无人机影像,在应急指挥帐篷里快速处理监控视频,甚至在学术会议的演示厅里流畅运行大模型推理——传统的算力方案就显得笨拙而割裂。