技术栈
大模型推理
论文复现现场
3 小时前
模型量化
·
vllm
·
大模型推理
·
awq
·
算家云
·
rtx3090
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战
更新时间:2026 年 9 月 20 日 适用环境:Linux、NVIDIA RTX 3090 24GB、Docker、CUDA 驱动
程序猿编码
2 天前
c++
·
神经网络
·
transformer
·
大模型推理
零依赖纯手写:C++ 实现完整神经网络,张量反向传播全打通
这是一套完全从零实现的基础神经网络库,全程采用纯C++编写,不依赖任何外部机器学习框架,完整覆盖多维张量运算、模块化网络层、前向传播、手动反向传播、损失函数计算全链路。
论文复现现场
3 天前
llama
·
qwen
·
vllm
·
大模型推理
·
大模型部署
·
rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型
直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
澳鹏Appen
6 天前
人工智能
·
大语言模型
·
智能体
·
大模型推理
AppenTalk | 当AI推理不再只是模型的事:Dan Roth谈智能体的真正边界
Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与“推理”的形式意义之间存在根本区别。
Albart575
8 天前
大模型
·
llm
·
vllm
·
大模型推理
·
幻觉
·
重复输出
大模型无限循环输出、重复生成文本:参数层面规避幻觉输出实战
摘要:面向大模型应用开发者的排障实战指南。全文以"现象 → 根因 → 参数 → 实战 → 方法论"为主线,系统讲解 12 个采样参数的作用机制、典型取值与风险,给出"复读机、无限死循环、幻觉编造"三大高频问题的可落地处方,并附 OpenAI、HuggingFace、vLLM 三套可直接复用的代码与 6 大平台的参数命名对照表。
ocean2103
14 天前
人工智能
·
面试
·
大模型推理
·
ai部署
2025-2026年AI部署与MLOps大厂面试高频问题
本文基于八股精2025-2026 年约 355 条 AI部署与MLOps 方向的真实面试记录,梳理了字节跳动、腾讯、快手、百度、京东、Shopee 虾皮等公司在大模型部署与推理优化岗位的考察侧重,并附上各家的高频真题示例,供备战该方向的求职者参考。
DevOps老兵
17 天前
人工智能
·
kubernetes
·
helm
·
vllm
·
大模型推理
·
ai infra
AI Infra实战05:用Helm在K8s中部署vLLM,从安装到压测全流程
本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
智码看视界
17 天前
大模型推理
·
推理加速
·
a100
·
tensorrt-llm
·
fp8量化
AI 推理优化实践-TensorRT-LLM 部署:A100 上 Llama-3-70B 吞吐量提升 8 倍
先看 HuggingFace transformers 默认推理路径的瓶颈:问题清单:TensorRT-LLM 就是为消灭这些瓶颈而生的。
白拾
1 个月前
强化学习
·
大模型推理
·
arxiv 2026
·
logos 论文分享
·
围棋ai
·
专家知识注入
【arXiv 2026】LoGos:把人类思考带回围棋——通用大模型的专业领域专家之路|从围棋AI与LLM推理交叉视角
本文解读 arXiv 2026 论文《Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go》。该论文提出LoGos(Language-Oriented Go System),通过融合启发式规则合成专家数据、长 CoT 混合冷启动与GRPO 自探索强化学习,把通用大模型变成能在自然语言中分析局面、推理并落子的职业级围棋棋手,其特别之处在于全程不依赖稀缺的人类推理标注,仅用可规模化的结构化专家知识。实验表明 LoGos(32B
weixin_44021329
1 个月前
vllm
·
大模型推理
·
decode
·
kv cache
·
prefill
·
llm 部署
大模型推理核心原理:KV Cache、Prefill、Decode、TTFT、vLLM、算子
在大模型落地部署、推理优化中,KV Cache、Prefill/Decode、TTFT/TPOT、GPU算子、vLLM 是一套高度关联的核心体系。本文将系统性地讲解大模型自回归推理的核心原理、推理阶段特性、性能瓶颈与工程优化方案,梳理完整的底层落地逻辑。
程序猿编码
1 个月前
人工智能
·
深度学习
·
lstm
·
transformer
·
大模型推理
扔掉特征工程!我用三个LSTM“栈“写了一个依存句法分析器,句子结构一眼看穿
做自然语言处理的人,迟早会遇到一个头疼的问题:怎么让机器理解句子的语法结构?比如这句话:“我喜欢自然语言处理。” 人一眼就能看出来——"喜欢"是核心动词,"我"是它的主语,"自然语言处理"是它的宾语。但机器呢?它看到的只是一串token ID,没有任何结构信息。
白拾
1 个月前
大模型推理
·
高效推理
·
kv cache
·
稀疏注意力
·
h2o 论文分享
·
neurips 2023
【NeurIPS 2023】H2O:重型命中者预言机——大模型高效生成式推理的 KV Cache 驱逐策略|从大模型推理系统优化视角
本文解读 NeurIPS 2023 论文《H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models》。该论文提出H2O(重型命中者预言机)KV Cache 驱逐策略,通过融合注意力稀疏性观测、累加注意力分数幂律分布与动态子模最大化理论,只保留重型命中者和最近 token,即可用 20% 的 KV 缓存预算实现 5–10 倍内存缩减、最高 29 倍吞吐提升,且精度与全缓存持平甚至反超。实验覆盖 O
HyperAI超神经
1 个月前
人工智能
·
深度学习
·
生物信息学
·
大模型推理
·
生物医学
在线教程|ProteinGym 第一名!VenusREM 用「检索增强」预测蛋白突变影响,加速蛋白质设计
蛋白质工程正在从「试错筛选」走向「计算预筛选」——在湿实验前用计算方法评估突变对蛋白质功能的影响,从而缩小候选范围、降低实验成本。但蛋白质突变空间巨大、结构与功能关系复杂,如何兼顾预测效率与准确性,一直是该领域的核心挑战。
清风lsq
4 个月前
vllm
·
大模型推理
大模型-vllm 自投机解码可行性分析
用户希望实现一种"外部 Drafter + 内部 Target 验证"的投机解码变体方案:客户端运行独立的推理模型(例如 ASR drafter),生成草稿 token
清风lsq
4 个月前
人工智能
·
vllm
·
大模型推理
大模型-解析vllm lora 模块
文档版本:2026-05-27 代码路径:vllm/lora/ 覆盖文件:models.py, worker_manager.py, request.py, lora_weights.py, peft_helper.py
清风lsq
4 个月前
人工智能
·
vllm
·
大模型推理
大模型-vllm 投机解码实现
https://docs.vllm.ai/en/latest/examples/features/speculative_decoding/?h=speculative+decoding
清风lsq
4 个月前
人工智能
·
vllm
·
大模型推理
大模型-vllm 实现lora解析
https://docs.vllm.ai/en/latest/design/lora_resolver_plugins/
LarryHai6
5 个月前
人工智能
·
aot
·
cot
·
tot
·
大模型推理
·
大模型思维链
AI 大模型思维链原理:从COT到AOT,解锁大模型的推理潜力
一、引言:大模型推理的核心困境与思维链的诞生近年来,大语言模型在自然语言理解、生成、对话等领域取得突破性进展,但在数学计算、逻辑推理、多步骤决策、复杂问题分析等任务中,仍频繁出现 “看似简单却答错” 的现象。例如简单的加减乘除、常识推理、步骤推导,模型常常直接给出错误答案,而非推导过程出错。
lin_dec+
5 个月前
nlp
·
transformer
·
vllm
·
大模型推理
·
kv cache
KV Cache:大模型推理加速的关键技术
目录1、为什么需要 KV Cache?先搞懂大模型的文本生成模式2、不使用 KV Cache 时,到底有多少冗余计算?
wdf8088
6 个月前
人工智能
·
深度学习
·
大模型推理
·
无人机影像
算力随行:UltraLAB便携工作站如何将多卡深度学习带入户外与现场
在人工智能研发的日常图景中,算力与场景之间似乎总隔着一道无形的墙。我们习惯了将深度学习训练与恒温机房里的机架式服务器画上等号,忍受着风扇的轰鸣和调试时往返于工位与机房的低效。然而,当模型需要走出实验室——在野外地质勘探现场实时分析无人机影像,在应急指挥帐篷里快速处理监控视频,甚至在学术会议的演示厅里流畅运行大模型推理——传统的算力方案就显得笨拙而割裂。