推理引擎

haliu21 小时前
人工智能·嵌入式·c·fhe·推理引擎·c11·边缘推理·同态加密推理
【FHE】(十二):为什么我们把 OpenMP 换成了自研线程池项目仓库 Gitee 主仓:https://gitee.com/pei-xiaoguang/kestrel-llm GitHub 镜像:https://github.com/m13253246268-ship-it/kestrel-llm
haliu1 天前
嵌入式·fhe·推理引擎·边缘推理·同态加密推理
【FHE】(十一):密文链协议——两条不变式,和 112 与 2100 的分工项目仓库 Gitee 主仓:https://gitee.com/pei-xiaoguang/kestrel-llm GitHub 镜像:https://github.com/m13253246268-ship-it/kestrel-llm
haliu1 天前
人工智能·嵌入式·c·fhe·推理引擎·c11·边缘推理·同态加密推理
【FHE】(十):密文里的 attention——没有 max,softmax 怎么办项目仓库 Gitee 主仓:https://gitee.com/pei-xiaoguang/kestrel-llm GitHub 镜像:https://github.com/m13253246268-ship-it/kestrel-llm
haliu1 天前
fhe·推理引擎·边缘推理·同态加密推理
【FHE】我们如何实现同态加密推理(八):SiLU 的密文化——两条路径,和一个 8 字节的开关项目仓库 Gitee 主仓:https://gitee.com/pei-xiaoguang/kestrel-llm GitHub 镜像:https://github.com/m13253246268-ship-it/kestrel-llm
程序猿编码7 天前
c++·大模型·llm·推理引擎
告别改源码适配模型:纯 C++ 可配置 LLM 推理引擎,全格式全结构兼容这是一套纯C++实现的高效、高度可配置大语言模型推理引擎,采用配置驱动的设计理念:接入新模型无需修改源码、重新编译,仅通过编辑模型规格配置文件即可完成适配。
RobinDevNotes14 天前
搜索引擎·ai·大模型·推理引擎
TensorRT 与 ONNX Runtime 推理全解析大模型从训练好的权重变成能对外提供服务的产品,中间必须经过"推理引擎"这一关。TensorRT(及其大模型分支 TensorRT-LLM)和 ONNX Runtime(及其生成式扩展 ONNX Runtime GenAI)是目前工程落地中最常被提到的两套推理方案,一个主打 NVIDIA GPU 上的极致性能,一个主打跨硬件、跨平台的通用部署。理解这两者的定位差异和使用方法,是做大模型推理绕不开的基础知识。
JiMoKuangXiangQu18 天前
人工智能·llama.cpp·推理引擎
在 AllWinner T507 上部署 Qwen2.5-0.5B 大语言模型AllWinner T507 是一款面向工业控制的 Arm Cortex-A53 四核处理器,主频最高 1.5GHz,常见于嵌入式 HMI、工业网关等场景。本文记录在这类资源受限的嵌入式设备上,通过交叉编译 llama.cpp 并部署 Qwen2.5-0.5B-Instruct 量化模型的完整过程。
thesky1234561 个月前
大模型·vllm·flashattention·推理引擎·pagedattention·连续批处理·显存管理
27届大模型面试准备(五十九):大模型推理引擎内核深度剖析——PagedAttention、调度器与显存管理前面(二十五)讲推理服务化与投机解码、(五十三)讲多模态服务化、(五十四)讲成本与吞吐调优,都偏「架构与成本」。本篇往内核里再钻一层:一个推理引擎(vLLM、TensorRT-LLM、SGLang 之类)到底怎么把一次请求变成显存里的 KV Cache、怎么调度 token、怎么不浪费显存。这是面试「部署优化」这条线的硬核题,也是华为多模态 LLM 岗现场写代码/画架构高频考点。
帅气的小峰1 个月前
c++·python·cuda·推理引擎
pybind11与nanobind可以共存吗?如何迁移?可以共存,但不建议在同一个 Python 扩展模块(.so/.pyd)中混合使用。不过,在同一个项目中以“分模块”或“渐进迁移”的方式共存是完全可行且常见的实践。
Briwisdom2 个月前
tensorrt·vllm·推理引擎·sglang
LLM 推理引擎三强争霸——vLLM vs SGLang vs TensorRT-LLM副标题: 2026 年的 LLM 推理引擎格局已经清晰——vLLM 是生产部署的事实标准,SGLang 在 Agent 和结构化输出场景独占鳌头,TensorRT-LLM 是 NVIDIA 硬件上的性能天花板。本文从架构哲学、调度策略、KV Cache 管理、编译优化到实测性能,做一次三强全面对比。
寒水馨2 个月前
linux·ubuntu·llm·llama·本地部署·llama.cpp·推理引擎
Linux下载、安装llama.cpp-b10068(附安装包llama-b10068-bin-ubuntu-vulkan-x64.tar.gz)llama.cpp 是由保加利亚软件工程师 Georgi Gerganov 于 2023 年 3 月创建的开源 LLM(Large Language Model,大语言模型)推理引擎。最初是 Gerganov 在一个周末为了让 Meta 的 LLaMA 模型在 MacBook 上运行而发起的项目,如今已发展成为本地 AI 推理领域的事实标准。截至 2026 年中,该项目在 GitHub 上已获得约 12 万颗星(Stars)、超过 1600 位贡献者,增长速度超过 PyTorch 和 TensorFlow
时光飞逝的日子4 个月前
risc-v·模型量化·推理引擎·边缘 ai·向量扩展·低功耗优化
基于 RISC-V 架构的边缘 AI 推理引擎优化设计关键词:RISC-V、边缘 AI、推理引擎、向量扩展、模型量化、低功耗优化摘要:针对嵌入式边缘设备算力弱、内存稀缺、功耗受限的行业痛点,依托RISC-V开源指令集模块化、可定制的核心优势,设计一款支持INT8/FP16混合精度推理的轻量化边缘AI推理引擎。结合RVV向量扩展指令级优化、模型量化压缩算法、自适应内存调度策略,全方位优化CNN模型端侧推理效率,在极低精度损耗的前提下,大幅降低推理延迟与设备功耗,可高效落地于工业视觉检测、智能家居感知、端侧智能监控等主流边缘场景。
luoganttcc4 个月前
开源·大模型·推理引擎
算子级开源、不依赖 torch_npu:从零实现 Ascend 大模型推理引擎项目地址:https://github.com/luogantt/LLM-inference-engine
d1z8886 个月前
llama·显卡·llm推理·推理引擎
(二十一)32天GPU测试从入门到精通-LLaMA 系列模型测试day19LLaMA 系列是最具影响力的开源大语言模型,从 LLaMA 到 LLaMA 3,推动了整个开源 AI 社区的发展。2023 年 2 月,Meta 发布了第一代 LLaMA,虽然仅限研究许可,但其出色的性能引发了开源社区的广泛关注。随后,LLaMA 2 于 2023 年 7 月发布,开放了商业使用许可,真正开启了开源 LLM 的黄金时代。2024 年 2 月,LLaMA 3 发布,带来了架构升级和性能飞跃,成为当时开源最强模型。
Shining05966 个月前
人工智能·深度学习·算法·大模型·ai芯片·智能体·推理引擎
推理引擎系列(七)《InfiniLM》目录InfiniLM 技术架构演进框架版本迭代整体架构设计核心组件解析作业项目实战指南环境配置要求核心模块实现
Shining05966 个月前
人工智能·分布式·深度学习·机器学习·大模型·注意力机制·推理引擎
推理引擎系列(四)《大模型计算优化与分布式推理》目录背景与意义1.Scaling Law 驱动模型容量越来越大:2. 大模型带来的问题:低精度类型1. 低精度数据类型优势:
长路 ㅤ   7 个月前
模型部署·vllm·xinference·推理引擎·ai框架
快速了解VLLM推理引擎博主介绍:✌目前全网粉丝4W+,csdn博客专家、Java领域优质创作者,博客之星、阿里云平台优质作者、专注于Java后端技术领域。
dawdo2228 个月前
llm·transformer·性能调优·推理引擎·xllm·模型执行器
自己动手从头开始编写LLM推理引擎(12)-xLLM的整体调优大型语言模型(LLM)推理系统的性能调优是一个复杂而关键的过程,涉及到系统架构、算法实现、资源管理等多个方面。xLLM作为一个高性能的LLM推理框架,通过一系列精心设计的优化措施,实现了显著的性能提升。本文将全面总结xLLM的整体调优过程,包括模型执行器、调度器、采样器等核心组件的优化策略,以及性能测试和监控分析结果。
dawdo2228 个月前
llm·transformer·性能测试·qwen·benchmark·推理引擎
自己动手从头开始编写LLM推理引擎(11)-xLLM的benchmark实现在大型语言模型(LLM)推理系统中,性能评估是确保系统稳定性和效率的关键环节。xLLM提供了一个功能完善的基准测试工具(benchmark),用于全面评估系统在不同负载条件下的性能表现。本文将详细介绍xLLM benchmark工具的设计理念、核心实现、测试策略和性能分析方法,帮助开发者深入理解LLM推理系统的性能评估方法。
dawdo2229 个月前
llm·推理引擎·xllm·tokenizer管理器
自己动手从头开始编写LLM推理引擎(3)在前两篇文章中,我们分别搭建了一个Demo推理引擎,并设计了自研的xLLM推理引擎架构。在Demo阶段,我们使用了简单的PD(Prompt Engineering + Decoding)分离架构,将提示工程和解码过程分离。然而,当我们从Demo走向生产级系统时,需要一个更加完善的Tokenizer管理器来处理复杂的推理场景。本文将深入介绍Tokenizer管理器的设计与实现,解释为什么需要专门的Tokenizer管理器,实现的原则和要点,并结合实际代码展示最佳实践。