技术栈
推理
Web3&Basketball
2 天前
python
·
架构
·
大模型
·
agent
·
推理
CRM Agent 后训练实战:3 倍更少错误
9 月 15 日的 Dreamforce 上,Salesforce 和英伟达联合发布了一个 CRM 推理模型 Koa。成绩单里最扎眼的一条是:在自家 CRM 基准上,错误率只有基座的三分之一。 但真正值得抄的不是这个结果,是它的做法。Koa 没有训练自己的基座,而是拿英伟达的开源权重模型 Nemotron 3 Super(120B)做后训练,训练语料全部由合成场景构成,建模自 Salesforce 近 27 年、覆盖 14 个以上行业的 CRM 部署经验。官方口径是:没有使用任何客户数据。这对企业落地智能
程序猿编码
5 天前
大模型
·
llm
·
rk3588
·
qwen
·
推理
·
vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地
这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
程序猿编码
6 天前
大模型
·
qwen
·
推理
扔掉 vLLM!从零构建 Qwen3-8B 推理引擎,C++/CUDA 实现性能追平 98%
这是一套从零开始完整实现的Qwen3-8B大模型推理栈,采用「C++/CUDA底层计算 + Go上层服务」的双层架构,不依赖PyTorch、通用推理框架等第三方组件,走精简代码路线:放弃宽泛的多模型支持,只聚焦Qwen3-8B一条完整的推理路径,换来代码干净、逻辑清晰、易于阅读与二次开发。
程序猿编码
8 天前
c++
·
计算机视觉
·
大模型
·
transformer
·
rk3588
·
推理
·
ggml
扔掉 Python!纯 C++ 本地跑扩散 TTS,GGML 加持,支持 RK3588 NPU 加速
这是一套完全原生C++实现的文本转语音(TTS)推理引擎,核心基于GGML轻量张量库构建,采用两阶段扩散式TTS架构:第一阶段由基于Qwen3骨干的扩散语言模型,将输入文本转换为离散音频编码;第二阶段由卷积编解码器将音频编码还原为24kHz语音波形。
Web3&Basketball
9 天前
python
·
大模型
·
agent
·
推理
·
推理优化
ChatGPT 路由自证:跨客户端实测对照
你在界面上选中的那个模型名,未必就是真正给你算的那一个。 这不是猜测。OpenAI 开发者社区从 9 月初起有多起可复现的报告:请求侧的 metadata 明确写着 model_slug: gpt-5-6-thinking、thinking_effort: extended,而同一次请求最终的服务端 metadata 报的是 model_slug: gpt-5-5-mini,并伴随 did_auto_switch_to_reasoning: false、is_autoswitcher_enabled: f
程序猿编码
10 天前
大模型
·
llm
·
agent
·
推理
LLM+Agent 全栈推理底座:Triton 算子优化・语义级缓存・分布式调度
这是一套从算子层到服务层全链路自主研发的大语言模型推理引擎,底层基于自定义CUDA内核、Triton算子与纯C++ CPU运行时构建,不依赖vLLM、llama.cpp等第三方推理框架,仅以PyTorch为基础依赖,整体遵循「最小依赖、按需加载、明确降级」的设计原则。
网络工程小王
1 个月前
人工智能
·
量化
·
推理
【LLM开发实验】LLM推理基本介绍
目录显存需求估算:参数量经验法则基本计算激活内存激活占用显存 (VRAM)键值(KV)缓存关于权重 (weight)的考量
天涯明月1993
1 个月前
人工智能
·
后端
·
推理
·
sglang
SGLang深度研究报告
一份面向工程实践的系统剖析,覆盖设计动机、前后端协同架构、RadixAttention、约束解码、零开销调度、投机解码、分布式部署与真实性能基准。 版本基线:SGLang v0.5.x(2026 年中),论文原作 NeurIPS 2024。
HyperAI超神经
1 个月前
人工智能
·
线性代数
·
矩阵
·
智能体
·
推理
·
ai编译器
基于 Strassen 与 LCMA 低复杂度矩阵乘,腾讯 FalconGEMM 探索超越硬件峰值的矩阵乘优化
8 月 1 日,HyperAI 主办的 Meet AI Compiler 技术沙龙第 9 期在北京举办。本期活动聚焦 AI 编译技术的最新进展,多位来自产业界和科研机构的专家围绕编程语言、算子开发、编译优化与推理执行展开分享,呈现 AI 编译器从上层语言表达到硬件执行的协同演进。
犀思云
2 个月前
训练
·
推理
·
ai原生
·
算力网络
算力网络怎么建?训练、推理、采集、调度——四类场景架构与选型完全指南
上一篇《什么是算力网络?》我们厘清了算力网络的定义、三层逻辑和它与智算网络、算网融合、AI Fabric 的边界。但对真正要动手的技术团队来说,光有认知不够——你需要知道:我的业务对应哪类场景?该建 L2 还是 L3?自建还是买服务?怎么选不踩坑?
西西弗Sisyphus
2 个月前
人工智能
·
机器学习
·
分类
·
训练
·
推理
·
imagenet
部署模型的优化:图像标准化预处理从三步到一步乘加(2)
flyfish在计算机视觉模型的工程落地中,输入图像的预处理是一个看似基础却极易踩坑的环节。 很多开发者直接照搬训练代码中的归一化-减均值-除以标准差」三步式写法 也有不少开发者混淆不同框架、不同工具链中的mean/scale参数定义,导致模型输入分布与训练时不匹配。
molihuan
2 个月前
android
·
ocr
·
paddle
·
推理
·
端侧
·
paddle lite
最新 Paddle-Lite Android平台编译
一.克隆源码 (只拉取最新的代码(包括子模块))二.安装基本编译环境三.配置环境变量四.修改编译脚本 修改项目目录下 lite/tools/build_android.sh
小北的AI科技分享
3 个月前
推理
·
力
·
算
AI算力:驱动智能时代的隐形引擎
自从GPT引发AI应用的浪潮兴起, 直至等大模型在垂直行业实现落地这一情况出现, 一场围绕“算力”作为核心的生产力革命, 正在全球的范围之内全面展开, AI算力, 也就是人工智能的计算能力, 正好像工业时代的电力情况一样, 成为数字经济的基础设施。本文将会从技术演进、市场格局、应用场景以及成本优化这四个维度, 客观地去解析AI算力的当前状况与未来发展态势。
小北的AI科技分享
3 个月前
模型
·
推理
·
搭建
AI大模型搭建,从入门到实践
近年来, 、Qwen等这类作为代表的开源大模型呈持续涌现态势, 越来越多的企业开始留意怎样把AI大模型切实“搭建”起来, 并且应用于日常业务里。然而, 从模型选择这一方面, 到硬件配置这一要点, 再到系统集成这一环节, 每一步均充斥着技术挑战以及决策难点。本文会以客观、专业的视角, 深入剖析AI大模型搭建的全流程, 给出精准的数据以及可操作的参考标准, 助力读者理清思路。
Together_CZ
3 个月前
图像处理
·
人工智能
·
opencv
·
计算机视觉
·
llm
·
dnn
·
推理
OpenCV 5.0 重磅发布:全面技术深度解析
从 C++ API 现代化到 ONNX 原生支持,OpenCV 5 带来了十年来最大的架构变革OpenCV 迎来了具有里程碑意义的 5.0 版本,这是一次彻底的重构。过去的 DNN 模块在处理 Transformer 等现代模型时显得力不从心,为此新版本完全重写了推理引擎,将 ONNX 算子支持率从 23% 大幅提升至 80% 以上,并且原生支持大语言模型(LLM)和视觉语言模型(VLM)的推理。在性能方面,CPU 上的推理速度是 PyTorch 原生模式的 2.3 倍,GPU 上也提升了 1.8 倍,同
小北的AI科技分享
4 个月前
部署
·
模型
·
推理
AI大模型搭建,从零开始的实战指南
时至今日, 人工智能技术飞一般地发展着, 大语言模型已然从实验室迈向千行百业, 不管是想要借助AI提升效率的企业, 还是渴望探索大模型潜力的个人开发者, 构建一套归属于自身的AI大模型系统都算是一项值得去掌握的核心技能, 本文会从硬件选型谈起再到软件部署, 为你整理出一套完整且能够落地的搭建流程。
一颗小树x
4 个月前
加速
·
推理
·
vla
·
realtime-vla
《VLA 系列》复现 realtime-vla | 加速推理 | Triton后端
本文介绍了实时realtime-vla 的加速实现方案,通过Triton后端优化在RTX 4090/5090显卡上达到20-55ms的推理速度。
Mike_666
4 个月前
推流
·
推理
·
cpu推理
·
cpu推流
·
gpu推流
·
gpu推理
推流和推理什么区别
1. CPU 推流(软件编码) bash # 使用 CPU 软件编码 ffmpeg -i input.mp4 -c:v libx264 output.mp4 工作原理:CPU 执行 H.264 压缩算法,逐帧分析、运动估计、熵编码 优点:画质好、参数可调、兼容性高 缺点:CPU 占用极高,可能影响其他任务 适用场景:离线转码、对画质要求高的场景
AIDF2026
4 个月前
人工智能
·
深度学习
·
框架
·
推理
第六篇:实战出击——深度学习的“减脂”与“提速”
假设我们已经耗费了数千万美元,终于“炼”出了一个聪明的模型。那么,是不是直接把它插到服务器上就能用了呢?(嘿嘿,其实我们也就是在huggingface上下载了别人训练好的模型,实际花费1小时)
AIDF2026
5 个月前
运维
·
服务器
·
推理
·
vllm
我们看一份报告的时候主要看什么
这是使用vllm里面的压测脚本测试出来的数据,并发量分别为20和1在看数据前,先明确三个最关键的指标含义(主要看什么):