ai推理

张星河zen2 小时前
华为·ai训练·ai推理·超节点·npo·昇腾960·hi-one
4096卡、8EFLOPS、7.2T NPO:华为昇腾960超节点详解9月17日,华为全联接大会2026在上海举办。华为副董事长、轮值董事长汪涛正式发布昇腾960超节点。以下是关于昇腾960超节点的几个关键数字:全球首个采用NPO近封装光学技术的超节点,单节点4096张算力卡,FP8峰值算力8 EFLOPS,FP4算力16 EFLOPS,1PB HBM内存容量。5500个Hi-ONE光引擎替代传统方案所需的4.8万颗800G光模块,整体功耗降低超过550千瓦,系统可用度99.8%。液冷版本计划2027年第三季度上市。
视***间11 天前
gpt·ai算力·本地部署大模型·ai推理·大模型本地部署·gpt-oss·本地推理
视程空间GPT-OSS 开源大推理模型部署与使用实战教程手把手教你如何在Pandora上面部署GPT-OSS一、课程概述1.1 学习目标本教程将带领学习者完成 gpt-oss 开源大推理模型的本地化部署与交互使用,涵盖两条核心实践路径:
b_bencom1 个月前
性能优化·ai推理·thinkstation p7·硬件测评·商红科技
联想ThinkStation P7深度测评:从硬件拆解到AI推理性能,商红科技实测全记录市面上关于ThinkStation P7的文章,90%都是官方参数复制粘贴。真实性能如何?散热够不够?AI推理到底快不快?
进军的码农1 个月前
vllm·deepseek·ai推理·大模型本地部署·联想工作站·thinkstation p4
DeepSeek-V4-Pro 正式版本地部署:联想 ThinkStation P4 硬件架构拆解与推理链路全验证一台 96GB 显存的工作站,能不能扛住 DeepSeek-V4-Pro 的本地推理?这篇文章从硬件架构到部署链路逐层拆解,把"参数能不能跑"和"跑起来好不好用"两件事分开讲清楚。
dogstarhuang1 个月前
网络·gpt·大模型·api网关·ai推理·模型选型·按量计费
实战:用 API 网关统一接入 GPT-5.6,多模型路由怎么省下 80% 成本摘要: OpenAI GPT-5.6 降价最高 80%,多模型路由能让降价红利自动到账。本文用 API 网关统一接入 GPT-5.6,拆解 Luna / Terra / Sol 的选型逻辑、路由配置与成本看板实现,并给出可复现的代码与切换步骤。
AmyLin_20011 个月前
人工智能·单元测试·openai·数学推理·符号计算·ai推理·反例生成
AI 如何做出数学发现【5】- AI 数学证明怎样做单元测试:从“看起来顺”到可否证工作流系列:AI 如何做出数学发现(第 5 篇) 深度解读 OpenAI公开的GPT推演手稿《How the Ideas Came Together》,从失败路线、关键不变量与可复现实验出发,拆解 AI 参与数学发现的真实过程。涵盖球堆积、编码理论、复杂性、量子信息与极值组合,并严格区分发现笔记、正式证明、数值验证和形式化检查。 关键词:数学证明验证、AI 推理、单元测试、反例生成、符号计算、形式化证明
hhzz2 个月前
人工智能·单片机·neo4j·esp·ai推理
(九)在MCU上跑AI推理:ESP-DL vs TFLite Micro,选哪个?怎么优化?“在单片机上跑神经网络?你开玩笑吧?”2024年我听到这句话的频率很高。但到了2025年,ESP32-P4已经能在端侧跑YOLO11n目标检测,帧率稳定在15fps,功耗不到1W。
派勤电子4 个月前
边缘计算·机器视觉·工控机·ai推理·工业主机·ai工控机·ai工业应用
AI 加速卡与工控机集成优化 2026 软硬件协同实操指南摘要随着工业 AI 应用的不断深入,单一处理器的算力已经无法满足日益复杂的任务需求。AI 加速卡与工控机的集成,成为提升工业 AI 系统性能的重要手段。本文基于 17 年工控行业技术积累,系统介绍了 AI 加速卡的类型和特点,详细讲解了 AI 加速卡与工控机的硬件集成和软件优化方法,分析了集成过程中常见的问题和解决方案,并结合实际案例给出了一套完整的软硬件协同优化流程。研究表明,经过合理优化的 AI 加速卡与工控机集成系统,性能可以提升 2-5 倍,同时功耗降低 30% 以上,能够充分发挥 AI 加速卡的
Jay Kay4 个月前
ai推理
算子开发知识整理在CUDA并行编程中,Reduce(归约)和SGEMM(单精度矩阵乘法)是两种基础且关键的运算模式,其性能优化直接影响GPU计算效率。本文系统梳理了Reduce操作从基础到高级的优化技术路线(v1-v8),并简要介绍SGEMM优化思路,旨在帮助开发者深入理解GPU内存架构、线程调度机制,掌握性能瓶颈分析与优化方法,从而在实际项目中实现高效的GPU计算加速。
叶子Talk4 个月前
人工智能·数学·算法·机器学习·ai·openai·ai推理
OpenAI破解80年数学猜想,AI首次做出原创证明80年。这是著名数学家埃尔德什1946年提的一个几何猜想——在平面上放n个点,最多有多少对距离恰好为1——困住整个数学界的时间。
苏渡苇5 个月前
ai·springboot·spring ai·deepseek·ai推理·deepseek v4·自然语言生成sql
DeepSeek V4 实战:自然语言生成 SQL + 智能优化引擎DS V4实战篇:DeepSeek V4 + Spring Boot 3 + JDK 21 :万字实战教你打造AI智能编码助手
李大锤同学5 个月前
大语言模型·ai推理·gpu优化
Qwen3.5-4B-Claude-Opus部署教程:GPU显存监控与llama.cpp参数调优Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF是基于Qwen3.5-4B的推理蒸馏模型,特别强化了结构化分析、分步骤回答、代码与逻辑类问题的处理能力。该版本以GGUF量化形态交付,适合本地推理和Web镜像部署。
tiger1195 个月前
fpga开发·llm·fpga·ai推理
FPGA独立实现LLM推理方案——FlighLLM说到独立使用FPGA来完成LLM的推理,近几年有好几种方案,我们一一来解读一下它们。今天,我们首先想到的应该是几年前的FlightLLM。确切时间应该是:2024年1月,算是最早的采用FPGA来实现推理的方案了。
DO_Community6 个月前
人工智能·ai推理
DigitalOcean 收购 Katanemo Labs:迎接 Agent 时代,重塑基础设施DigitalOcean 正在全力构建全球领先的Agent 推理云。我们的使命很清晰:为 AI 原生企业提供一个坚实底座,让它们能在生产环境中大规模运行推理任务。今天,我们正式宣布收购 AI Agent 基础设施领域的领先公司 Katanemo Labs, Inc.。
DO_Community6 个月前
人工智能·aigc·ai编程·ai推理
教程:让OpenClaw一次接入Claude、Qwen、DeepSeek 多个模型本文将介绍,如何在本地安装的Openclaw中,使用DigitalOcean GradientAI 的Key配置大模型。可用的大模型包括:Claude opus、Claude Sonnet、gtp-oss、Kimi、DeepSeek、Qwen、MiniMax,以及 NVIDIA Dynamo 1.0等数十种大模型。本文中介绍的API 接入方法,对云端部署的Openclaw同样适用。
DO_Community6 个月前
人工智能·aigc·ai编程·ai推理
如何使用DigitalOcean Gradient 平台上的无服务器推理无服务器推理理所当然地成为人工智能用户技术圈和非技术圈最热门的话题之一,这背后有其充分理由。虽然部署自定义模型通常需要控制部署的方方面面,但无服务器技术免去了维护和管理模型部署及 API 端点的麻烦。这对于众多不同的智能体大语言模型用例来说,可能极为有用。
DO_Community6 个月前
人工智能·aigc·ai编程·ai推理
使用 DigitalOcean 实现 Claude Code “低配订阅 + 外部 Token”本文将介绍,通过开源工具,配合 DigitalOcean 云平台的大模型 API 服务,直接使用 Claude Opus 4.6、Sonnet 以及其他任意一种模型。价格与官方持平的同时,统一平台管理,多 team、多 token、支付宝支付。
DO_Community6 个月前
人工智能·aigc·ai推理
高性能、低成本推理新标准:NVIDIA Dynamo 1.0 现已上线 DigitalOcean 推理云平台上周在 NVIDIA GTC 上发布的 NVIDIA Dynamo 1.0 现已面向 DigitalOcean 客户开放,有助于提升性能并降低成本。NVIDIA Dynamo 1.0 在 NVIDIA GB200 NVL 系统上提供 7 倍推理性能提升,通过与 DigitalOcean 的智能推理云结合,客户可以以更低的成本获得更高性能,同时受益于无缝部署。在共同努力下,DigitalOcean 与 NVIDIA 的优化已经为 Workato 等客户实现了 67% 的成本节省,而这一代新的 Dynamo
brave and determined9 个月前
人工智能·算法·机器学习·ai实战·昇腾ai·ai推理·实战记录
CANN训练营 学习(day8)昇腾大模型推理调优实战指南训练营简介报名链接https://www.hiascend.com/developer/activities/cann20252#cann-camp-2502-intro
云雾J视界9 个月前
fpga开发·边缘计算·gpu·vitis·ai推理·azure云·异构编程
FPGA在AI时代的角色重塑:硬件可重构性与异构计算的完美结合截至2025年,半导体行业已普遍接受一个不可逆的事实:晶体管微缩带来的性能红利正在枯竭。台积电3nm工艺的每晶体管成本不降反升,而2nm以下制程面临量子隧穿、原子级制造等物理极限。国际器件与系统路线图(IRDS)明确指出,未来十年算力增长将主要依赖架构创新而非制程微缩。