技术栈
ai推理
b_bencom
6 天前
性能优化
·
ai推理
·
thinkstation p7
·
硬件测评
·
商红科技
联想ThinkStation P7深度测评:从硬件拆解到AI推理性能,商红科技实测全记录
市面上关于ThinkStation P7的文章,90%都是官方参数复制粘贴。真实性能如何?散热够不够?AI推理到底快不快?
进军的码农
12 天前
vllm
·
deepseek
·
ai推理
·
大模型本地部署
·
联想工作站
·
thinkstation p4
DeepSeek-V4-Pro 正式版本地部署:联想 ThinkStation P4 硬件架构拆解与推理链路全验证
一台 96GB 显存的工作站,能不能扛住 DeepSeek-V4-Pro 的本地推理?这篇文章从硬件架构到部署链路逐层拆解,把"参数能不能跑"和"跑起来好不好用"两件事分开讲清楚。
dogstarhuang
15 天前
网络
·
gpt
·
大模型
·
api网关
·
ai推理
·
模型选型
·
按量计费
实战:用 API 网关统一接入 GPT-5.6,多模型路由怎么省下 80% 成本
摘要: OpenAI GPT-5.6 降价最高 80%,多模型路由能让降价红利自动到账。本文用 API 网关统一接入 GPT-5.6,拆解 Luna / Terra / Sol 的选型逻辑、路由配置与成本看板实现,并给出可复现的代码与切换步骤。
AmyLin_2001
23 天前
人工智能
·
单元测试
·
openai
·
数学推理
·
符号计算
·
ai推理
·
反例生成
AI 如何做出数学发现【5】- AI 数学证明怎样做单元测试:从“看起来顺”到可否证工作流
系列:AI 如何做出数学发现(第 5 篇) 深度解读 OpenAI公开的GPT推演手稿《How the Ideas Came Together》,从失败路线、关键不变量与可复现实验出发,拆解 AI 参与数学发现的真实过程。涵盖球堆积、编码理论、复杂性、量子信息与极值组合,并严格区分发现笔记、正式证明、数值验证和形式化检查。 关键词:数学证明验证、AI 推理、单元测试、反例生成、符号计算、形式化证明
hhzz
1 个月前
人工智能
·
单片机
·
neo4j
·
esp
·
ai推理
(九)在MCU上跑AI推理:ESP-DL vs TFLite Micro,选哪个?怎么优化?
“在单片机上跑神经网络?你开玩笑吧?”2024年我听到这句话的频率很高。但到了2025年,ESP32-P4已经能在端侧跑YOLO11n目标检测,帧率稳定在15fps,功耗不到1W。
派勤电子
3 个月前
边缘计算
·
机器视觉
·
工控机
·
ai推理
·
工业主机
·
ai工控机
·
ai工业应用
AI 加速卡与工控机集成优化 2026 软硬件协同实操指南
摘要随着工业 AI 应用的不断深入,单一处理器的算力已经无法满足日益复杂的任务需求。AI 加速卡与工控机的集成,成为提升工业 AI 系统性能的重要手段。本文基于 17 年工控行业技术积累,系统介绍了 AI 加速卡的类型和特点,详细讲解了 AI 加速卡与工控机的硬件集成和软件优化方法,分析了集成过程中常见的问题和解决方案,并结合实际案例给出了一套完整的软硬件协同优化流程。研究表明,经过合理优化的 AI 加速卡与工控机集成系统,性能可以提升 2-5 倍,同时功耗降低 30% 以上,能够充分发挥 AI 加速卡的
Jay Kay
3 个月前
ai推理
算子开发知识整理
在CUDA并行编程中,Reduce(归约)和SGEMM(单精度矩阵乘法)是两种基础且关键的运算模式,其性能优化直接影响GPU计算效率。本文系统梳理了Reduce操作从基础到高级的优化技术路线(v1-v8),并简要介绍SGEMM优化思路,旨在帮助开发者深入理解GPU内存架构、线程调度机制,掌握性能瓶颈分析与优化方法,从而在实际项目中实现高效的GPU计算加速。
叶子Talk
3 个月前
人工智能
·
数学
·
算法
·
机器学习
·
ai
·
openai
·
ai推理
OpenAI破解80年数学猜想,AI首次做出原创证明
80年。这是著名数学家埃尔德什1946年提的一个几何猜想——在平面上放n个点,最多有多少对距离恰好为1——困住整个数学界的时间。
苏渡苇
4 个月前
ai
·
springboot
·
spring ai
·
deepseek
·
ai推理
·
deepseek v4
·
自然语言生成sql
DeepSeek V4 实战:自然语言生成 SQL + 智能优化引擎
DS V4实战篇:DeepSeek V4 + Spring Boot 3 + JDK 21 :万字实战教你打造AI智能编码助手
李大锤同学
5 个月前
大语言模型
·
ai推理
·
gpu优化
Qwen3.5-4B-Claude-Opus部署教程:GPU显存监控与llama.cpp参数调优
Qwen3.5-4B-Claude-4.6-Opus-Reasoning-Distilled-GGUF是基于Qwen3.5-4B的推理蒸馏模型,特别强化了结构化分析、分步骤回答、代码与逻辑类问题的处理能力。该版本以GGUF量化形态交付,适合本地推理和Web镜像部署。
tiger119
5 个月前
fpga开发
·
llm
·
fpga
·
ai推理
FPGA独立实现LLM推理方案——FlighLLM
说到独立使用FPGA来完成LLM的推理,近几年有好几种方案,我们一一来解读一下它们。今天,我们首先想到的应该是几年前的FlightLLM。确切时间应该是:2024年1月,算是最早的采用FPGA来实现推理的方案了。
DO_Community
5 个月前
人工智能
·
ai推理
DigitalOcean 收购 Katanemo Labs:迎接 Agent 时代,重塑基础设施
DigitalOcean 正在全力构建全球领先的Agent 推理云。我们的使命很清晰:为 AI 原生企业提供一个坚实底座,让它们能在生产环境中大规模运行推理任务。今天,我们正式宣布收购 AI Agent 基础设施领域的领先公司 Katanemo Labs, Inc.。
DO_Community
5 个月前
人工智能
·
aigc
·
ai编程
·
ai推理
教程:让OpenClaw一次接入Claude、Qwen、DeepSeek 多个模型
本文将介绍,如何在本地安装的Openclaw中,使用DigitalOcean GradientAI 的Key配置大模型。可用的大模型包括:Claude opus、Claude Sonnet、gtp-oss、Kimi、DeepSeek、Qwen、MiniMax,以及 NVIDIA Dynamo 1.0等数十种大模型。本文中介绍的API 接入方法,对云端部署的Openclaw同样适用。
DO_Community
5 个月前
人工智能
·
aigc
·
ai编程
·
ai推理
如何使用DigitalOcean Gradient 平台上的无服务器推理
无服务器推理理所当然地成为人工智能用户技术圈和非技术圈最热门的话题之一,这背后有其充分理由。虽然部署自定义模型通常需要控制部署的方方面面,但无服务器技术免去了维护和管理模型部署及 API 端点的麻烦。这对于众多不同的智能体大语言模型用例来说,可能极为有用。
DO_Community
5 个月前
人工智能
·
aigc
·
ai编程
·
ai推理
使用 DigitalOcean 实现 Claude Code “低配订阅 + 外部 Token”
本文将介绍,通过开源工具,配合 DigitalOcean 云平台的大模型 API 服务,直接使用 Claude Opus 4.6、Sonnet 以及其他任意一种模型。价格与官方持平的同时,统一平台管理,多 team、多 token、支付宝支付。
DO_Community
5 个月前
人工智能
·
aigc
·
ai推理
高性能、低成本推理新标准:NVIDIA Dynamo 1.0 现已上线 DigitalOcean 推理云平台
上周在 NVIDIA GTC 上发布的 NVIDIA Dynamo 1.0 现已面向 DigitalOcean 客户开放,有助于提升性能并降低成本。NVIDIA Dynamo 1.0 在 NVIDIA GB200 NVL 系统上提供 7 倍推理性能提升,通过与 DigitalOcean 的智能推理云结合,客户可以以更低的成本获得更高性能,同时受益于无缝部署。在共同努力下,DigitalOcean 与 NVIDIA 的优化已经为 Workato 等客户实现了 67% 的成本节省,而这一代新的 Dynamo
brave and determined
8 个月前
人工智能
·
算法
·
机器学习
·
ai实战
·
昇腾ai
·
ai推理
·
实战记录
CANN训练营 学习(day8)昇腾大模型推理调优实战指南
训练营简介报名链接https://www.hiascend.com/developer/activities/cann20252#cann-camp-2502-intro
云雾J视界
8 个月前
fpga开发
·
边缘计算
·
gpu
·
vitis
·
ai推理
·
azure云
·
异构编程
FPGA在AI时代的角色重塑:硬件可重构性与异构计算的完美结合
截至2025年,半导体行业已普遍接受一个不可逆的事实:晶体管微缩带来的性能红利正在枯竭。台积电3nm工艺的每晶体管成本不降反升,而2nm以下制程面临量子隧穿、原子级制造等物理极限。国际器件与系统路线图(IRDS)明确指出,未来十年算力增长将主要依赖架构创新而非制程微缩。
DO_Community
9 个月前
运维
·
服务器
·
人工智能
·
llm
·
aigc
·
ai推理
NVIDIA HGX™ B300 GPU Droplet 服务器,即将上线DigitalOcean 云平台!
人工智能正以史无前例的速度演进,新的模型和繁重的负载不断突破可能的边界。从复杂的大型语言模型(LLM)到精密的科学模拟,开发者与企业都需要获得最强大、最高效的算力基础设施。在 DigitalOcean,我们致力于提供顶级的算力资源,让你的团队能够以简单且经济的方式构建、部署并扩展 AI 项目。因此,我们激动地宣布:即将推出由 NVIDIA HGX™ B300 加速的 GPU Droplets,这标志着我们 GPU 产品的一次重大升级。目前,中国区及亚太企业可与 DigitalOcean 中国区独家战略合作
DO_Community
9 个月前
人工智能
·
开源
·
aigc
·
音视频
·
教程
·
ai推理
开源视频生成新标杆:美团LongCat Video全面解析与实战指南
今年涌现了大量新的视频模型,可以说 2025 年是视频建模真正主导公众对 AI 技术兴趣的第一年。随着 Sora 2 的普及,这一点变得越来越清晰。得益于 OpenAI 的一系列移动应用程序,获取视频生成工具的可能性与普及度达到了前所未有的高度。但闭源模型并非本文的重点,而这些模型的开源竞争实际上正变得比以往任何时候都更加令人印象深刻。