大模型部署

进军的码农4 天前
大模型部署·deepseek·qwen3·浪潮服务器·gpu服务器·glm-5.2
浪潮服务器怎么选?DeepSeek V4、GLM-5.2、Qwen3三大开源模型本地部署方案与代理商选购指南基于公开资料整理,不构成商业推荐。文中代理商信息均来自浪潮官方合作伙伴门户、爱企查、天眼查等公开渠道。
维核科技7 天前
ai·私有化部署·llama·大模型部署·私有化大模型部署
Llama 3.3 vs Qwen2.5 vs DeepSeek-R1开源大模型选型实战对比一、选型背景:开源大模型格局剧变2024至2026年,开源大语言模型(LLM)生态经历了前所未有的洗牌。Meta的Llama系列、阿里云的Qwen系列以及深度求索(DeepSeek)旗下的R1/V3系列,共同构成了当前中文开发者圈最具影响力的三大开源阵营。三者在模型架构、训练范式、能力侧重与商业授权上各具特色,也让技术选型变得前所未有地复杂。
circuitsosk9 天前
python·云原生·agent·vllm·推理加速·大模型部署·ensorrt-llm
不止于API调用:大模型推理加速与云原生服务化部署指南训练一个效果好、能力强的模型,在今天已经不再是最大的门槛。真正考验工程能力的,是把这个动辄几十GB、甚至上百GB的“巨兽”,在保障生成质量的前提下,用尽可能低的延迟和成本,稳定地服务成千上万的用户。
咋吃都不胖lyh1 个月前
大模型部署
VSCode 通过官方的 Remote - SSH 插件实现远程开发VSCode 通过官方的 Remote - SSH 插件实现远程开发:代码文件、运行环境、算力 / 显存全部在云服务器上,你本地的 VSCode 只是一个编辑界面,体验和在本地写代码几乎一致。
薛定谔的猫19821 个月前
大模型部署·lmdeploy
LMDeploy安装及部署 Qwen/Qwen3-0.6B教程https://internlm.intern-ai.org.cn/ 书生·浦语欢迎来到 LMDeploy 的中文教程! — lmdeploy 教程
rebibabo2 个月前
人工智能·vllm·推理加速·大模型部署·kvcache
KV Cache 与 PagedAttention 详解:理论推导 + RTX 3090 实测数据前两篇文章分别建立了 BF16 基线和 AWQ INT4 量化实验,我们发现了一个有趣的现象:AWQ 量化把模型权重从 14 GB 压缩到 4 GB,TPOT 降了 65%,但吞吐却翻了一倍多——这个倍数远超 TPOT 降幅能解释的范围。
Python私教2 个月前
人工智能·语言模型·qwen·ollama·本地大模型·大模型部署·deepseek
Cursor + Claude Code 全流程实战:搭一套生产级 AI 编程工作流(2026 最新版)这是专栏「AI编程实战:Cursor与Claude Code」的第 1 篇。读完你会得到一套可以照抄进真实项目的 AI 编程工作流:Cursor 与 Claude Code 各自的定位与协作分工、项目级提示词(rules)的写法、一个真实小项目从 0 到跑通的多文件改造、以及 8 个我在生产中真实踩过的报错的「原文 + 根因 + 解法」。不是"怎么装个插件试试看",而是"明天上班就能用上、还能少踩坑"。
小何code2 个月前
vllm·大模型部署·推理优化·pagedattention
人工智能【第55篇】大模型推理优化:vLLM与推理加速技术作者的话:随着大语言模型的规模不断增长,推理成本已成为AI应用落地的关键瓶颈。一个70B参数的模型,单次推理可能需要数GB显存和数秒延迟。vLLM等推理引擎通过PagedAttention、连续批处理等创新技术,将吞吐量提升了数十倍。本文将深入解析大模型推理优化的核心技术,并带你完成vLLM的实战部署!
碳基硅坊2 个月前
人工智能·llama·大模型部署
Qwen3.6-27B 本地部署三大工具:Ollama、LM Studio、llama.cpp 谁更快?阿里开源的 Qwen3.6-27B ,很多人想在本地跑起来。Ollama、LM Studio、llama.cpp 三个工具怎么选?
碳基硅坊3 个月前
人工智能·大模型部署·qwen3.6-27b
Mac Studio 部署 Qwen3.6-27B omlx & dflash 深度评测本地部署大语言模型一直是开发者和技术爱好者关注的焦点。当你在 Apple Silicon Mac 上运行 27B 参数级别的模型时,内存瓶颈往往是最大的挑战。今天我们带来一期硬核实测:Mac Studio M4 Max(36GB 统一内存)搭配 omlx 推理框架和 dflash 内存优化技术,部署 Qwen3.6-27B-4bit(15.7GB)的完整性能报告。
Daydream.V3 个月前
人工智能·langchain·ollama·functioncalling·大模型部署
从零搭建 AI Agent:LLM Agent+Function Calling+Dify 本地部署 + Coze 实战全攻略随着大模型技术快速发展,LLM Agent与Function Calling已成为 AI 应用落地的核心能力。传统 LLM 仅能处理文本生成,存在信息滞后、缺乏行动力、逻辑不精确三大痛点,而 Agent 通过自主规划、记忆、工具调用实现复杂任务,Function Calling 则打通大模型与外部世界的连接。
七牛云行业应用3 个月前
人工智能·docker·github·ai实战·大模型部署·claude opus 4.7·api接入
GPT-5.5 Instant vs Grok 4 完整对比【2026年5月最新】:哪个大模型更适合开发者?GPT-5.5 Instant 和 Grok 4 是截至 2026 年 5 月最受关注的两款主流大语言模型,分别由 OpenAI 和 xAI 推出。两者均在 2026 年 5 月密集更新,GPT-5.5 Instant 于 5 月 5 日正式向所有 ChatGPT 用户开放,Grok 4 则以百亿至千亿参数规模跻身性能榜前列。选哪个,取决于你的具体使用场景。
Rabbit_QL3 个月前
大模型部署
【大模型换机器部署失败原因排查】一次 `Illegal instruction` 排查:原来是虚拟机没暴露 AVX 指令集昨天在重新构建服务时,遇到了一个非常“底层”的问题。最开始看日志,还以为是业务代码、依赖或者容器环境的问题,结果一路排查下去,最后发现问题根本不在 Python,而在虚拟机 CPU 指令集。
AAI机器之心3 个月前
人工智能·macos·langchain·llm·知识库·大模型部署
在 macOS 上本地部署 Ollama + LLaMA3(附教程)在 macOS 上本地部署 Ollama + LLaMA3 非常简单,以下是完整步骤:一、系统要求1.macOS 12+
liu****4 个月前
人工智能·python·langchain·langgraph·大模型部署
LangGraph-AI应用开发框架(三)要点1:回顾AIMessage消息结构要点2:构造ToolMessage要点3:在State中访问messages
handsomestWei4 个月前
昇腾·ascend·huawei·大模型部署·deepseek
华为昇腾DeepSeek模型部署适用于华为昇腾 310P3 服务器,基于 MindIE 服务化部署 DeepSeek-R1 系列模型,并通过 curl 调用 OpenAI 兼容接口进行对话验证。
liu****4 个月前
人工智能·python·langchain·大模型部署
LangChain-AI应用开发框架(二)目录一.认识嵌入模型1. 什么是嵌入模型?2. 嵌入模型应用场景3.主流的嵌入模型二.嵌入模型接入方式
YoanAILab5 个月前
大模型部署·ai平台·ai工程·ai基础设施·ai项目实战
大模型平台是怎么跑起来的?从 GPU 到 API 全链路拆解(工程视角)很多人在接触大模型时,通常只关注:但在实际工程项目中,更关键的问题是:❓ 模型是怎么“跑起来”的?从 GPU 到最终 API 服务,中间到底经历了什么?
长路 ㅤ   6 个月前
向量数据库·大模型部署·langchain4j·智能体agent·ai后端技术
长路的AI领域技术博客汇总文档博主介绍:✌目前全网粉丝4W+,csdn博客专家、Java领域优质创作者,博客之星、阿里云平台优质作者、专注于Java后端技术领域。
小C哈哈哈6 个月前
人工智能·lm studio·大模型部署·deepseek·本地部署模型
告别联网限制与隐私担忧:在自家电脑跑一个专属的DeepSeek AI很多人不明白本地部署AI大模型的意思,今天我就用通俗易懂的语言给大家讲一讲。说白了就是把原本在别人服务器(电脑里)里的 AI 大模型,安装在你自己的电脑设备上运行,全程不用连外网、不用依赖别人的电脑服务,所有的 AI 计算、数据处理都在你自己的设备里完成。