老显卡能否运行大语言模型

  1. Meta-Llama-3.1-8B-Instruct

TITAN X Pascal x 2 10.9 token/s 占用显存16.8G

4090 62.6 token/s 占用显存15.6G

  1. Meta-Llama-3.1-8B-Instruct-GPTQ-INT4

TITAN X Pascal 10.4 token/s 占用显存6.5G

3060TI 50.4 token/s 占用显存5.6G

4090 85.0 token/s 占用显存6.2G

3、Meta-Llama-3.1-70B-Instruct-GPTQ-INT4

4090x4 23.6 token/s 占用显存40.8G

如果跑Meta-Llama-3.1-8B-Instruct需要一张大显存显卡,如果跑量化版本Meta-Llama-3.1-8B-Instruct-GPTQ-INT4一般显存显卡也能跑,TITAN X Pascal与1080TI相当,老显示卡也能战大语言模型,只是速度相对慢一些。

相关推荐
正在走向自律6 小时前
用豆包Seed Evolving打造全功能【AI智能记账】小程序,开源可落地
人工智能·小程序·开源·智能记账
小保CPP6 小时前
OpenCV C++提取webp动图里的图片
c++·人工智能·opencv·计算机视觉
B8017913Y6 小时前
手动整理录音太慢错漏多?2026专业AI录音可高效整理内容
人工智能
梦想的颜色6 小时前
AI Agent 可观测性:破解多步推理黑盒|从概念、架构、指标到生产落地图鉴
人工智能·ai agent 可观测性·llm 追踪 trace·llmops 硬核实战·agent 生产运维
IT智慧客07316 小时前
Harness 到底指什么
人工智能
大模型任我行7 小时前
阿里:端到端文档解析模型OvisOCR2
人工智能·语言模型·自然语言处理·论文笔记
aixingkong9217 小时前
Atlas 950 1024卡SuperPoD推测分析
网络·人工智能·硬件架构·硬件工程
触底反弹7 小时前
🤯 面试被问 AI Workflow 和 Agent 有啥区别?3 张图 + 2 段代码讲清楚!
人工智能·设计模式·面试
步步精BBJconn7 小时前
从GPU服务器到数据中心:AI服务器高压连接器的应用与发展趋势
大数据·运维·服务器·人工智能·科技·物联网
K姐研究社7 小时前
Codex 怎么用国产模型?Kimi + CC Switch 接入配置指南
人工智能·aigc