老显卡能否运行大语言模型

  1. Meta-Llama-3.1-8B-Instruct

TITAN X Pascal x 2 10.9 token/s 占用显存16.8G

4090 62.6 token/s 占用显存15.6G

  1. Meta-Llama-3.1-8B-Instruct-GPTQ-INT4

TITAN X Pascal 10.4 token/s 占用显存6.5G

3060TI 50.4 token/s 占用显存5.6G

4090 85.0 token/s 占用显存6.2G

3、Meta-Llama-3.1-70B-Instruct-GPTQ-INT4

4090x4 23.6 token/s 占用显存40.8G

如果跑Meta-Llama-3.1-8B-Instruct需要一张大显存显卡,如果跑量化版本Meta-Llama-3.1-8B-Instruct-GPTQ-INT4一般显存显卡也能跑,TITAN X Pascal与1080TI相当,老显示卡也能战大语言模型,只是速度相对慢一些。

相关推荐
xcLeigh1 分钟前
AI 编程的未来趋势:2025-2026 年你必须关注的六大技术方向
人工智能·ai·ai编程
xcLeigh1 分钟前
88%在用,不到10%完成规模化部署——AI Agent落地差在哪里
人工智能
一见已难忘1 分钟前
产业AI落地技术解析:边缘部署、工业视觉检测与多传感器融合预警的工程实践(燎原:我看见的智能中国)
人工智能·计算机视觉·视觉检测
小燕子~~3 分钟前
Photoshop2026新版 AI 功能实测,看这一篇就够了
图像处理·人工智能·ai·aigc·photoshop
星河耀银海4 分钟前
数据解析:AI返回JSON数据在HTML5中的渲染方法
人工智能·json·html5
秦先生在广东7 分钟前
构筑 AI Agent 的实时安全防线:Harness 与 AWS AgentCore Gateway 的深度集成解析
人工智能
秦先生在广东12 分钟前
可审计决策原语:重塑 Agent 循环中的治理与信任
人工智能
米小虾19 分钟前
一周 AI 观察(9.23–9.30):越狱的 Agent、腰斩的价格,与一场关于 GPU 的金融赌局
人工智能
秦先生在广东25 分钟前
AI 时代的交付新瓶颈:从代码生成速度到生产环境持续信任
人工智能
米小虾29 分钟前
把调度器扔了:微软 Agensh 让 1024 个编码 Agent 自组织,但收益正在变平
人工智能