在星河社区部署大模型unsloth/Llama-3.3-70B-Instruct-GGUF

unsloth/Llama-3.3-70B-Instruct-GGUF在hf的网址:https://huggingface.co/unsloth/Llama-3.3-70B-Instruct-GGUF

在hf-mirror镜像的网址:https://hf-mirror.com/unsloth/Llama-3.3-70B-Instruct-GGUF

先上结论,速度慢,基本上1秒一个token的往外出,基本没法使用

部署unsloth/Llama-3.3-70B-Instruct-GGUF

部署很简单,进入星河社区部署页面:飞桨AI Studio星河社区-人工智能学习与实训社区

点击:新建部署,选外部资源库,输入模型url,比如

复制代码
https://huggingface.co/unsloth/Llama-3.3-70B-Instruct-GGUF

然后点击:一键部署,后面一会儿就部署好了。

使用外部库部署要比内部(也就是热门模型库)要慢很多。而且文本输出速度也很慢,只能说聊胜于无吧。

估计也就是7b、8b模型的速度还可以一用。另外文心自己的21b模型,速度也还将就,至少咱也有免费的大模型用,还要啥自行车!

相关推荐
云卷云舒___________3 小时前
Gemini 4-Flash曝光?Argon现身Antigravity?Carbon新检查点?Ultra模式齐亮相? 谷歌憋大招!| 10月10日 AI日报
ai·谷歌·gemini·ai日报·aistudio·antigravity·gemini4
阡陌数智1 天前
Llama 4 MoE 架构深度拆解:交替稀疏专家设计与生产环境推理落地实战
架构·llama
论文复现现场1 天前
8卡4090能跑70B吗?Llama-2显存预算、QLoRA与通信瓶颈
人工智能·深度学习·分布式训练·llama·显存·qlora·算家云
Vd7H20A72 天前
Windows 下用 llama.cpp 运行 Qwen3.8-27B 并开启 512K 上下文 完全指南
windows·llama
jason.zeng@15022072 天前
(六)Prompt 优化
python·ai·langchain·prompt·ai编程·llama
jason.zeng@15022072 天前
(八)现有架构上新增一个通用Excel导出工具
python·架构·langchain·excel·llama
jason.zeng@15022072 天前
(九)多轮对话式新增维修记录实现方案
python·prompt·交互·llama
jason.zeng@15022073 天前
(五)多轮对话上下文,实现交互。
python·交互·llama
jason.zeng@15022073 天前
(十)分层架构的多文件工程
python·架构·prompt·交互·ai编程·llama
n112125 天前
4G 显存老显卡怎么跑模型:llama.cpp 加 GGUF 配置
llama·llama.cpp·本地大模型·gguf