gpt oss 20b 本地运行

GPT-OSS:20b 专为低延迟、本地或专用用例而设计。

注意:此型号至少需要 16GB 的统一内存(MAC)或 GPU 内存才能运行。

GPT-OSS:120b 专为生产、通用、高推理用例而设计。

注意:此型号至少需要 80GB 的统一内存或 GPU 内存才能运行。

bash 复制代码
ollama run gpt-oss:20b   

ollama run gpt-oss:120b  
相关推荐
行者全栈架构师8 小时前
从 55% 到 6%:一个快餐营养规划器的算法迭代实录
后端·算法·架构
余槐i8 小时前
无慢查询 RT 却飙升:cProfile 定位 FastAPI 事件循环阻塞
后端·python·性能优化·fastapi·asyncio
AINative软件工程8 小时前
LLM 应用的 Adaptive Batching 工程实践:动态合批把吞吐提升 3 倍,但延迟的坑你踩过吗
后端·llm·ai编程
parser8 小时前
Python 装饰器:从语法糖、闭包到 @wraps(上篇)
后端
高频因子挖掘机8 小时前
股票池一大就请求缓慢?量化系统批量获取行情的设计与优化
后端·github·api
郑州光合科技余经理8 小时前
本地生活平台搭建:跨业态用户标识怎么贯通
java·开发语言·前端·后端·uni-app·php·ai编程
Thneonl8 小时前
故意弄坏生产:混沌工程不是乱砸,是实验设计
后端·程序员
Thneonl8 小时前
别上来就 strace:60 秒十条命令看清一台病机
后端·程序员
马剑威(威哥爱编程)8 小时前
【AI全栈后端12-11】Spring Boot 把 AI 接口真正上线扛量:限流 / 降级 / 可观测
人工智能·spring boot·后端
tachibana29 小时前
Golang 中数组和切片的区别?
开发语言·后端·golang·数组·切片