全网开测GPT-oss!技术架构也扒明白了

全网开扒 GPT-oss,惊喜发现......

奥特曼还是谦虚了,这性能岂止是 o4-mini 的水平,直接 SOTA 击穿一众开源模型。

不仅轻松通过多项性能测试,网友也整起了各种花活:

论文解读、整理数据,甚至造出类似于 Grok 4 Heavy 的 GPT-oss Pro 版。

背后架构也是被大佬们挖掘得明明白白,只能说开源真妙哇!

终于理解奥特曼提前预告的那句话是啥意思了:

即将进入 SaaS 的快时尚时代。

估计接下来 OpenAI 还有不少好东西要陆续发布......

全网开测 GPT-oss

首先,全网最关注的基准测试新鲜出炉,GPT-oss 直接登顶开源模型王座。

横扫 GPQA Diamond、AIME 2024、AIME 2025 和 Codeforces 榜单,超越 DeepSeek R1、Qwen3、Llama 4、Kimi K2 等一众开源模型。

不过在 MMLU 上确实还是 Qwen3-235B 更胜一筹,Kimi-K2 也在 SWE-Bench 上得分更高。

在核心推理基准测试中,GPT-oss 实现了与 o4-mini 等同的效果,可以在单个 80GB 的 GPU 上高效运行。

另外在一些常见基准测试中,性能也比肩 o3-mini,且只需要一个 16GB 内存的边缘设备,预计 GPT-oss 将会成为本地推理或快速迭代的理想选择,而无需昂贵的基础设施。

最小的 20B 模型可以轻松通过以下三项编码测试,比一些规模远超过它 2-3 倍的模型效果要好得多:

  • 模拟球在旋转六边形内弹跳,GPT-oss 以较高的准确性尽可能还原了真实物理情况。

    另外,AWS 今天也宣布将通过 Amazon Bedrock 和 Amazon SageMaker AI 平台正式上线该 OpenAI 开源模型,直接能够快速便捷地构建生产式 AI 应用。

    除了民间网友的实测,一些专业大佬们也加入了这场开源风暴。

    吴恩达测试 GPT-oss-120B 后,认为其性能相当强大:

    Qwen 著名研究员 Binyuan Hui 也表示如果 GPT-oss 完全使用的是合成数据训练,那么该方法将有助于小模型实现更好的性能。

    也欢迎屏幕前的你动手体验 GPT-oss,并在评论区留下你的实测结果。

    参考链接:
    1x.com/rasbt/statu...
    2cookbook.openai.com/articles/gp...
    3x.com/mattshumer_...
    4x.com/RafaCrackYT...
    5x.com/hud_evals/s...
    6simonwillison.net/2025/Aug/5/...
    7x.com/AdamZweiger...
    8x.com/arithmoquin...

    欢迎在评论区留下你的想法!

    --- 完 ---

相关推荐
怕浪猫29 分钟前
2026 年 AI Agent 面试到底考什么?这套题库覆盖了 90% 的高频考点
面试·aigc·ai编程
ii_best4 小时前
按键精灵手机端开发安卓版实战:手写一个可最小化、可拖动的「运行日志悬浮窗」(附完整 源码 + 踩坑记录)
android·ios·智能手机·自动化·ai编程·按键精灵
FluxArt4 小时前
GPT Image 2.5 中文提示词教程:Flux Art 可复用模板
前端·gpt·算法
VIP_CQCRE5 小时前
Visual Studio 也能接入统一 AI 能力:用 Ace Data Cloud + LMLocal 打通 OpenAI 兼容模型
openai·ai编程·开发工具·visual studio·acedatacloud
VIP_CQCRE6 小时前
在 Visual Studio 里接入 AI 编程助手:用 Ace Data Cloud + LMLocal 打通 OpenAI 兼容模型
ai编程·visual studio·openai兼容·ace data cloud·lmlocal
张晓宇 .6 小时前
Codex 使用教程(2026年9月 0.158 最新版):安装、国内接入 DeepSeek / GPT-6、config.toml 配置与报错排查
gpt·大模型·openai·ai编程·codex·deepseek
乃嘿仔6 小时前
AI 热点日报 · 2026-09-30
人工智能·chatgpt
泯泷8 小时前
AI 该怎样"记笔记"?——四种记忆格式与认知科学(二)
人工智能·agent·ai编程
战族狼魂8 小时前
AI Agent核心能力解析
面试·ai编程