OpenAI最强编程模型GPT-5-Codex发布!可独立编程7小时,编程效率提升10倍

今天凌晨,OpenAI 发布了基于 GPT-5 的 Codex 升级版本------GPT-5-Codex,专门针对编程任务而优化。新版本最大的突破在于引入了动态思考能力,能够根据任务复杂度自主调整处理时间,从几秒钟到长达 7 小时不等。

与之前版本的 Codex 相比,GPT-5-Codex 在处理简单任务时效率显著提高。内部数据显示,对于最底部 10% 的简单请求,新模型比标准 GPT-5 少用了93.7%的计算资源。

与此同时,GPT-5-Codex 的思考时间更长,其推理、编辑和测试代码以及迭代的时间是 GPT-5 的两倍。

在面对复杂任务时,GPT-5-Codex 表现出更强的持久性和深度思考能力。该模型能够连续工作超过 7 小时,在复杂项目上不断迭代、修复错误并运行测试,最终交付完整可用的解决方案。这种能力使得 AI 能够处理大规模代码重构等传统上需要人类开发者投入大量时间的任务。

而在 SWE-bench Verified 测试中,该模型达到了 74.5% 的准确率,优于普通 GPT-5 的72.8%。在代码重构任务中,提升更为明显,达到 51.3% 的准确率,远超 GPT-5 的 33.9%。

代码审查能力也得到了专门加强。经过专项训练的 GPT-5-Codex 在审查代码时错误率大幅降低,错误评论率从 13.7% 下降到 4.4%,同时高影响力评论的比例从 39.4% 提升到 52.4%。这意味着它不仅能更准确地发现问题,还能提供更有价值的改进建议。

OpenAI 产品负责人 Alexander Embiricos 解释说,这种性能提升主要得益于模型的动态思考能力。与传统的路由机制不同,GPT-5-Codex 可以在处理任务过程中实时调整投入的时间资源。例如,它可能在处理任务 5 分钟后决定还需要再花一个小时来完善解决方案。

同时,整个 Codex 生态系统也随着模型升级而得到增强。全新的 CLI 工具现在支持图像输入,开发者可以直接上传截图、线框图或设计稿作为参考。IDE 插件支持 VS Code 和 Cursor 等主流编辑器,实现了本地与云端环境间的无缝切换。

在安全方面,GPT-5-Codex 保持了严格的标准。模型默认在沙盒环境中运行,禁用网络访问,有效降低潜在风险。开发者可以根据需要自定义安全设置,在保证安全的前提下获得所需功能。

目前,GPT-5-Codex 已经集成到所有 ChatGPT 付费计划中,包括 Plus、Pro、Business、Edu 和 Enterprise 套餐。不同套餐提供不同的使用额度,满足从个人开发者到企业团队的各种需求。

OpenAI 首席执行官奥特曼在社交平台上透露,GPT-5-Codex 发布后迅速获得开发者认可,已经占到 Codex 总流量的 40%,并且预计很快将成为平台的主要流量来源。

看到这里,一些 GPT-4o 的忠实守护者坐不住了,纷纷在评论区为它"鸣不平"。


随着 GPT-5-Codex 的推出,AI 编程工具市场的竞争格局可能发生改变。开发者现在拥有了一个能够理解项目上下文、提供高质量代码建议、并能适应不同复杂度任务的智能编程伙伴。这不仅是开发效率的提升,还可能改变软件开发团队的工作方式。

点击算家云-高性能GPU算力租赁,AI训练推理平台,4090仅1.24元/卡时,了解更多

相关推荐
外域速览1 小时前
OpenAI 智能体「越狱」风波未平,苹果折叠屏 iPhone Ultra 下周三登场
人工智能·ios·iphone
全栈弄潮儿4 小时前
不要先问“用哪个 AI”,先盘点你的开发工作流
aigc·openai·ai编程
william_yangshun5 小时前
【AI Agent 实战】agent-vision-toolkit 中文版:给纯文本模型(DeepSeek)装上视觉能力
人工智能·多模态
杨杨杨大侠5 小时前
大模型的权重到底怎么用?拆开一个 token 的生成过程
aigc·openai·ai编程
智能体与具身智能5 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
AI智能体工作室5 小时前
生产级 RAG 检索增强架构实战:向量数据库、混合检索(Hybrid Search)、RRF 融合与重排(Rerank)全链路
人工智能
geinvse_seg6 小时前
我做了个 AI 架构审查员,把整个微服务项目通读了一遍,还顺手做成了 Skill
人工智能
李帅朋6 小时前
微分基本定义笔记
人工智能·笔记·深度学习·神经网络
醍醐实验室6 小时前
下一代端到端全模态(Omni)模型解密:离散音频 Token 化与极速双工流式交互架构
人工智能
米小虾6 小时前
你的 Agent 有 1000 万上下文,为什么第 50 轮就开始失忆?
人工智能·agent