Claude 3 Opus 效果是否真的可以超过GPT-4?

实测,不仅是超过,而且我个人感觉这个差距甚至大于GPT3.5到GPT4的距离.

claude3在长篇理学论文的解析能力是非常显著的,可以扩展补完作者省略的大量运用高等数学,复变函数以及更多数理方法的计算过程,并且将中间过程补完的非常完美.不会漏符号,错符号,偏差数值之类的问题.工科许多运动学,物理学和其他机理内容都能快速扩展。

相信大的上下文可以协助复杂的代码模块去调整功能,或者去调整架构,这些都是GPT4有限的token或者昂贵的GPT4-128k所不能及的。

大家可以在AskManyAI去做claude3和gpt4的对比测试,最方便的全球大模型评测站点,支持大模型对比测试,最方便没有之一:

https://askmanyai.cn

以下部分我觉得基本正确.

opus结果opus结果原文相关内容

再补充一些跟opus的讨论结果吧,以下是过载,也就是上传了远比token大的文件中让它讨论的内容.里面的信息太多,我也很难鉴别对比原文是否足够准确.但是这个推理过程和结果还是正确的.问题是作者如何完成Cauchy问题的基本解的求解

opus单次输出结果

一句话总结,opus 碉堡了。

大家可以在AskManyAI去做claude3和gpt4的对比测试,最方便的全球大模型评测站点,支持大模型对比测试,最方便没有之一:

https://askmanyai.cn

相关推荐
墨风如雪1 分钟前
Hermes Agent 实战:让它去 X 上给我盯 AI 圈的一手消息
aigc
windliang14 分钟前
Claude Code 源码分析(一):从 claude 命令到 Agent 主循环
javascript·面试·ai编程
春风野草19 分钟前
AI Agent 前端驾驶舱实战:复杂流程如何做成用户看得懂、敢操作的界面
aigc·ai编程
雨田哥1 小时前
我使用AFSIM助手写了一个想定场景脚本
ai·afsim·ai afsim·afsim助手·afsim智能助手·afsim智能编码·afsim智能问答
万里鹏程转瞬至1 小时前
论文简读:Boogu-Image 图像生成与编辑模型
论文阅读·深度学习·aigc
ZzT1 小时前
Caveman 翻车了:号称省 65% token,官方实测只有 8.5%
ai编程·jetbrains
Sirius Wu2 小时前
OpenClaw Model Provider(模型提供商)完整详解
服务器·网络·人工智能·安全·aigc
臼犀2 小时前
大语言模型响应延迟对软件工程师尿液浓缩程度的影响 —— 一项基于水杯见底速度的观察性研究
程序员·ai编程·vibecoding
产品推荐官2 小时前
2026年AI应用开发服务商的选择逻辑:适配度比功能清单更重要
大数据·人工智能·ai·技术分享·开发经验
俊哥V2 小时前
每日 AI 研究简报 · 2026-07-27
人工智能·ai