DeepSeek V3“小版本升级” 实测堪比 V3.5,非推理模型也有 “啊哈时刻”,7 米甘蔗过 2 米门想通了

DeepSeek V3 升级了,新版本 V3-0324。

官方轻描淡写只说是 "小版本升级",但很多人实测下来可一点也不小。

把流行的小球弹跳测试,提升难度到 4 维空间超立方体也没问题。

天哪,如果这只是一个小更新,那我想象不出大更新会是什么样子。

编程这块,只需一句提示词开发一个完整产品着陆页,带自适应布局带动效,被评价为与 Claude 3.7 Sonnet 同一水平。

由于发布时间太短,还没有正式测评结果,不过在开发者 Xeophon 的个人 Benchmark 上所有指标都有大提升,成为该测试下最好的非推理模型。

不是推理模型也有 "啊哈时刻"

DeepSeek-V3-0324 并非推理模型,在回答之前不会给出思考过程,但依然遵循一定的思维方式分解问题。

走入死胡同的话,还表现出自主回到上一步重新思考的能力。

在 "9.11 和 9.9 那个大"、"Straberry 有多少个 r" 已经不成问题的今天,最新折磨 AI 的难题是"让 7 米长的甘蔗通过 2 米高 1 米宽的门"。

在量子位的测试中,DeepSeek-V3-0324 先是像它的前辈以及许多其他 AI 一样碰壁。

碰壁之后开始重新思考题目本身的含义,后面依旧陷入误区,但突然在中文解题过程中夹杂一句英语思考,类似 DeepSeek-R1 技术报告中的 "啊哈时刻"

等等,这似乎与之前的对角线方法相似,也许我遗漏了什么。

顿悟之后,突然就走上了正确的道路,注意到了题目中没直接提到的隐藏条件。

虽然从计算过程看,还是没理解到问题的本质,但好歹得出了解决方案,还认识到了自己的误区。

依旧免费, 依旧开源

像这样的优秀模型依旧免费, 依旧开源,权重文件已火速上线 HuggingFace,使用最宽松的 MIT 协议。

所有权重文件加起来占硬盘空间约 688GB,与初代 v3 保持一致,说明依然是 671B 参数的 MoE 模型,目前没有更多技术细节,还需等待官方进一步发布公告。

目前在官网和官方 APP(关闭深度思考即可)、HuggingFace 等渠道都能体验到 v3-0324。

也可以到大模型竞技场去与其他模型 pk,不过投票结果还要等一段时间才能出来。

当然最让大家期待的还是,v3 更新了,r2 还会远吗?

官网试玩:

chat.deepseek.com/

HuggingFace:

huggingface.co/deepseek-ai...

参考链接:

1\][x.com/TheXeophon/...](https://link.juejin.cn?target=https%3A%2F%2Fx.com%2FTheXeophon%2Fstatus%2F1904225899957936314 "https://x.com/TheXeophon/status/1904225899957936314") \[2\][x.com/Yuchenj_UW/...](https://link.juejin.cn?target=https%3A%2F%2Fx.com%2FYuchenj_UW%2Fstatus%2F1904223627509465116 "https://x.com/Yuchenj_UW/status/1904223627509465116") \[3\][x.com/risphereedi...](https://link.juejin.cn?target=https%3A%2F%2Fx.com%2Frisphereeditor%2Fstatus%2F1904194061780590773 "https://x.com/risphereeditor/status/1904194061780590773") --- **完** ---

相关推荐
星越华夏1 小时前
计算机视觉:YOLOv12安装环境
人工智能·yolo·计算机视觉
Yolanda942 小时前
【人工智能】《从零搭建AI问答助手项目(九):Prompt优化》
人工智能·prompt
wj3055853782 小时前
课程 9:模型测试记录与 Prompt 策略
linux·人工智能·python·comfyui
小和尚同志2 小时前
深入使用 skill-creator:结合真实生产级实践
人工智能·aigc
DevSecOps选型指南2 小时前
安全419专访悬镜安全 | 穿越周期在 AI 浪潮中定义数字供应链安全新范式
人工智能
沪漂阿龙2 小时前
面试题详解:GraphRAG 全面解析——知识图谱增强 RAG、Local Search、Global Search、社区摘要、工程落地与评估指标一次讲透
人工智能·知识图谱
WangN22 小时前
Unitree RL Lab 学习笔记【通识】
人工智能·机器学习
haina20193 小时前
海纳AI亮相《科创中国》,解码招聘“智”变之路
人工智能·ai面试·ai招聘
阿星AI工作室3 小时前
刘润年中大课笔记:一句话说清AI落地之战的本质
大数据·人工智能·创业创新·商业
YDS8293 小时前
DeepSeek RAG&MCP + Agent智能体项目 —— RAG知识库的搭建和接口实现
java·ai·springboot·agent·rag·deepseek