deepseek v3 重磅发布,ai 届「拼多多」

视频看:www.bilibili.com/video/BV1MD...

奥特曼强调"复制容易,创新很难",高度疑似在暗讽 deepseek,我感觉奥特曼有点破防,因为 deepseek 用低成本保持了与 gpt-4o 相当甚至更优的性能,这无疑给他融资带来困难。

他说这句话的原因是,此前 deepseek 说自己是 chatgpt,这是我在官网之前问的:

但其实之前 gemini 也被爆过说自己的是文心一言:

这背后的原因一个是deepseek 训练过程中,使用了 chatgpt 的数据,也没有做好训练数据的清洗,后期也没有做好模型对齐。

说实话目前模型之间相互"借鉴学习"也很常见,不存在什么道德压力,你 openai 使用广大互联网数据,这么多侵权咋不说呢?

而且据说 deepseek v3 发布不在预期内,我是倾向这个观点的,因为 v2.5 也是 12月更新了一波,deepseek 是觉得模型能力够了,先放出来一波,后面会持续进行优化的。

deepseek v3 ** **2024年12月26日 正式发布,仅耗费 557.6 万美元完成预训练。

依旧是混合专家架构,总参数量高达6710亿(之前 v2.5 是2360 亿),每次推理激活370亿参数。

DeepSeek-V3 多项评测成绩超越了 Qwen2.5-72B 和 Llama-3.1-405B 等其他开源模型,并在性能上和世界顶尖的闭源模型 GPT-4o 以及 Claude-3.5-Sonnet 不分伯仲:

livebench 排名第 5,去掉推理模型,排名第2:

聊天机器人竞技场排行榜排名第 7:

模型权重和代码完全开源,支持在 Hugging Face 下载:

官网和 api 默认都已经切换到 v3 版本了,v2.5 已经下线。

最大亮点

  • 完全开源
  • 相对优惠的价格维持目前优惠价格到 2025 年 2 月 8日:
  • 模型规模扩大近三倍,而且因为是国产模型,中文训练数据更多,会对中文用户更加友好:
  • 生成速度提升至 3 倍,从 20 TPS(每秒 20 个 token)大幅提高至 60 TPS(每秒 60 个 token):

相对缺点

  • 在非推理模型中,代码能力可能还是比不上 claude 3.5 sonnet,虽然aider 代码榜上现在是第 2名:
  • api 价格后续会上升,最重要的目前 api 还没有多模态和推理模型的选项。

模型性能:国内第一,综合性价比:世界第一。

这是 aider 评测简介:

相关推荐
fanstuck14 小时前
从0到提交,如何用 ChatGPT 全流程参与建模比赛的
大数据·数学建模·语言模型·chatgpt·数据挖掘
七牛云行业应用1 天前
3.5s降至0.4s!Claude Code生产级连接优化与Agent实战
运维·人工智能·大模型·aigc·claude
zhanglianzhao1 天前
Win 11 WSL 配置Claude code 并在VsCode中使用
ide·vscode·编辑器·claude·cladue code
有颜有货1 天前
GEO(生成引擎优化)是什么?GEO的工作流程详解
人工智能·chatgpt·geo
数研小生1 天前
用爬虫数据训练 ChatGPT 行业知识库:从数据采集到模型微调的实战指南
人工智能·爬虫·chatgpt
北杳同学2 天前
Claude Code安装与初始化
ai·claude
熙客3 天前
Claude 与 Claude Code 介绍、安装与使用
chatgpt
石去皿3 天前
Depth Viewer: 16-bit 深度图可视化工具
人工智能·chatgpt·prompt
core5123 天前
Vanna实现Text2SQL
sql·openai·text·vanna
FreeBuf_4 天前
AI扩大攻击面,大国博弈引发安全新挑战
人工智能·安全·chatgpt