小模型吊打大模型,MoE 架构效率惊人

阿里通义 Qwen3 重磅发布:小模型吊打大模型,MoE 架构效率惊人

阿里通义 Qwen3 系列大模型[1]正式推出,本次开源了 2 个 MoE 模型和 6 个密集模型。旗舰模型 Qwen3-235B-A22B 在代码、数学、通用能力等基准测试中表现出色,与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等顶级模型不相上下。

小型 MoE 模型 Qwen3-30B-A3B 仅需激活 QwQ-32B 10% 的参数就能实现更优表现;

Qwen3-4B 这样的小模型能匹敌 Qwen2.5-72B-Instruct 的性能

Qwen3 提供两种智能模式选择:

  • 思考模式:像老教授一样深思熟虑,逐步推理后给出答案,专治各种复杂疑难杂症
  • 非思考模式:秒回小能手,适合那些「快给我答案别废话」的简单问题

Qwen3 还特别强化了 Agent 和代码能力,同时加强了对 MCP 的支持。

现在已经在 Qwen Chat[2] 上免费使用啦!

不过,我看了下阿里百炼的 API 接入还没出,可能还要再等等。

Qafind 实验室发布 ChatDLM:2800 tokens/秒的极速扩散语言模型

Qafind 实验室推出 ChatDLM,官方号称世界上最快的扩散语言模型,在 A100 GPU 上可达到 2,800 tokens/秒(约DeepSeek 7B 的 30倍),拥有 131,072 tokens上下文窗口,可以处理非常长的文本。

佬们可以在官网使用,晚些时候将会开源,关注我为你持续跟进!

FASHN v1.5 发布:虚拟试穿模型

FASHN v1.5[3] 虚拟试穿模型重磅更新!本次升级支持了更高分辨率输出,并解除了宽高比限制,可以在官网使用,也可以通过 FAL 调用 API[4] 使用

OpenAI 为 ChatGPT 推出原生购物功能

OpenAI[5] 宣布 ChatGPT 搜索重大改进,即将推出购物功能。

现在用户可以直接在对话中查找、比价并完成购买。官方特别强调,所有推荐商品都是算法独立选择,绝非广告植入,我信了,你们呢

本次更新还包含其他改进:

  • 信息来源引用改进;
  • WhatsApp 用户可直接发送消息至 1-800-ChatGPT (+1-800-242-8478) 来调用 GPT 服务。
相关推荐
冬奇Lab1 天前
一天一个开源项目(第43篇):Star-Office-UI - 像素风格的 AI 办公室看板,让 AI 助手的工作状态可视化
人工智能·开源·资讯
冬奇Lab3 天前
一天一个开源项目(第41篇):Workout.cool - 现代化开源健身教练平台,训练计划与进度追踪
docker·开源·资讯
冬奇Lab4 天前
一天一个开源项目(第40篇):copyparty - 单文件便携文件服务器,断点续传/去重/多协议/媒体索引
开源·资讯
冬奇Lab5 天前
一天一个开源项目(第39篇):PandaWiki - AI 驱动的开源知识库搭建系统
人工智能·开源·资讯
冬奇Lab6 天前
一天一个开源项目(第38篇):Claude Code Telegram - 用 Telegram 远程用 Claude Code,随时随地聊项目
人工智能·开源·资讯
冬奇Lab7 天前
一天一个开源项目(第37篇):awesome-selfhosted - 自托管软件资源集合
开源·自动化运维·资讯
冬奇Lab8 天前
一天一个开源项目(第36篇):EverMemOS - 跨 LLM 与平台的长时记忆 OS,让 Agent 会记忆更会推理
人工智能·开源·资讯
冬奇Lab9 天前
一天一个开源项目(第35篇):GitHub Store - 跨平台的 GitHub Releases 应用商店
开源·github·资讯
冬奇Lab11 天前
一天一个开源项目(第33篇):MyCodeAgent - 面向学习的 Claude Code 风格代码代理框架
人工智能·开源·资讯
冬奇Lab12 天前
一天一个开源项目(第32篇):Edit-Banana - 让不可编辑的图表变成可编辑,SAM3+多模态大模型驱动
人工智能·开源·资讯