qwen

程序猿编码2 小时前
大模型·llm·rk3588·qwen·推理·vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
赋创小助手8 小时前
服务器·人工智能·大模型·qwen·vllm·sglang·context长度
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异本文基于一组 Qwen3.8-27B 多平台公开基准测试,重点讨论 Benchmark 方法、推理引擎、Context、MTP、TTFT / Prefill / Decode 的技术关系。不同平台的量化和运行配方并不完全一致,因此本文不把结果当作严格的硬件排名。
论文复现现场11 小时前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
程序猿编码1 天前
大模型·qwen·推理
扔掉 vLLM!从零构建 Qwen3-8B 推理引擎,C++/CUDA 实现性能追平 98%这是一套从零开始完整实现的Qwen3-8B大模型推理栈,采用「C++/CUDA底层计算 + Go上层服务」的双层架构,不依赖PyTorch、通用推理框架等第三方组件,走精简代码路线:放弃宽泛的多模型支持,只聚焦Qwen3-8B一条完整的推理路径,换来代码干净、逻辑清晰、易于阅读与二次开发。
程序猿编码3 天前
开发语言·gpt·深度学习·神经网络·大模型·qwen
两张 3090 扛 27B:Qwen3.8-27B 大模型 DFlash2 加速版生产级落地这是一套面向生产环境的Qwen3.8-27B大模型落地方案,基于vLLM推理引擎构建,采用AutoRound W4A16 4bit量化权重,在两张24GB显存的RTX 3090显卡上通过张量并行完整运行,对外提供OpenAI兼容的标准API。
java_logo5 天前
人工智能·claude·qwen·ai 安全·kimi·模型蒸馏·anthropic
Claude 遭大规模「蒸馏」?过去 8 个月,AI 行业另一场战争被摊开了2026 年 9 月,Anthropic 发布迄今最详细的一份威胁情报报告。公开叙事里,人们更熟悉的是 Claude 被用于网络攻击、影响力操作、监控系统、诈骗,乃至武器与生物相关的高风险双用途研究。
星核0penstarry16 天前
人工智能·qwen·flash·glm-5.3·deepseek-·横向测评
三款Flash模型横向对比:GLM-5.3、DeepSeek-V4、Qwen3.8怎么选?2026年8月最后一周,国产大模型市场发生了一件值得关注的事:智谱、阿里在同一天晚上先后发布了各自的Flash新模型,DeepSeek则刚刚完成一轮备受争议的涨价。三款模型定位高度一致——用极低的价格提供接近旗舰的能力——但各自的打法和侧重点完全不同。它们贴身肉搏的价格战,也把"大模型性价比"这个话题彻底推到了台前。
晨欣16 天前
qwen·moe·gqa·kv cache·deepseek·mla·llm架构
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和 config.json 链接放到同一页,适合当作日常对照表,而不是又一个榜单。
zhangfeng113322 天前
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。直接结论关键资源(推荐先看)ROCm / PyTorch / 兼容性要点性能与注意事项快速示例命令(用于验证与启动)
云卷云舒___________23 天前
qwen·阿里·字节跳动·ai日报·豆包工作·paloma·wan30
Qwen新模型paloma现身Arena、阿里Wan3.0视频模型上线、字节豆包工作开放下载 | 8月25日 AI日报💡 今日趋势速览:Qwen新模型以paloma代号现身Arena,前端编程表现被测出可比肩Opus 5,引发社区对其定位猜测。阿里Wan3.0视频生成大模型正式上线,单次可生成30秒视频并直接读取多种文档。字节豆包工作火速上线开放下载,主打办公场景。大厂正加速将前沿模型推向实际产品落地。
老大白菜1 个月前
python·qwen·deepseek·harness
Qwen3.8-27B 本地推理 + DeepSeek Harness 配置本文档记录本机硬件环境、Qwen3.8-27B 模型的安装与推理服务部署,以及在 DeepSeek Harness(dsh)中的接入配置。支持文本 + 图片(多模态)。
虎鲸不是鱼1 个月前
大模型·多模态·qwen·lm studio·千问
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型之前已经部署了模型: https://lizhiyong.blog.csdn.net/article/details/163834176
小白跃升坊1 个月前
开源·大模型·通义千问·qwen·qwen3.8-27b
阿里云通义千问正式开源 Qwen3.8-27B:性能与成本的黄金平衡点2026年8月14日,阿里云通义千问(Qwen)正式开源 Qwen3.8 系列模型。作为系列中最受关注的成员,Qwen3.8-27B 以"性能与成本的黄金平衡点"定位,向全球开发者开放下载与商用授权。
咕噜咕噜啦啦1 个月前
人工智能·qwen·vllm
vLLM框架前言:真是学无止境啊,最近也是接触到了一些新东西,更觉前路漫漫。最值得加深印象的应该是环境隔离。开始时,我竟然直接pip安装了,可能也是因为不知道安装的是个什么概念。然后就引发了一系列环境冲突问题。跑不同工具、做不同实验,都应该创建独立虚拟环境。
liferecords1 个月前
开源·llm·qwen
Qwen3.8-Max 开源了:该不该从 Claude 切过去?💡 一句话带走:阿里把旗舰 Qwen3.8-Max(2.4 万亿参数、95B 激活、1M 上下文、原生看图看视频)发了,还宣布下周开源权重——这是 Max 系列头一回开源。多模态和"自主跑十天"的编码能力是真亮点,但标准编码基准它还排在 Claude Fable 5 后头;社区有人退订 Anthropic,也有人测了预览版直骂。把它说清楚:亮点和短板都在,能不能替 Claude,看你用在哪儿。
神奇霸王龙2 个月前
人工智能·ai·aigc·dubbo·claude·qwen·ai金融
跨厂商大模型接入实战:5大基座性能对比适用读者:想在企业 IM / 自动化工作流里跨厂商调 Qwen / Claude / SparkDesk / ERNIE 这些大模型 API 做生产部署的开发者 阅读时长:约 12 分钟 测试时间:2026 年 7 月(基于 炻光 AI 接入管理平台 公开文档)
minhuan2 个月前
qwen·大模型应用·llama3·gpt-4o·deepseek·主流大模型能力边界·claude3.5
主流大模型能力边界:GPT-4o、Claude3.5、Llama3、Qwen、DeepSeek横向对比22.6很多刚接触大模型的朋友都会陷入同一个困境:网上评测五花八门,各类模型更新速度飞快,看着GPT-4o、Claude 3.5、Llama 3、通义千问Qwen、DeepSeek一堆名字,分不清谁擅长什么、调用要花多少钱、到底能不能部署在自己业务里。
带娃的IT创业者2 个月前
人工智能·开源·qwen·开源大模型·deepseek·ai竞赛·开源策略
中国开源大模型策略:正在赢得全球AI竞赛过去一年,全球AI领域的格局发生了微妙但深刻的转变。曾经被普遍认为“美国领先,中国追赶”的叙事,如今正在被改写。一个关键变量浮出水面:开源权重(Open-Weights)模型策略。以DeepSeek、Qwen等为代表的中国AI团队,通过大规模开放模型权重,正在全球开发者社区中赢得前所未有的关注和影响力。Hacker News上近千票的热议并非偶然,它折射出一个事实:中国AI的“开放”策略,正在对抗美国AI的“封闭”和“专有”模式,并且在这场竞赛中占据了主动。
云卷云舒___________2 个月前
ai·qwen·opus·grok·deepseek·ai日报·interns2
DeepSeek V4灰度测试、马斯克Grok 4.6下周开测、上海AI实验室Intern-S2击败Opus4.8 | 7月18日 AI日报💡 今日趋势速览:DeepSeek V4灰度测试提升推理能力,马斯克Grok 4.6下周全面测试,上海AI实验室Intern-S2开源模型击败Qwen3.6和Opus4.8。
俊俊谢2 个月前
机器学习·大模型·llama·qwen·llama-factory·deepseek·hugging-face
LLaMA-Factory 部署与 DeepSeek-R1-Distill-Qwen 模型乱码问题解决全记录摘要:本文记录了在远程 A100 服务器上部署 LLaMA-Factory,并加载 DeepSeek-R1-Distill-Qwen 系列模型时遇到的输出乱码问题。通过强制指定 Qwen2Tokenizer,最终完美解决。全过程包括环境配置、CUDA 版本协调、模型下载、问题排查与修复。