qwen

论文复现现场2 天前
强化学习·qwen·大模型微调·rtx4090·算家云·grpo
Qwen3.8-27B 做 GRPO 需要几张 4090?Coding Agent 显存预算与多卡验收Qwen3.8-27B 做 GRPO,不能只按模型权重计算 4090 卡数。单张 24GB 无法容纳完整 BF16 权重;多卡需求还取决于全参或 LoRA、生成并发、上下文长度,以及训练与生成是否共用 GPU。
半甜柠檬5 天前
大模型·qwen·量化·本地部署·llama.cpp
llama.cpp 部署 Qwen3.8-27B:无独显轻薄本实测一提本地部署大模型,很多人的第一反应就是得先买张四五千的显卡。我原来也这么想,直到把天天背去上班的ThinkBook 14翻开,折腾三个晚上,硬是把一个270亿参数的模型跑起来了。
slacker-kian6 天前
ai·llm·agent·qwen·beeai
BeeAI 实战:从简单对话到 Agent 的驯服之路本次实践基于 IBM 开源的 BeeAI 框架,完成了一套 12 章渐进实验(t2~t12 共 11 个作业文件),全程跑在本地 Qwen 模型上。路线从简单对话(ChatModel)出发,途经结构化输出、RequirementAgent、需求系统、ReAct、人工审批、自定义工具,最终抵达四智能体协作的旅行规划系统。本篇重点拆解 BeeAI 最有辨识度的设计——需求系统(Requirements):它把"请先思考再查资料、查资料最多两次"这类写在提示词里的软约束,变成了框架在执行层强制实施的硬协议。
梅雅达编程笔记8 天前
llama·qwen·开源大模型·ai安全·模型越狱·权重投毒·大模型治理
开源模型的安全悖论——越开放,越危险?开源大模型的安全困境:开放带来民主化与创新加速,也让攻击门槛骤降、对齐可被绕过、权重后门可植入。本文以正反辩论结构拆解Llama到Qwen的生态困局,给出务实出路与开发者行动清单。
jianpeng的工程笔记16 天前
人工智能·qwen·图像生成·comfyui
Qwen-Image-2.1 图像编辑拆解:从透明改字到多图合成大家好啊,我是 jianpeng。今天和大家聊一下 Qwen-Image-2.1。我想和你一起看几个具体的改图任务,最后再把 ComfyUI 里容易弄混的模型组件和分辨率说清楚。
Zhu75817 天前
docker·qwen·vllm
docker环境,vLLM 部署 Qwen3.8-27B内网测试环境,无法承诺在生产环境使用,仅供学习参考。全程操作无互联网。本仓库用于通过 Docker Compose 在 GPU 服务器上部署 Qwen3.8-27B(OpenAI 兼容接口),并对接 newapi 统一对外提供服务。
空 白II17 天前
大语言模型·qwen
9.20 大语言模型研究简报:Qwen Code v0.24.1从 Coding Agent 走向统一 Agent Runtime北京时间 2026 年 9 月 19 日 16:18:42 正式发布了 Qwen Code v0.24.1。
咬代码的兽19 天前
人工智能·大模型·api·qwen
Qwen3.8-Omni-Flash 发布:1M 上下文 + 原生全模态,四步跑通音视频 API今天(9 月 18 日)阿里千问团队发了 Qwen3.8-Omni-Flash,官方中文标题叫「耳聪目明,办事得力」。
程序猿编码20 天前
大模型·llm·rk3588·qwen·推理·vlm
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地这是一套面向瑞芯微RK3588 NPU硬件加速的Qwen3.5-2B视觉语言模型推理实现,完全基于原生C++构建,配套专用大模型运行时与神经网络加速引擎,完整支持单图像理解与视频序列分析两种模式。
赋创小助手20 天前
服务器·人工智能·大模型·qwen·vllm·sglang·context长度
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异本文基于一组 Qwen3.8-27B 多平台公开基准测试,重点讨论 Benchmark 方法、推理引擎、Context、MTP、TTFT / Prefill / Decode 的技术关系。不同平台的量化和运行配方并不完全一致,因此本文不把结果当作严格的硬件排名。
论文复现现场21 天前
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型直接答案:70B/72B 模型用 2 张 RTX 4090 只能主打 4-bit、低并发推理;4 张是量化部署的均衡配置;8 张可以考虑 BF16 或双副本吞吐,但性能不会随卡数线性增长。
程序猿编码21 天前
大模型·qwen·推理
扔掉 vLLM!从零构建 Qwen3-8B 推理引擎,C++/CUDA 实现性能追平 98%这是一套从零开始完整实现的Qwen3-8B大模型推理栈,采用「C++/CUDA底层计算 + Go上层服务」的双层架构,不依赖PyTorch、通用推理框架等第三方组件,走精简代码路线:放弃宽泛的多模型支持,只聚焦Qwen3-8B一条完整的推理路径,换来代码干净、逻辑清晰、易于阅读与二次开发。
程序猿编码23 天前
开发语言·gpt·深度学习·神经网络·大模型·qwen
两张 3090 扛 27B:Qwen3.8-27B 大模型 DFlash2 加速版生产级落地这是一套面向生产环境的Qwen3.8-27B大模型落地方案,基于vLLM推理引擎构建,采用AutoRound W4A16 4bit量化权重,在两张24GB显存的RTX 3090显卡上通过张量并行完整运行,对外提供OpenAI兼容的标准API。
java_logo25 天前
人工智能·claude·qwen·ai 安全·kimi·模型蒸馏·anthropic
Claude 遭大规模「蒸馏」?过去 8 个月,AI 行业另一场战争被摊开了2026 年 9 月,Anthropic 发布迄今最详细的一份威胁情报报告。公开叙事里,人们更熟悉的是 Claude 被用于网络攻击、影响力操作、监控系统、诈骗,乃至武器与生物相关的高风险双用途研究。
星核0penstarry1 个月前
人工智能·qwen·flash·glm-5.3·deepseek-·横向测评
三款Flash模型横向对比:GLM-5.3、DeepSeek-V4、Qwen3.8怎么选?2026年8月最后一周,国产大模型市场发生了一件值得关注的事:智谱、阿里在同一天晚上先后发布了各自的Flash新模型,DeepSeek则刚刚完成一轮备受争议的涨价。三款模型定位高度一致——用极低的价格提供接近旗舰的能力——但各自的打法和侧重点完全不同。它们贴身肉搏的价格战,也把"大模型性价比"这个话题彻底推到了台前。
晨欣1 个月前
qwen·moe·gqa·kv cache·deepseek·mla·llm架构
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署新开源模型一出来,开发者最容易先去看跑分、看参数量、看别人说好不好用。但真正决定你能不能部署、长上下文贵不贵、MoE 是否划算的,往往是结构本身。Sebastian Raschka 做的 LLM Architecture Gallery 把 100 多个现代 LLM 的结构图、注意力机制、decoder 类型、每 token KV cache 和 config.json 链接放到同一页,适合当作日常对照表,而不是又一个榜单。
zhangfeng11331 个月前
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。直接结论关键资源(推荐先看)ROCm / PyTorch / 兼容性要点性能与注意事项快速示例命令(用于验证与启动)
云卷云舒___________1 个月前
qwen·阿里·字节跳动·ai日报·豆包工作·paloma·wan30
Qwen新模型paloma现身Arena、阿里Wan3.0视频模型上线、字节豆包工作开放下载 | 8月25日 AI日报💡 今日趋势速览:Qwen新模型以paloma代号现身Arena,前端编程表现被测出可比肩Opus 5,引发社区对其定位猜测。阿里Wan3.0视频生成大模型正式上线,单次可生成30秒视频并直接读取多种文档。字节豆包工作火速上线开放下载,主打办公场景。大厂正加速将前沿模型推向实际产品落地。
老大白菜2 个月前
python·qwen·deepseek·harness
Qwen3.8-27B 本地推理 + DeepSeek Harness 配置本文档记录本机硬件环境、Qwen3.8-27B 模型的安装与推理服务部署,以及在 DeepSeek Harness(dsh)中的接入配置。支持文本 + 图片(多模态)。
虎鲸不是鱼2 个月前
大模型·多模态·qwen·lm studio·千问
【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型【RTX Pro 4500】Qwen3.8 27B NVFP4在LM Studio挂载多模态模型之前已经部署了模型: https://lizhiyong.blog.csdn.net/article/details/163834176