qwen3.8

论文复现现场6 天前
模型量化·vllm·a100·大模型部署·int8·fp8·qwen3.8
A100 跑 Qwen3.8-27B,FP8 还是 INT8?显存、速度、精度与微调兼容性怎么选直接结论:在算家云 A100 SXM4 80GB 环境验证 Qwen3.8-27B 时,建议先用 BF16 建立基线,再重点测试 INT8 W8A8。FP8 在 A100 上通常只能走权重-only 兼容路径,不能直接套用 H100 的 FP8 性能结论。
论文复现现场9 天前
deepspeed·qlora·大模型训练·vllm·rtx4090·grpo·qwen3.8
Qwen3.8-27B 做 GRPO 需要几张 GPU?4×RTX 4090 与 8×RTX 4090 显存、vLLM 和 ZeRO-3 配置分析发布时间:2026 年 9 月 18 日直接结论:Qwen3.8-27B 做 GRPO,4×RTX 4090 只能作为 QLoRA、小 Batch、短输出的 PoC 起点;要把 vLLM Rollout 与训练进程分开,8×RTX 4090 更合理。全参数 GRPO 不建议直接用这两种配置。
SNOWPIAOP1 个月前
重构·qwen3.8·dsh·双5090
双 RTX 5090 + DSH + Qwen 3.8:本地 Agent 已经能稳定完成复杂软件重构最近我一直在测试一套本地 Agent 开发环境:一开始,我真正担心的其实不是速度,也不是模型能不能加载。
70asunflower1 个月前
人工智能·推理部署·qwen3.8
Qwen3.8-27B 在 Jetson Thor 上的 llama.cpp 部署手册(Q8_0 + MTP)文档日期:2026-08-17|本文档为公开脱敏版(原内网 IP 与用户名已替换为 <THOR_IP> / %USERPROFILE% 占位符) 设备:Jetson Thor(Blackwell T5000)|引擎:llama.cpp(GGUF)|量化:Q8_0(~29.0 GB)+ MTP 投机解码 状态:✅ 部署完成且接入 WorkBuddy(服务 http://<THOR_IP>:8080,模型 thor-qwen38-q8,实测对话通过)
东姬AI1 个月前
ai·agent·grok·deepseek·anthropic·黎曼猜想·qwen3.8
Anthropic模型36小时突破46年数学进展,同日三家前沿模型上新:当AI抽象智能逼近极限,“表现力“为什么仍是结构性空白2026年8月12日到13日,AI行业经历了极为密集的48小时。一边是Anthropic宣布,一款尚未公开发布的内部模型在36小时内将黎曼猜想的零点下界从41.6%提升至67.2%——这个数字意味着,AI在一天半里超越了人类数学家46年在这一子问题上的累积进展。另一边,DeepSeek、阿里巴巴和xAI在同一天发布了三款前沿大模型,参数规模从1.6万亿到2.4万亿不等,定价从0.43美元到2美元每百万token,性能差距却在个位数之内。
我是有底线的