llama

阡陌数智16 小时前
架构·llama
Llama 4 MoE 架构深度拆解:交替稀疏专家设计与生产环境推理落地实战MoE(Mixture-of-Experts,混合专家模型)早已是超大模型主流架构,但是传统 MoE 存在一个致命工程问题:不同专家被调用频次差异巨大,出现路由倾斜(Expert Imbalance)。部分专家持续高负载,另一部分专家几乎闲置,GPU 算力浪费,推理延迟抖动严重,这也是很多 MoE 模型在真实业务流量下,基准测试和线上性能差距巨大的根本原因。
论文复现现场17 小时前
人工智能·深度学习·分布式训练·llama·显存·qlora·算家云
8卡4090能跑70B吗?Llama-2显存预算、QLoRA与通信瓶颈8 张 RTX 4090 可以作为 70B 量化推理和 QLoRA 微调的候选配置,但不是全参数训练的显存保证。192GB 是八张卡的合计容量,能否运行仍取决于每卡峰值、分片策略和通信路径。
Vd7H20A72 天前
windows·llama
Windows 下用 llama.cpp 运行 Qwen3.8-27B 并开启 512K 上下文 完全指南我们要做三件事:安装 llama.cpp(一个免费的开源工具,用来在你自己电脑上跑大模型)下载 Qwen3.8-27B 模型文件(GGUF 格式,适合 llama.cpp 使用)
jason.zeng@15022072 天前
python·ai·langchain·prompt·ai编程·llama
(六)Prompt 优化针对 Text-to-SQL 场景,Prompt 优化的核心目标是消除歧义、减少模型试错、让 SQL 一步生成到位,从根源解决 max iterations 超限问题,同时大幅提升查询准确率。
jason.zeng@15022072 天前
python·架构·langchain·excel·llama
(八)现有架构上新增一个通用Excel导出工具我会在你现有架构上新增一个通用Excel导出工具,Agent 可以自动把查询到的数据生成 Excel 文件,返回下载链接。支持固化接口数据和 SQL 查询数据导出,前端点击链接就能下载文件。
jason.zeng@15022072 天前
python·prompt·交互·llama
(九)多轮对话式新增维修记录实现方案这个方案的核心是:Agent 通过多轮对话逐步收集必填信息,全部确认后自动调用固化接口写入数据库。全程自然语言一问一答,用户不用管字段格式,Agent 会主动引导、校验、确认,最后完成提交。
jason.zeng@15022072 天前
python·交互·llama
(五)多轮对话上下文,实现交互。下面给你加上多轮对话上下文功能,前端只要传同一个 session_id,就能支持连续追问(比如先问车队清单,再问「其中维修中的有几辆」),代码保持小白友好,直接替换就能用。
jason.zeng@15022072 天前
python·架构·prompt·交互·ai编程·llama
(十)分层架构的多文件工程下面将单文件 main.py 拆分为分层架构的多文件工程,遵循「单一职责、分层解耦」原则,后续加功能、改逻辑只需要找对应文件,维护成本大幅降低。
n112125 天前
llama·llama.cpp·本地大模型·gguf
4G 显存老显卡怎么跑模型:llama.cpp 加 GGUF 配置手头有块 4G 显存的老显卡,好几年前买的,平时就看看视频。今年想在家跑个本地大模型,一开始图省事装 Ollama,拉了个 7B 的模型,一跑就报 CUDA out of memory,显存直接爆掉。后来换 llama.cpp 配 GGUF 量化模型,才算在这张卡上把模型跑起来。这篇把配置和踩的坑写下来。
打工仔折腾 AI6 天前
人工智能·后端·python·深度学习·langchain·llama
LLaMA 1 到 LLaMA 3 架构演进拆解:从 RoPE、GQA 到词表扩张现在做 Agent、RAG、微调,绕不开开源权重模型。而开源权重模型里,LLaMA 系列的架构几乎成了事实上的"公共底座":Qwen、Baichuan、InternLM、DeepSeek 早期的很多设计,都能看到 LLaMA 结构的影子。所以与其一个个去看各家模型的论文,不如先把 LLaMA 这条主线吃透,再看别的模型时会快很多。
倔强的石头1066 天前
开源·大模型·llama
LLaMA系列架构详解_Meta开源大模型的技术演进摘要:LLaMA/Llama 系列值得学习,不是因为它只是 Meta 的一个模型家族,而是因为它把现代开源大模型的典型骨架集中呈现出来:Decoder-Only Transformer、RMSNorm、RoPE、SwiGLU、GQA、长上下文、指令微调和社区微调生态。本文不追逐榜单,也不猜测未公开细节,而是从开发者视角讲清楚:LLaMA 风格模型的 block 怎么组成,为什么这些组件会成为主流,如何读 config.json,以及在项目里如何选择 base/chat、上下文长度、量化和 LoRA 微调方
梅雅达编程笔记11 天前
llama·qwen·开源大模型·ai安全·模型越狱·权重投毒·大模型治理
开源模型的安全悖论——越开放,越危险?开源大模型的安全困境:开放带来民主化与创新加速,也让攻击门槛骤降、对齐可被绕过、权重后门可植入。本文以正反辩论结构拆解Llama到Qwen的生态困局,给出务实出路与开发者行动清单。
白萝卜弟弟12 天前
ai·大模型·agent·llama·qwen3.8
【大模型Qwen3.8 27B】llama.cpp 本地大模型部署与使用环境:Ubuntu 26.04(kernel 7.0.0-34)+ AMD Radeon RX 7900 XTX 24GB(gfx1100)+ Granite Ridge 核显 部署:llama.cpp b11227(Vulkan/RADV) + Qwen3.8-27B UD-Q4_K_M(16.46GB) 当前配置:上下文 131072(128k),KV q4_0,MTP 投机解码,显存 19.98GB(留 ~4GB 余量) 实测:prefill 387–781 tok/s,decode 37.7–72
仙人掌_lz12 天前
人工智能·llm·llama·vllm·判别模型·jev
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准2026 年 9 月,我把同一个 4B 模型用两种方式放到 RTX 3090 24GB 上,对外都走 OpenAI 兼容接口,做同一件事:读完一篇舆情,只回答一个字母。A 表示文中能看出具体毕业生和他的毕业院校,B 表示看不出来。
代数狂人12 天前
llama
异构双卡大模型部署指南:18GB显存突破单卡瓶颈 llama.cpp 层并行部署前几日,偶然在柜底寻得两张蒙尘已久的旧显卡。拂去岁月的浮灰,它们静默地躺在那里,仿佛两位退隐江湖的老将,等待着重新披挂上阵的号角。今日突发奇想,何不唤它们出山,让它们在这大模型风起云涌的时代,再展一番拳脚?
写bug如流水12 天前
人工智能·llama
【LLM】Qwen3.5 35B A3B 单卡 RTX 3090 部署教程本文记录在一台 Ubuntu 20.04.6、单张 RTX 3090 24GB 服务器上,使用 llama.cpp 部署 Qwen3.5-35B-A3B-Q3_K_M.gguf 多模态模型的可复现流程。
promanz13 天前
人工智能·llama
llamap.cpp 和 llama-index连接1. 启动 llama.cpp 服务器 使用 llama.cpp 二进制文件启动一个兼容 OpenAI API 的服务器。
GPU实战笔记20 天前
java·服务器·网络·人工智能·深度学习·llama
本地跑不动 llama.cpp,临时租云 GPU 怎么搭?从启动服务到环境复用本地跑 llama.cpp 时,经常会碰到一个很实际的问题:小模型还能正常使用,模型变大、上下文变长以后,本地显存、内存或者推理速度开始限制实际工作。
牛马工作号22 天前
人工智能·语言模型·llama
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战图 1:本文以 RK3588 上的文本推理为目标。板卡为概念示意,CPU 与三核 NPU 均属于 RK3588 SoC。
书源丶22 天前
网络·语言模型·embedding·llama
Qwen3-Embedding-0.6B 纯 CPU😫 痛点引入:4 核小机器跑个 0.6B 的 embedding 模型,一条长文本要等 一百多秒? 内存常年顶满、swap 疯狂读写、CPU 明明闲着却慢得离谱? 网上一搜全是「vLLM + FP16 + FlashAttention」,可你这台机器连个独显都没有🤡?