llm

孟健8 小时前
人工智能·llm·ai编程
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优大家好,我是孟健。今天刚结束本地开发工作流的压测调试,坐下来整理这篇记录。很多同行经常问我:本地跑大模型写代码,到底能不能替代云端 API?如果你的印象还停留在本地 27B 模型只能吐出 14 tok/s、光是等补全就足以打断思路的阶段,那么这套基于投机解码与底层计算图优化的方案,值得你重新算一笔账。
Flynt8 小时前
llm
HN 614 分的 16.9MB 语音模型,我在 1 核 2G 上实测了一遍语音识别模型这两年越做越大,动辄几个 GB,挑硬件像挑显卡。所以 Cactus 上周发布的 Whistle 让我多看了两眼:一个 16.9 MB 的单文件模型,CPU 直接跑,零依赖,宣称词错率(WER)在 LibriSpeech test-clean 上做到 4.3,比 145.3 MB 的 Whisper base 还低。
goehou16 小时前
docker·ai·llm·部署·教程·容器化
AI 应用上线实战:从本地脚本到 Docker 容器化(密钥、健康检查、镜像瘦身)LLM 系列又一篇。垂类 Agent 篇讲了系统架构,Harness 篇讲了开发环境——这篇讲最后一公里:上线。本地跑得好好的 AI 应用,一进容器就环境崩、密钥泄漏、启动超时,这篇把链路走通。
CopyCode16 小时前
前端·llm·agent
Agent 开发不是模型训练:一个前端的入门认知这篇文章想先讲清楚一件更基础的事:Agent 到底是什么;同时会按当前 Demo 给出一套能跟着跑通的搭建步骤,方便你自己验证 Agent Loop。
流浪00117 小时前
llm·大语言模型·rag
大模型技术全景(十八):RAG 检索增强生成与知识时效性问题📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN篇十七把幻觉的根因拆成了三层,「知识缺、知识旧」 那一层留给工程去治,治它的主流架构就是 RAG。但企业真正卡住的地方往往不是模型不够聪明,而是知识在自己手里、模型碰不到。本篇讲 RAG 是什么、为什么非它不可、哪些场景已经跑出了可核实的数字。
桃西西呀18 小时前
人工智能·spring·llm
Spring AI Alibaba 之四:拆开 ReactAgent 的图,看 ReAct 循环怎么拼出来之三把 graph-core 拆完,我说 ReactAgent 不过是把状态图引擎做的一种固定拼法。这一篇就把它真正拆开,看那张图是怎么从代码里长出来的。ReactAgent 这个类本身不复杂,复杂的是它把 ReAct 这个「模型想一下、调个工具、再想一下」的循环,翻译成图引擎能跑的节点和边。
桃西西呀19 小时前
人工智能·spring·llm
Spring AI Alibaba 之三:graph-core 状态图引擎深拆graph-core 是 SAA 真正落地的第一个增量层。它干的事很单纯,把智能体的流程建模成一张有向图:节点是动作,边是路由,整张图共享一块叫 OverAllState 的状态黑板。之上的 agent-framework 里那个 ReactAgent,不过是这张图的一种固定拼法,所以我想先把引擎本身拆清楚。
承渊政道20 小时前
人工智能·pytorch·开源·llm·chatglm
【从零开始大模型开发与微调:基于PyTorch与ChatGLM】(开源大模型ChatGLM使用详解)近几年,大模型技术的发展速度越来越快,但对于很多刚接触这一领域的开发者来说,真正的难点往往不是“知道有哪些模型”,而是如何把一个开源大模型真正跑起来、用起来,并进一步完成自己的应用开发.从环境配置、模型下载,到推理调用、参数设置、对话交互,再到后续的微调与部署,每一步都会遇到不少实际问题.在众多开源大模型中,ChatGLM 对中文场景支持较好,同时具备较完整的开源生态,非常适合作为学习大模型开发的入门对象.因此,本篇将围绕 ChatGLM 的实际使用 展开,结合PyTorch,从模型获取、环境搭建、加载运
用户7196975933581 天前
llm
Llama 3 精读|附 FP8 量化与长上下文实测Llama 3 是 Meta 的第三代开放权重模型(论文里的结果都是 7 月发布的 Llama 3.1):8B、70B、405B 三个稠密 Transformer,最大的 405B 在 15.6T token 上训练,用了 3.8×10253.8 \times 10^{25} 3.8×1025 FLOPs,约为 Llama 2 70B 的 50 倍,上下文分 6 个阶段从 8K 扩到 128K。结构几乎没变(所有规模都用 GQA,词表扩到 128K,RoPE 基频提高到 500,000),提升主要来自更多
架构师那点事儿1 天前
人工智能·架构·llm
大模型如何私有化部署到生产环境先架构设计为主+,部分已实现工程为辅。以翻译模型为例,打通「下载开源模型 → 私有化部署 → 对外提供 API」全流程
浮生望1 天前
llm·agent
给 Agent 加记忆:截断、总结与向量检索三种方案怎么取舍我做多轮对话时最早的“记忆”实现,就是把所有消息放进数组,每次请求都完整传给模型。对话少时没有问题;轮次一多,token 开销持续上涨,旧内容开始挤占上下文窗口,真正相关的信息反而被淹没。
浮链序1 天前
人工智能·python·llm
用 Claude Haiku 5.5 做子智能体路由,把 Agent 成本砍掉六成做 Agent 系统最容易被账单教做人。我带过一个内部客服 agent,一开始所有请求都丢给旗舰模型,月底一看费用,老板脸都绿了。后来我们做了一层「路由」:轻活给小模型,重活给大模型,整体开销直接腰斩。但腰斩不是白来的。路由写错了比不路由还惨——把本该重推理的请求误判成轻活丢给小模型,用户那边直接看到胡说八道,投诉比省钱更贵。所以路由的核心不是「省」,是「分得对」。我们当时是先离线跑了一周流量做意图标注,确认分布后才上路由,不是拍脑袋切,这一步省不得。
Soofjan1 天前
llm·agent
Agent基础(3):提示工程、采样参数与 Token和大模型交互,本质上是在做两件事:一是用提示词告诉模型“该怎么理解任务”,二是理解模型实际读到的并不是文字本身,而是一串 Token。前者决定输出方向,后者决定成本、上下文长度和一些看似奇怪的错误。
Soofjan1 天前
llm·agent
Agent基础(1):组成、运行机制与幻觉处理一个可用的 Agent,通常不是“一个会聊天的模型”,而是四块能力拼在一起:理解 AI Agent,可以先抓住一个核心差异:普通 AI 更像“回答问题的助手”,而智能体更像“能围绕目标持续行动的执行者”。
万联WANFLOW1 天前
llm·agent·mcp
从Agent到Agentic Collaboration:企业AI工作流背后的技术架构10月7日,Cisco在WebexOne 2026期间公布了一系列围绕Agentic Collaboration的更新,涉及Webex、Claude Managed Agents、Model Context Protocol(MCP),以及客户服务、智能办公和企业IT管理等场景。
孟健1 天前
人工智能·llm·ai编程
200 美元订阅实测:从 Agent 吞吐与缓存机制,算清 Claude 与 OpenAI 的算力账大家好,我是孟健。上周我把团队自动化编程 Agent 矩阵的主力调用通道重新梳理了一遍,并复盘了全月的算力账单。
草上飞95272 天前
人工智能·深度学习·llm
把前沿能力装进便宜产物,本身是多数模型还不会的能力原文链接:arxiv.org/abs/2610.08…这篇论文问的是一个很朴素的工程问题:一个大模型能逐条回答某个窄任务,但要对几百万条同类实例逐条调用,账单会大到不可接受;那么能不能让模型以智能体的身份,自己动手把这份能力做成一个便宜的、可反复使用的产物——训一个小模型、写一段规则程序,或者两者混用——再拿这个产物去跑完整个工作量?作者把这种能力叫作 bottling(装瓶),并搭了一个叫 BOTTLED 的基准来测它。
山顶夕景2 天前
llm·蒸馏·rlvr·opd
【OPD】Rethinking On-Policy Distillation: Phenomenology, Mechanism, and RecipeRethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 清华大学等,2026-04-15 | 代码:github.com/thunlp/OPD
goehou2 天前
ai·llm·json·agent·教程·结构化输出
LLM 结构化输出全解:从 Prompt 约束到 Schema 硬保证,三层实现怎么选LLM 系列又一篇。Function Calling 篇讲过「模型输出结构化请求」的协议细节——但那个循环里有个前提没展开:模型输出本来就是不可靠的散文,怎么让它变成代码能直接用的数据? 这篇讲透结构化输出。
AI技术新视界2 天前
人工智能·llm
微软确认 GPT‑6 使用 Looped TransformersGPT‑6 系列确实采用了 Looped Transformers:一种重复执行同一层以提升推理深度的架构。它带来更强性能,但显著降低可解释性与安全性,因此引发社区对 OpenAI 的强烈争议。