llm

吴佳浩1 小时前
人工智能·llm·agent
今天我们讲讲大模型的“核心”技术:蒸馏(Model Distillation)作 者:吴佳浩Alben撰稿时间:2026.7.18更新时间:2026.7.23很多人都会有一个疑问。 现在开源模型遍地都是,DeepSeek 的推理成本已经低到令人惊讶,为什么各家大模型公司仍在持续投入模型蒸馏? 如果只是站在 API 使用者的角度,这个问题确实很难理解——按量付费、直接调用,多简单。但当你真正开始训练、部署和维护一个大模型时,答案会变得完全不同。 据业内普遍推测,**Claude 的实际参数规模已逼近 6 万亿。**一次完整训练,成本高达数千万甚至上亿美元;每一次在线推理,都在持续消耗
GPUStack1 小时前
ai·大模型·llm·gpu·vllm·gpu集群·gpustack
怎么优雅地在GPUStack上使用minerU?如果你搞过 AI 知识库,那你一定听过 MinerU 的大名。这家伙专治各种不服——哦不,专治各种复杂的 PDF 文档,甭管是密密麻麻的公式还是乱七八糟的表格,它都能精准地转成 Markdown 格式。在 AI 知识库里,海量的 PDF 嗷嗷待哺,等着被转成 MD 喂进去呢。
chaors3 小时前
langchain·llm·ai编程
DeepRearchSystem 0x00:初识最近在关注 跨境电商 相关的东西,难免会从网上搜索各种资料。但是吧,感觉事倍功半的几点有:正好最近也算系统性学历 LLM 相关的知识,于是就想做一个从某一议题出发最终输出系统性研究报告的 Agent。由于不仅仅是简单的搜索,而是带迭代逻辑的深度搜索。这也是 DeepRearchSystem 的缘起。
浮生望6 小时前
llm
文档切割与RAG管线:从网页爬取到语义检索的完整闭环摘要: 从网页爬取到向量检索,拆解RAG知识库构建链路:cheerio提取网页内容、RecursiveCharacterTextSplitter语义切割、向量存储与相似度检索,理解文档分块背后的设计哲学。
浮生望6 小时前
llm
知识蒸馏:大模型教小模型,远不止背答案那么简单摘要:从 DeepSeek 被指控蒸馏 OpenAI 的争议切入,拆解知识蒸馏的核心机制——硬标签只背答案,软标签才是思维方式的传承,用化学蒸馏和米其林大厨带徒弟两个类比,把暗知识的本质讲透。
leeyi1 天前
llm·aigc·agent
流式传输引擎:Eino StreamReader 源码拆解(第61篇-E47)系列「企业级 AI Agent 实现拆解」E47 篇,Part 10 生产工程篇第五章。上一篇 讲了 RAG 流水线。这篇往下看底层:LLM 的流式输出在 Eino 内部是怎么流动的——StreamReader 如何实现 fan-out、fan-in、类型转换,以及 Graph 层如何包装它。
寒水馨1 天前
windows·llm·大语言模型·llama·本地部署·ollama·模型运行
Windows下载、安装ollama-v0.32.1(附安装包OllamaSetup.exe)Ollama 是目前最流行的本地大语言模型(LLM)运行工具,在 GitHub 上已获得超过 130,000 颗星标(Stars),是 AI 开发者社区中最受关注的开源项目之一。
AINative软件工程1 天前
后端·llm·ai编程
LLM 应用的熔断降级工程实践:Circuit Breaker 不只是重试的升级版你以为给 LLM 调用加个重试就够了?直到某天凌晨,某国产大模型 API 挂了 3 小时,你的 retry storm 把下游打垮了,你才意识到熔断和降级是两回事。
wangruofeng2 天前
llm·github·openai
opencodex 解锁 Codex 任意模型,一个本地代理打通 Claude/Kimi/GLM/DeepSeek大家好,我是若风。你大概有过这种憋屈,打开 OpenAI 的 Codex CLI 或者 Claude Code,界面很顺手,Agent 跑任务也很流畅,但你就是想换个脑子试试。手里明明有 Claude 的 Max 订阅、有 Gemini 的 API、本地还跑着一个 DeepSeek,可 Codex 就是认死了它自己的后端,你 codex -m deepseek-chat 它理都不理你。
wangruofeng2 天前
llm·aigc
姚顺雨长谈:在 Anthropic 和 Gemini 训练模型,英雄主义已经过时本文整理自 YouTube 访谈视频 Yao Shunyu: Let Me Go a Little Crazy! Training Models at Anthropic & Gemini, Heroism Is Over,主持人小君,嘉宾姚顺雨(Google DeepMind 研究员,前 Anthropic)。
赵康2 天前
ai·llm·skill
AI 写代码之后,Code Review 会议怎么开写完 /weekly-report[1][2] 之后发现同一套思路还能再用一次:代码 review 会前,也得把这段时间的提交整理成一份能讲的东西。会上被问"这里为什么这么改",自己都未必答得上来,毕竟现在很多代码本身是 AI 写的,没细看过的代码讲不出个所以然。
莫逸风2 天前
java·llm·agent·agentscope
【AgentScope 2.0】 0. 学习指南版本基准:本文档基于 AgentScope 2.0 GA(v2.0.0)编写。具体版本号以 Release Notes 为准。
谢白羽2 天前
笔记·分布式·llm·论文·vllm
vllm源码剖析14-vLLM 分布式推理-专家并行EP大模型的算力与显存瓶颈,随着大模型规模越来越大,参数量动辄上百亿,但我们的显存和算力却跟不上。尤其是在 Transformer 的 Decoder 层中,除了 Attention 之外,参数量最多、计算最重的部分就是 MLP(多层感知机)层
Token炼金师2 天前
人工智能·深度学习·llm
框架的擂台:LangChain、LlamaIndex、Dify、AutoGen 与 LangGraph —— 应用框架选型五局应用框架屏蔽底层复杂度,加速大模型应用开发。本文从 LangChain 编排生态、LlamaIndex 知识增强、Dify 低代码平台、AutoGen 多 Agent 对话、LangGraph 状态图编排、框架选型决策六个切口,给出源码级对比与企业级选型框架。
wenb1n2 天前
llm
【 LLM】Agent Planning 完全指南:8 种纯 LLM 范式 + 8 种混合规划模式详解(一)💡 核心摘要 :Planning 是 Agent 面对任务时,决定“怎么做”“先做什么后做什么”“用什么工具做”的核心过程。本文系统梳理 8 种纯 LLM 规划范式与 8 种混合规划模式,每种均配有直观流程图、适用场景与工程实现要点,助你根据实际需求选择最合适的方案。
bonechips2 天前
langchain·llm
LLM 的"严谨"与"胡说":temperature、Top K + LangChain 工作流摘要:LLM是概率引擎,每个词都是从概率分布中抽出来的。temperature控制发散度,TopK限制候选池,两者配合决定输出是严谨还是创意。本文用LangChain搭双链条同一主题两套参数,直观对比真实效果。
带刺的坐椅2 天前
java·ai·llm·agent·solon
Solon AI:Tool 与 Talent 怎么选?从函数到领域专家多数 Agent 教程停在工具层:给模型一个函数 Schema,指望它会正确调用。这对 get_time、hash_string 够用;一旦模型跳过知识库检索就直接开工单,或把几十上百个 API 全塞进上下文,就会崩。
AINative软件工程2 天前
llm·ai编程
LLM 账单来了,却不知道哪个功能在烧钱:Cost Attribution 工程实践每个月 LLM 账单 6 万块,CFO 来问你"AI 写作功能花了多少钱",你答不上来。这不是成本控制问题,是工程问题。