llm

ltl6 小时前
llm
PagedAttention 与 Continuous Batching原文发布于 quant67.com,转载请保留出处。本篇分工(与第 13 篇互补):本篇只讲 KV block 分页 + 迭代级调度 两条机制——Continuous Batching、PagedAttention、Chunked Prefill、Prefix Caching 及其内核耦合;不做 vLLM / SGLang / TensorRT-LLM 的产品横评。引擎选型、生态与部署模式见下一篇《vLLM / SGLang / TensorRT-LLM / TGI 对比》。
@atweiwei2 天前
开发语言·后端·rust·llm·agent·rag
用 Rust 写 LLM Agent:原生工具调用、检索纠错、自适应路由、深度研究、多步规划为什么一个 Agent 框架要实现 6 种 Agent?为什么不是 1 种通吃的?每种背后的真实痛点是什么?该选哪个?能组合吗? 本文不讲代码,只讲思路。基于 langchainrust v0.8.0 的实践。
DigitalOcean12 小时前
llm·agent
在 DigitalOcean 如何提示词缓存:降低 AI 推理成本与延迟在调用大模型 API 时,很多成本其实花在了“重复阅读”上。例如,一个企业知识库应用可能会在每次请求中重复发送相同的系统提示词、工具定义和业务规则;一个 Coding Agent 也会不断把项目说明、代码上下文和历史对话重新提交给模型。即使真正变化的只有用户最后输入的一句话,模型仍然需要重新处理前面的大段内容。
only-qi13 小时前
人工智能·ai·llm·agent·react
美的AI Agent面试题的解析与思考近期整理了美的AI Agent方向实习面试全套真题。整套题目看似基础、偏向概念,但每一题都在筛选真正懂工程落地、而非只会背理论的候选人。
武子康14 小时前
人工智能·llm·agent
VLA 落地先签动作合同:从视觉语言输入到可执行控制指令VLA 能输出动作,不代表它已经能接到真实机器人。输入必须带时间和版本,动作必须声明坐标、单位、范围、频率、归一化与有效期,执行层还要核对安全责任。本文比较五类动作表示和四类动作生成路线,给出跨本体适配与项目启动清单。
武子康17 小时前
人工智能·llm·agent
SWE-1.7 的提升究竟来自哪里?接受大量强化学习后训练的 Kimi K2.7 为起点,继续进行大规模 RL一个团队把 Agent 模型从 A 换成 B,任务成功率明显上升,最容易出现的结论是:新模型的权重更强,所以换到任何系统里都能得到同样提升。
用户4693684832018 小时前
llm·agent
kimi-code 深度掌握系列文章-工具系统:从注册到执行(六)ToolManager 是 Agent 与外部世界交互的桥梁。它位于 packages/agent-core/src/agent/tool/,是 Agent 类的核心成员之一。在一个 turn 的 loop 中,LLM 返回 tool_use 停止原因后,loop 会查询 ToolManager 获取可执行的工具集合,完成工具调用的分配与执行。
今日无bug18 小时前
llm·nlp
用 Prompt 做 NLP 任务开发:几分钟构建一个推理系统仅用几分钟,我们就可以构建多个用于对文本进行推理的系统,而以前这需要熟练的机器学习人员数天到数周的时间。这就是 Prompt 工程带来的效率革命。
AINative软件工程20 小时前
node.js·llm
LLM Streaming 背压工程实践:慢客户端、断流重连与服务端缓冲区的生产设计你的 LLM 应用每秒往客户端推 50 个 token,但用户的手机浏览器已经睡着了——你的服务器还在傻傻地把这些 token 往一个没人消费的缓冲区里塞。这篇文章讲的就是这个问题,以及怎么在生产中真正解决它。
hboot1 天前
后端·langchain·llm
AI工程师第六课 - RAG检索增强生成学习代码记录仓库第五课中使用OpenAI调用模型DeepSeek 代码,作为基准测试代码:LLM 不知道你的私有数据。
用户469368483201 天前
llm·agent
kimi-code 深度掌握系列文章-对话循环TurnFlow(五)如果 Agent 类是一个乐团的指挥,那么 TurnFlow 就是指挥挥动的手臂 — 它负责将乐谱上的每个音符变为实际的演奏。从用户按下回车那一刻起,到 Agent 吐出最后一个字,TurnFlow 掌管了期间的每一个决策、每一次 LLM 调用、每一个工具的调度。本文深入剖析这个核心循环引擎的完整生命周期。
孙启超2 天前
人工智能·llm·agent·react·observation·rag·plan-execute
【AI应用开发】 Agent篇(三):规划推理:ReAct 与 Plan-Execute工具调用让 Agent 有了"手",但还是不够聪明——面对复杂任务,它需要知道先做什么、后做什么、遇到意外怎么办。
lucas_AI1 天前
llm·agent
Skill-α:教 Agent 学会自己'改说明书'💡 一句话带走:Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 \
DigitalOcean1 天前
llm·agent
多款模型最高直降 50%:DigitalOcean 无服务器推理大降价对于正在把大模型接入应用的团队来说,模型能力固然重要,但 API 调用成本仍是团队最关心的一项。尤其是 AI 编程、客服机器人、内容生成、代码辅助和 AI Agent 这类高频场景,单次请求便宜几厘钱看似不多,乘上每月数千万甚至数亿 Token 后,就会变成一笔不小的支出。
罗高1 天前
llm·agent
Hermes Agent Token 机制深度解析从一个简单的问题出发,逐层深入 Hermes Agent 的源码,完整拆解 LLM Agent 框架如何管理 token 预算、上下文窗口、自动压缩、图片处理与 API 请求构建的全流程。
众人皆醒我独醉1 天前
面试·llm·ai编程
Ray Serve:把 LLM 推理当"分布式 Actor"调度——不是 Kubernetes,是 Python 原生LLM 推理服务系列 · 第 5 篇KServe 的思路是把推理包装成 Kubernetes 原语——Deployment、Service、HPA、Istio VirtualService。这套方案在"模型即微服务"的场景里非常成熟,但它有一个隐含假设:推理是独立的、无状态的、请求-响应的。
玉鸯1 天前
前端·llm·agent
界面用完即消失:Agent 生成式 UI 的短暂性哲学与前端工程的未来导读:我的前面一篇文章讲了 AG-UI 协议——Agent 后端和前端的通信标准。但协议只是管道。管道里流的是什么?当 Agent 不仅能发文本,还能发组件描述、发完整界面时,"通信"这个词本身就不够用了。本文讨论生成式 UI 的架构哲学:三种控制模式、短暂性界面的意义,以及前端开发范式的转变。
组合缺一1 天前
llm·agent·ai编程·solon·claudecode·opencode
SolonCode v2026.8.4 发布:界面字体可调、22 种语言、记忆搜索增强打开终端就能上岗的全中文编码智能体,这一轮把「看得清、用母语、记得住」三件事一次补齐。SolonCode 是杭州无耳科技研发的企业级终端编码智能体——一位全中文驱动的数字员工,自主理解需求、规划步骤、编写代码。不挑模型、不挑平台,curl 一行装完即用。
用户469368483202 天前
llm·agent
kimi-code 深度掌握系列文章-Agent 类编排者(四)在 kimi-code 的架构中,没有比 Agent 类更中心的模块了。它就是乐团的指挥,不亲自演奏任何乐器,却协调着所有的乐手——15 个以上的子系统——在正确的时机发出正确的声音。本章深入 Agent 类的内部构造,拆解它如何将一组互相依赖的服务编织成一个能完成完整对话循环的有机整体。
牧艺2 天前
llm·agent·next.js
Knowledge Studio 本地开源版:对标百炼 RAG 控制台的架构、重难点与差异发布日期:2026-08-06 标签:RAG / Knowledge Studio / pgvector / Ollama / Next.js / 工程实践 项目:jiaxiantao/knowledge-studio · 静态预览:jiaxiantao.xyz/knowledge-s…