llm

Revolution6111 小时前
人工智能·llm·claude
多个 Agent 同时工作时,主 Agent 怎样接收队友结果本文是「从零理解 Claude Code:20 个 Agent Harness 机制」系列的第 15 篇。 源码仓库:shareAI-lab/learn-claude-code 对应章节:s15:Agent Teams
武子康11 小时前
人工智能·llm·mcp
MCP 2026-07-28 无状态核心之后:身份、任务、幂等与审计状态到底放在哪里?发布边界:规范事实按 MCP 2026-07-28 稳定版核验;operation_id、operation ledger、outcome_unknown 与审计字段属于作者架构设计,Tasks 是可选扩展,发布前复核勘误和目标 SDK 支持。
DO_Community1 天前
llm·serverless·agent·ai编程·kimi
Kimi K3 现已上线 DigitalOcean 无服务器推理Moonshot AI 的最新旗舰模型 Kimi K3——也是目前公开发布的最大规模开源模型——现已通过 DigitalOcean 无服务器推理(Serverless Inference) 正式上线。Kimi K3 专为长时自主 Agent 工作负载设计:自主编码、多步研究、以及需要在数百次工具调用中稳定运行而不丢失上下文的生产级 AI Agent。它可以通过 Serverless Inference 集成到现有应用中,享有按量计费与全托管基础设施。同时,Kimi K3 也已接入 DigitalOcean
一只小bit16 小时前
机器学习·langchain·llm·人机交互·langgraph
Agent 动态调控:模型、工具、提示词、输出、流模式模型是Agent的推理引擎,其配置方式分为静态模型和动态模型两种。在创建Agent时一次性配置,执行期间保持不变。有两种指定方式:
AINative软件工程17 小时前
架构·llm·ai编程
LLM 应用的 Graceful Degradation 工程实践:5 层降级策略让你的 AI 功能永不完全崩溃一句话定义:Graceful Degradation 不是"失败时报错",是"失败时给用户一个质量递减但仍可用的答案"。
To_OC18 小时前
前端·node.js·llm
对接大模型流式接口,我被一个 ReadableStream 卡了半小时昨天写 BFF 对接 DeepSeek 流式接口,fetch 发出去请求,response 也拿到了,200 OK,心想稳了。随手 console.log(response.body) 想看看返回啥,控制台蹦出来这么个东西:
桦说编程1 天前
llm·ai编程·代码规范
炮轰SDD:Spec驱动开发为何不适合绝大多数项目本文讨论的是当下 AI 编程语境中的 Specification-Driven Development(SDD,规格驱动开发) :先把需求和约束写成 Spec,再让 Coding Agent 据此规划、实现和验证代码。
我是大卫1 天前
langchain·llm·agent
【图】一图理解LLM、LangChain、RAG、AI Agent、MCP、token、context、prompt、tool概念如果你刚接触 AI,一定会被一堆名词砸得有点晕:token、prompt、RAG、Agent、MCP……它们各自听起来都很厉害,但彼此之间到底是什么关系?今天这篇文章,我们用几张图把这套知识骨架搭起来。看完你会有一种“原来如此”的通透感。
吴佳浩1 天前
人工智能·深度学习·llm
AI 核心技术解析|OPD:大模型开始复制的不再是知识,而是判断力作 者:吴佳浩Alben撰稿时间:2026.7.23更新时间:2026.7.29上一篇我们讲清楚了传统的知识蒸馏(Knowledge Distillation):Teacher 把"答案"教给 Student。这一篇要回答一个更进一步的问题——为什么今天 OpenAI、DeepSeek、Google 这些公司,开始不满足于只蒸馏知识,而是要蒸馏"偏好"?OPD 到底解决了什么问题,它在整个 Alignment 技术演进里处在什么位置,工程上又该怎么落地?
就是一顿骚操作1 天前
人工智能·大模型·llm·论文解读·ai agent
Agent Loop 入门到深入:从 ReAct 到 LangGraph、Agents SDK 与 MCP这两年 “Agent” 这个词被用得很满:聊天机器人叫 agent,工具调用叫 agent,自动写代码叫 agent,多角色协作也叫 agent。真正值得抓住的不是名词,而是背后的循环结构:模型不再只是一次性回答,而是在“观察、思考、行动、再观察”的闭环里逐步推进任务。
AndrewHZ1 天前
人工智能·gpt·深度学习·语言模型·自然语言处理·llm·多模态
【LLM技术全景】多模态大模型:当语言模型学会“看“和“听“摘要回顾本系列前 17 篇,我们一直在和文本 Token打交道:Tokenization、Embedding、Self-Attention、预训练、对齐……所有机制都建立在"一串离散文本符号"之上。
玉鸯2 天前
python·llm·agent
RAG 全链路调优指南:从 Chunking 到 Reranker导读:RAG 出了问题,大多数情况下问题出在检索而非生成。但大多数人第一反应是调 prompt 或者换模型。这篇文章沿着 RAG 的数据管线,从 chunking 到 reranker,逐层拆解每个环节的验证方法和调优空间,核心原则是:先修上游,再动下游,每次改动都要用对指标。
贵慜_Derek2 天前
人工智能·算法·llm
vLLM-05|MLA、Compressor、Indexer 与 SWA:Flash 注意力栈在 vLLM 里怎么落地协议层把 prompt 编成 token ids 之后,计算进入 DeepseekV4ForCausalLM.forward。Flash 的注意力实现不是标准多头注意力(MHA)单路径:在 DeepSeek V2/V3 的 MLA(Multi-head Latent Attention)底座上,按层叠加滑动窗口 SWA、可选 Compressor、以及仅在部分层出现的 Indexer 与 FlashMLA 稀疏 kernel。本文回答:compress_ratio 为 1、4、128 时,一层 atten
Revolution612 天前
人工智能·llm·claude
长命令运行时,Agent 怎样继续处理其他工作本文是「从零理解 Claude Code:20 个 Agent Harness 机制」系列的第 13 篇。 对应源码:s13_background_tasks 源码仓库:shareAI-lab/learn-claude-code
AINative软件工程2 天前
llm·测试·前端工程化
LLM 应用的 Eval 数据工程实践:Golden Set 构建、版本管理与生产 Trace 回放你的 eval 跑绿了,但上线之后用户还是骂——因为你的测试数据集三个月没更新,早就过时了。大多数团队把 90% 的 eval 精力花在写评估逻辑上:设计 judge prompt、选 LLM-as-judge 还是规则打分、确定阈值。
浮生望2 天前
llm
大模型 Benchmark 全面解析:MMLU、GPQA、HumanEval,读懂 AI 模型的"成绩单"摘要: 拆解大模型Benchmark体系,详解MMLU综合知识、GPQA高级推理、HumanEval代码能力、AIME数学、C-Eval中文能力五大基准,揭穿厂商选择性展示套路,建立看懂模型成绩单认知框架。
浮生望2 天前
llm
GPT 5.6 的真正变革:从"最强模型"到"最合适模型",AI 工程范式正在重置摘要: GPT 5.6以Sol、Terra、Luna三层架构重新定义AI使用方式。跑分不再决定竞争力,真正的差距在于把什么任务分给什么模型,用更少Token和更少返工完成更高质量交付。AI正从顾问变成协作者。
孙启超3 天前
人工智能·llm·embedding·rag·向量化·chunking·文档切分
【AI应用开发】 RAG篇(三):文档切分与多路检索前两篇我们讲清了 RAG 的整体架构和向量检索原理。但这远不足以让系统"好用"——一条最容易被忽视却最为致命的链路是:文档切不好,检索等于白做。