llm

桦说编程5 小时前
llm·ai编程·代码规范
炮轰SDD:Spec驱动开发为何不适合绝大多数项目本文讨论的是当下 AI 编程语境中的 Specification-Driven Development(SDD,规格驱动开发) :先把需求和约束写成 Spec,再让 Coding Agent 据此规划、实现和验证代码。
我是大卫8 小时前
langchain·llm·agent
【图】一图理解LLM、LangChain、RAG、AI Agent、MCP、token、context、prompt、tool概念如果你刚接触 AI,一定会被一堆名词砸得有点晕:token、prompt、RAG、Agent、MCP……它们各自听起来都很厉害,但彼此之间到底是什么关系?今天这篇文章,我们用几张图把这套知识骨架搭起来。看完你会有一种“原来如此”的通透感。
吴佳浩8 小时前
人工智能·深度学习·llm
AI 核心技术解析|OPD:大模型开始复制的不再是知识,而是判断力作 者:吴佳浩Alben撰稿时间:2026.7.23更新时间:2026.7.29上一篇我们讲清楚了传统的知识蒸馏(Knowledge Distillation):Teacher 把"答案"教给 Student。这一篇要回答一个更进一步的问题——为什么今天 OpenAI、DeepSeek、Google 这些公司,开始不满足于只蒸馏知识,而是要蒸馏"偏好"?OPD 到底解决了什么问题,它在整个 Alignment 技术演进里处在什么位置,工程上又该怎么落地?
就是一顿骚操作9 小时前
人工智能·大模型·llm·论文解读·ai agent
Agent Loop 入门到深入:从 ReAct 到 LangGraph、Agents SDK 与 MCP这两年 “Agent” 这个词被用得很满:聊天机器人叫 agent,工具调用叫 agent,自动写代码叫 agent,多角色协作也叫 agent。真正值得抓住的不是名词,而是背后的循环结构:模型不再只是一次性回答,而是在“观察、思考、行动、再观察”的闭环里逐步推进任务。
AndrewHZ10 小时前
人工智能·gpt·深度学习·语言模型·自然语言处理·llm·多模态
【LLM技术全景】多模态大模型:当语言模型学会“看“和“听“摘要回顾本系列前 17 篇,我们一直在和文本 Token打交道:Tokenization、Embedding、Self-Attention、预训练、对齐……所有机制都建立在"一串离散文本符号"之上。
玉鸯14 小时前
python·llm·agent
RAG 全链路调优指南:从 Chunking 到 Reranker导读:RAG 出了问题,大多数情况下问题出在检索而非生成。但大多数人第一反应是调 prompt 或者换模型。这篇文章沿着 RAG 的数据管线,从 chunking 到 reranker,逐层拆解每个环节的验证方法和调优空间,核心原则是:先修上游,再动下游,每次改动都要用对指标。
贵慜_Derek14 小时前
人工智能·算法·llm
vLLM-05|MLA、Compressor、Indexer 与 SWA:Flash 注意力栈在 vLLM 里怎么落地协议层把 prompt 编成 token ids 之后,计算进入 DeepseekV4ForCausalLM.forward。Flash 的注意力实现不是标准多头注意力(MHA)单路径:在 DeepSeek V2/V3 的 MLA(Multi-head Latent Attention)底座上,按层叠加滑动窗口 SWA、可选 Compressor、以及仅在部分层出现的 Indexer 与 FlashMLA 稀疏 kernel。本文回答:compress_ratio 为 1、4、128 时,一层 atten
Revolution6115 小时前
人工智能·llm·claude
长命令运行时,Agent 怎样继续处理其他工作本文是「从零理解 Claude Code:20 个 Agent Harness 机制」系列的第 13 篇。 对应源码:s13_background_tasks 源码仓库:shareAI-lab/learn-claude-code
AINative软件工程17 小时前
llm·测试·前端工程化
LLM 应用的 Eval 数据工程实践:Golden Set 构建、版本管理与生产 Trace 回放你的 eval 跑绿了,但上线之后用户还是骂——因为你的测试数据集三个月没更新,早就过时了。大多数团队把 90% 的 eval 精力花在写评估逻辑上:设计 judge prompt、选 LLM-as-judge 还是规则打分、确定阈值。
浮生望17 小时前
llm
大模型 Benchmark 全面解析:MMLU、GPQA、HumanEval,读懂 AI 模型的"成绩单"摘要: 拆解大模型Benchmark体系,详解MMLU综合知识、GPQA高级推理、HumanEval代码能力、AIME数学、C-Eval中文能力五大基准,揭穿厂商选择性展示套路,建立看懂模型成绩单认知框架。
浮生望17 小时前
llm
GPT 5.6 的真正变革:从"最强模型"到"最合适模型",AI 工程范式正在重置摘要: GPT 5.6以Sol、Terra、Luna三层架构重新定义AI使用方式。跑分不再决定竞争力,真正的差距在于把什么任务分给什么模型,用更少Token和更少返工完成更高质量交付。AI正从顾问变成协作者。
孙启超2 天前
人工智能·llm·embedding·rag·向量化·chunking·文档切分
【AI应用开发】 RAG篇(三):文档切分与多路检索前两篇我们讲清了 RAG 的整体架构和向量检索原理。但这远不足以让系统"好用"——一条最容易被忽视却最为致命的链路是:文档切不好,检索等于白做。
DO_Community1 天前
人工智能·llm·agent·claude
Claude Opus 5 现已上线 DigitalOcean AI 推理云Anthropic 的 Claude Opus 5——最新旗舰级模型,现已通过 DigitalOcean 无服务器推理服务(Serverless Inference) 正式上线。Opus 5 专为高要求的 Agent 工作流设计,在复杂软件工程、科学研究和企业自动化等任务上均达到前沿水准。它支持长上下文推理、工具调用与结构化输出,同时带来了显著提升的成本效率——性能接近 Claude Fable 5,但定价仅为后者的一半。
天然玩家1 天前
llm·openai·gpt5.6
【生产力】GPT-5.6 发布:前沿智能、智能体协作与更高性价比发布日期:2026 年 7 月 9 日OpenAI 正式推出 GPT-5.6 系列模型,包括旗舰模型 GPT-5.6 Sol、面向日常工作的均衡型模型 GPT-5.6 Terra,以及成本效率最高的 GPT-5.6 Luna。
chaors1 天前
llm·github·ai编程
DeepResearchSystem 0x03:HITL之前已经基于 LangGraph 实现了 DeepRearchSystem 的核心流程,也基本能实现我们初衷想要的效果了。但是,好像我们忽略了一个问题:
武子康1 天前
人工智能·llm·agent
GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续、反事实可比较、失效可校准,并在固定预算与安全约束下改善真实决策。
liulilittle2 天前
缓存·ai·llm
LLM推理中的KV缓存与跨请求前缀复用:机制、条件与提示词摘要KV缓存是Transformer自回归推理中将解码阶段计算复杂度从平方级降为线性级的标准技术。其跨请求复用——即前缀缓存——依赖于提示词前缀在token块级别的精确匹配,任何动态内容都会破坏可复用的缓存段,触发完整预填充。本文从自注意力的数学定义出发,解析KV缓存原理,严格区分单请求内缓存与跨请求前缀缓存的工程实现差异;以分块匹配和基数树索引为背景,论述“静态前缀最大化、动态内容后置”的提示词架构设计原则。以某任务编排引擎的不可变约束注入为例,展示如何通过静态规则系统提示词后缀实现缓存复用最大化。同时
武子康1 天前
人工智能·llm·agent
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“Video VAE 在主模型之前就决定时空网格、信息损失和 token 数量,在主模型之后又决定解码峰值、分块缓存和最终伪影。本文区分 VAE、VQ-VAE 与 Tokenizer,给出张量计算、责任边界和纯重建验收方法。
一起努力啊~2 天前
笔记·学习·llm
DataWhale组队学习笔记--llm-algo-leetcode(七)控制单一变量,标准化评测推理方案,量化对比 latency / 吞吐 / 显存,选出最优推理策略。 代码实现: