llm

孙启超15 小时前
人工智能·llm·embedding·rag·向量化·chunking·文档切分
【AI应用开发】 RAG篇(三):文档切分与多路检索前两篇我们讲清了 RAG 的整体架构和向量检索原理。但这远不足以让系统"好用"——一条最容易被忽视却最为致命的链路是:文档切不好,检索等于白做。
DO_Community2 小时前
人工智能·llm·agent·claude
Claude Opus 5 现已上线 DigitalOcean AI 推理云Anthropic 的 Claude Opus 5——最新旗舰级模型,现已通过 DigitalOcean 无服务器推理服务(Serverless Inference) 正式上线。Opus 5 专为高要求的 Agent 工作流设计,在复杂软件工程、科学研究和企业自动化等任务上均达到前沿水准。它支持长上下文推理、工具调用与结构化输出,同时带来了显著提升的成本效率——性能接近 Claude Fable 5,但定价仅为后者的一半。
天然玩家4 小时前
llm·openai·gpt5.6
【生产力】GPT-5.6 发布:前沿智能、智能体协作与更高性价比发布日期:2026 年 7 月 9 日OpenAI 正式推出 GPT-5.6 系列模型,包括旗舰模型 GPT-5.6 Sol、面向日常工作的均衡型模型 GPT-5.6 Terra,以及成本效率最高的 GPT-5.6 Luna。
chaors5 小时前
llm·github·ai编程
DeepResearchSystem 0x03:HITL之前已经基于 LangGraph 实现了 DeepRearchSystem 的核心流程,也基本能实现我们初衷想要的效果了。但是,好像我们忽略了一个问题:
武子康6 小时前
人工智能·llm·agent
GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续、反事实可比较、失效可校准,并在固定预算与安全约束下改善真实决策。
liulilittle15 小时前
缓存·ai·llm
LLM推理中的KV缓存与跨请求前缀复用:机制、条件与提示词摘要KV缓存是Transformer自回归推理中将解码阶段计算复杂度从平方级降为线性级的标准技术。其跨请求复用——即前缀缓存——依赖于提示词前缀在token块级别的精确匹配,任何动态内容都会破坏可复用的缓存段,触发完整预填充。本文从自注意力的数学定义出发,解析KV缓存原理,严格区分单请求内缓存与跨请求前缀缓存的工程实现差异;以分块匹配和基数树索引为背景,论述“静态前缀最大化、动态内容后置”的提示词架构设计原则。以某任务编排引擎的不可变约束注入为例,展示如何通过静态规则系统提示词后缀实现缓存复用最大化。同时
武子康7 小时前
人工智能·llm·agent
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“Video VAE 在主模型之前就决定时空网格、信息损失和 token 数量,在主模型之后又决定解码峰值、分块缓存和最终伪影。本文区分 VAE、VQ-VAE 与 Tokenizer,给出张量计算、责任边界和纯重建验收方法。
一起努力啊~11 小时前
笔记·学习·llm
DataWhale组队学习笔记--llm-algo-leetcode(七)控制单一变量,标准化评测推理方案,量化对比 latency / 吞吐 / 显存,选出最优推理策略。 代码实现:
孙启超8 小时前
llm·embedding·向量数据库·rag·向量化·ai应用开发·chunking
【AI应用开发】 RAG篇(一):概述与核心架构现在大模型落地业务,90% 的企业场景都会优先上 RAG(检索增强生成)。不管是知识库问答、智能客服还是私有文档助手,RAG 都是绕不开的核心方案。
DigitalOcean9 小时前
llm·agent·ai编程
Kimi K3 现已上线 DigitalOcean 无服务器推理Moonshot AI 的最新旗舰模型 Kimi K3——也是目前公开发布的最大规模开源模型——现已通过 DigitalOcean 无服务器推理(Serverless Inference) 正式上线。Kimi K3 专为长时自主 Agent 工作负载设计:自主编码、多步研究、以及需要在数百次工具调用中稳定运行而不丢失上下文的生产级 AI Agent。它可以通过 Serverless Inference 集成到现有应用中,享有按量计费与全托管基础设施。同时,Kimi K3 也已接入 DigitalOcean
tkevinjd9 小时前
大数据·python·搜索引擎·llm·agent
MiniCode 项目详解7:Memory 记忆系统一个 Coding Agent 每轮对话都是独立的——LLM 调用结束后,上下文就消失了。下次启动新 session,Agent 对之前的项目一无所知:
玉鸯10 小时前
后端·llm·agent
旧概念还是新范式?Agent 框架集体"图化"背后的矛盾与必然导读:几乎在同一时间,大多数主流 Agent 框架(LangGraph、Microsoft Agent Framework、Dify、Coze Studio)都在底层把自己变成了图执行引擎。为什么整个行业不约而同地选了同一个方向?
京东云开发者14 小时前
llm·ai编程·前端工程化
拆解海博 AI-Native 落地保障:Harness、双 Loop、知识库与技能自主迭代实践当下 AI 编程助手已成研发标配,但多数团队仅用对话式外挂 AI,靠人适配模型,存在行为不可控、流程不固定、规范难统一、知识难沉淀等问题,产出不稳、返工多,难以规模化。
得物技术15 小时前
算法·架构·llm
推荐系统体验的数字化突破:得物自动化评测平台的技术实践|AICon 文章整理在推荐系统中,CTR 和 CVR 等硬性指标往往容易通过实时数据进行观测,但新颖性、相关性等评价维度由于主观性强、反馈周期长,长期处于量化黑盒状态。本文将介绍得物自动化评测平台的建设方案。该平台通过引入大模型评测能力,将评测反馈周期从周级缩短至小时级,并在支撑单周百万级审计需求的背景下,实现了 91% 的资源成本优化。
武子康15 小时前
人工智能·llm·agent
1M Context 也会失忆:Coding Agent 为什么需要 Context Ledger发布边界:价格、会员层级、模型 ID、默认 effort、缓存与 compact 行为需在发布前复核;本文不声称已完成本地吞吐或成本实测。
mapengfei15 小时前
langchain·llm
LangChain学习背景LangChain是LLM应用复杂之后的一套工程化框架当LLM逐渐开始应用的发现:LLM应用不是一次API调用,而是一条由模型、prompt、工具、数据、记忆、流程控制、观测评估组成的链路
程序员三明治15 小时前
java·人工智能·ai·大模型·llm·prompt·rag
【AI】RAG 生成阶段的最后一公里:Prompt 设计、幻觉抑制与引用对齐这也是 RAG 最容易被低估的一段链路。团队往往会花大量时间调分块策略、Embedding 模型和 Top-K,却把生成阶段理解成“把检索结果交给大模型总结一下”。系统刚开始演示时可能没有问题,一旦进入复杂业务,错误很快就会暴露出来:模型会补充资料中不存在的细节,会把不同文档的规则拼在一起,甚至会直接用预训练知识覆盖知识库中的明确结论。
扯蛋4381 天前
langchain·llm·agent
从脱敏到审批:我用 LangChain 11 个中间件给羽毛球 AI 助手装了一整套"安全阀"一个生产级 Agent 不能只会"回答问题",还要会省钱、防泄漏、能容灾、懂审批。本文基于 LangChain 1.x Middleware 系统,结合真实羽毛球 AI 助手项目,逐一拆解 11 个中间件的配置、原理、源码级分析和实战案例。
uncle_ll1 天前
langchain·llm·agent·graph·langgraph
LangGraph 深度解析:用图结构构建下一代智能代理与多智能体系统随着大语言模型技术的快速演进,AI 应用早已从简单的单轮问答走向了复杂的自动化代理工作流。从链式调用的 LangChain 到自主决策的 ReAct 代理,开发者始终在追求更强的流程可控性、更灵活的状态管理与更可靠的循环逻辑。LangGraph 正是在这一背景下诞生的核心框架,它以图结构为基础,为构建有状态、可循环、支持人机协同的智能代理提供了一套底层、精细且高度可扩展的解决方案。