技术栈
llm
张彦峰ZYF
3 小时前
人工智能
·
llm
·
agent
·
mcp
MCP 从“能连工具”到“像 Web 一样部署”——无状态核心、扩展框架与企业级 Agent 基础设施的真正分水岭
目录一、真正的变化不是“多了几个能力”,而是协议的默认世界观变了(一)五次规范迭代,构成了一条清晰的生产化路线
Darling噜啦啦
6 小时前
langchain
·
llm
·
agent
LLM 记忆管理三剑客:截断、总结、检索,彻底搞懂 Agent 的 Memory 系统
大模型是无状态的——每次对话都像第一次见面。要让 AI 记住你说过的话,就需要 Memory 系统。但简单地把所有对话塞进 prompt 会触发两个问题:上下文窗口爆了,Token 账单爆了。本文从 LangChain 的 InMemoryChatMessageHistory 出发,逐级深入三种存储方式(内存 / 文件 / 向量数据库)和三种管理策略(截断 / 总结 / 检索),附完整代码演示和 token 精确计算。建议收藏后动手实践。
今日无bug
6 小时前
前端
·
llm
·
agent
大模型的回答是怎么一个字一个字蹦出来的?前端流式输出解析
你有没有好奇过:问 ChatGPT 一个问题,它的回答是"一个字一个字往外蹦"的,而不是等几十秒一次性甩出一大段。这背后到底藏着什么前端技术?今天我们就从 0 到 1 拆解它。
桃西西呀
10 小时前
人工智能
·
数据分析
·
llm
《牛来》票房涨 1000 倍是真的吗?——2026暑期档 124 亿里的数学
这个夏天我朋友圈被同一部动画刷屏:《牛来》。零宣发、被吐槽"建模粗糙到抽象",首日票房只有 3420 元。结果到 8 月底,累计票房传出 1260 万元,猫眼预测终值 9000 万元,媒体齐刷刷地写"暴涨 1000 倍"。这中间还有 18 部影片破亿、4 部破 10 亿,《牛来》直接成了"史上最乱暑期档"里最大的变量。
tachibana2
11 小时前
网络
·
人工智能
·
ai
·
大模型
·
llm
·
agent
如何设计多 Agent 的协作与动态切换机制?
摘要:随着大语言模型(LLM)从单任务处理走向复杂跨领域业务求解,单一 Agent(单体智能体)由于 Prompt 膨胀、工具过多导致的召回稀释(Tool Dilution)、上下文污染(Context Pollution)以及规划深度不足,正迅速触碰到性能天花板。
程序员三明治
12 小时前
java
·
人工智能
·
后端
·
大模型
·
llm
·
deepseek
·
dsh
【体验毛坯房】Deep Harness 入门教程
我也来安装使用下。安装前,先来搞懂DeepSeek Harness到底是什么?我们都知道下面这个公式:
桃西西呀
13 小时前
人工智能
·
llm
·
ai编程
AI 为什么一本正经地胡说八道?3 个底层原因 + 2 个防坑法
读完你能说清"AI 编假话"到底是 bug 还是天性,并且手上有两个今晚就能用的招,让它的胡说八道少一大半。
阿黎梨梨
13 小时前
langchain
·
node.js
·
llm
AI也有记忆?LangChain Memory 管理指南
你有没有遇到过这种情况:跟 AI 聊了几轮之后,它突然问你“你叫什么名字”——而这个问题你第一轮就告诉过它了。
武子康
13 小时前
人工智能
·
llm
·
agent
删掉邮箱后,Agent Trace 仍可能泄露什么:一条可重放脱敏流水线
摘要:生产 Trace 即使删掉邮箱,仍可能通过工具结果、内部文档、secret 和准标识符组合泄密;删得过多又会破坏失败重放。本文给出 classify → transform → verify 流水线,并交付 sanitized trace、redaction manifest 与 replay invariant report。
MicrosoftReactor
14 小时前
ai
·
llm
·
生产评估
技术速递|如何在投入生产环境前评估 LLM
作者:Mariko Wakabayashi & Zixiao Chen排版:Alan Wang以下是我们在真实的密钥扫描场景中评估 LLM 时总结出的经验。
武子康
14 小时前
人工智能
·
llm
·
agent
RoboLab 解读:机器人策略评测为什么不能只看二元成功率
两个机器人策略 A 和 B 在论文或排行榜上都报告 90% 完整成功率。A 在简单抓取上稳定,但无法处理空间关系;B 经常完成大部分步骤,只在最后放置阶段失败。把它们压成同一个数字时,能力结构、失败位置、轨迹质量与统计不确定性会同时丢失。
BreezeJiang
1 天前
llm
·
agent
大模型为什么能记住上一轮?从 InMemoryChatMessageHistory 看对话 Memory
很多“多轮对话”看起来像模型记住了上下文,实际却是应用在做一件非常明确的事:保存消息,再把消息放回下一次请求。
武子康
1 天前
人工智能
·
llm
·
agent
同一套 Agent Runtime,为什么 Web、Headless 和 Python SDK 仍然不是同一个产品
同一个 Agent Runtime,只要换个 UI、包一层 HTTP 或 SDK,是不是就能变成多个产品?
还有多久拿退休金
1 天前
前端
·
llm
·
aigc
不调多模态,纯文本大模型如何给系统操作配上截图
当大模型只会吐文字,怎么让它"看懂"你的系统,还能边回答边截出带红框标注的操作图。一句话讲清楚:不用多模态模型,不用 Playwright 连浏览器,纯前端 + 一个文本大模型,就能让助手"边说边画"——文字流式回答操作步骤,同时截出当前系统页面的图,还给关键按钮画上红框。
DigitalOcean
1 天前
llm
·
agent
AI Agent如何降本?从五层技术栈到三种推理服务
近日,在白鲸出海主办的全球 AI 出海大会上,卓普云科技解决方案架构师丁可受邀发表主题演讲《AI Agent 落地的 5 层技术栈:Serverless vs Dedicated,全球部署的两种姿势怎么选》。他从 AI Agent 带来的推理成本压力出发,系统介绍了 DigitalOcean AI 原生云的五层技术栈,以及企业从产品原型走向全球规模化部署时选择推理服务的实践路径。
百工蜂Agent
1 天前
llm
·
agent
Claude Code 整体架构与设计
Claude Code 是一个基于大模型的编程 Agent:模型负责决策,它自己这几十万行 TypeScript 负责把决策变成动作——执行工具、管理上下文、守住权限。它有三种交付形态:命令行工具(CLI)、可嵌入的 SDK、MCP 服务。三种形态不是三份代码,来自同一条代码库。
桃西西呀
2 天前
人工智能
·
llm
·
ai编程
上下文窗口都卷到 100 万了,大模型为什么还在为"位置"发愁?
本文我们从一个 8 月真实刷屏的新闻开始,把它拆成 6 个递进的小问题,逐个用事实和数据解决。最后你会发现:2026 年 8 月最火的那个词——百万上下文,踩中的正是 2021 年一个被低估的老发明:RoPE(旋转位置编码)。
山顶夕景
2 天前
大模型
·
llm
·
agent
·
多模态
·
moe
【LLM】GLM-5.3-Flash模型
MVBench 和 MMVU:我们使用的参数设置为温度=1.0,top_p=0.95,最大上下文长度为 256K 个令牌。对于那些原生支持视频输入的模型,比如 Gemini 3.7 Flash,我们可以直接将原始视频作为输入进行评估。而对于那些不支持视频输入的模型,我们会采用默认的 1 帧每秒的提取策略。如果提取出的帧数超过 API 的最大限制,我们会在整个视频范围内进行均匀采样,直到达到这个最大帧数限制为止。
武子康
2 天前
人工智能
·
llm
·
agent
把生产 Agent 事故 Trace 变成可重放的回归测试集
封面 01: 退款事故修完又复发, 5 次转化是永久发布门线上 Agent 把退款工具当作查询工具, 重复创建工单, 引用了错误知识库, 团队修完 Prompt 后在工单里写一句"已解决"。几周后升级模型, 同类错误再次出现。问题不在于团队没有日志, 而在于日志没有被转换成可重放、可判定、与训练隔离的测试资产。
武子康
2 天前
人工智能
·
llm
·
agent
开放权重之后,为什么 Agent 仍然无法复现:真正缺的是可重放行为证据
同一个开放模型、同一条用户指令,两支团队做出的 Agent 可能完全不像同一个系统。一支能在工具超时后换路重试、验证外部状态再结束;另一支遇到 403 仍继续编造"操作已完成"。差别未必来自权重。系统 Prompt、工具 Schema、权限、失败样本、数据混合方式与评测器,都可能改变最后的行为。