llm

桃西西呀15 小时前
人工智能·spring·llm
Spring AI Alibaba 之七:我没写一行 tracing 埋点,Agent 每一步却被 Micrometer 看得清清楚楚我接手一个线上 Agent 排障,运营说模型偶尔抽风,但不确定是模型慢还是工具卡。我第一反应是去 SAA 代码里找它的 tracing 实现,心想这套多智能体框架总得自己埋点吧。结果 grep 了一圈 graph-core 模块,一个 Observation 都没有。再顺藤摸瓜,发现 SAA 根本没有自研的链路追踪,它只是把 Spring AI 现成的 Observation API 一路透传下去。这篇就把这条透传链路讲清楚,顺便纠正「SAA 造了一套可观测体系」这个错觉。
桃西西呀15 小时前
人工智能·spring·llm
Spring AI Alibaba 之八:我让 Agent 直接执行 shell 命令,它却读到了目录里的密钥,沙箱到底防住了什么一句话结论:SAA 没有给你一个真正的操作系统级容器,它是在「让 Agent 跑 shell」这条最大风险面上,用四层纯 Java 的筛子把伤害拦下来。会话隔离管住进程和工作区,输出治理管住超时和泄露,文件隔离管住路径越界和符号链接,钩子护栏管住 PII 和失控循环。
MoonOut17 小时前
llm
LLM | OpenAI 兼容模式 与 Anthropic 协议的区别我们在做一套用 Claude Code 自动解 code 题的系统:在一个容器里跑 cc,使用一个外层框架驱动 cc 一轮轮干活。我们想让它除了 Claude 官方模型,也能用第三方托管或自部署的开源模型(比如 GLM、Qwen),结果第一步就卡住了:Claude Code 这个客户端只支持 Anthropic 的 API 协议,而那些模型对外提供的几乎都是"OpenAI 兼容"端点,两边格式对不上,请求没法直接发。
架构师那点事儿18 小时前
llm·agent·ai编程
Agent Skill: 视频/PPT 内容提取 Skill —— 从 0 到 1 诞生记 + 使用指南最近很多网友问我: agent skill长得像什么样子? agent skill 要如何自定义一个符合自己情况的? 发现网上视频好看,但对方不给ppt怎么办,总不能一直收藏吧? 为了一次性能够比较全面的回答问题,专门试验了下最大合集的实验。 第一部分复盘「这个 Skill 是怎么从一次真实任务里被提炼出来的」 —— 一套可迁移的**「把一次性任务沉淀为可复用 Skill」的方法论**; 第二部分告诉别人「怎么用这个 Skill」。 附件会分享skill.md 以及运行记录
lucas_AI18 小时前
llm
CPSE:只给 3 篇范文,让 LLM 学会你的 478 字段抽取 schema,还不许动接口💡 一句话总结:中国科大团队的 CPSE 解决一个特别真实的工程痛:schema 设计好了、下游接口也接好了,但 LLM 就是抽不可靠,而你只有三五份已核验的标注。它的做法是把 schema 拆成「冻结的结构契约 + 可变的字段语义」,用文本反馈自动校准提示词和字段描述,再让模型「先列材料清单、再按清单填空」——聚合物论文抽取提升 9.93 分,输出 100% 合法,接口一个字节没动。
AINative软件工程19 小时前
后端·llm·ai编程
LLM 应用的 Adaptive Batching 工程实践:动态合批把吞吐提升 3 倍,但延迟的坑你踩过吗上线三个月的 RAG 服务,Embedding 阶段每天凌晨批量处理 10 万条文档,跑了 6 小时,API 账单快到上限。
范中勤20 小时前
redis·langchain·llm·缓存架构·多用户隔离
LLM 动态加载与多用户缓存架构技术文档本文档针对 Agent 项目的动态 LLM 模型加载机制、类 / 实例缓存策略、多用户并发隔离方案、本地缓存与 Redis 分层设计做系统性总结。
流浪00120 小时前
llm·rag·文本分块·语义完整性
大模型技术全景(二十):RAG 文本分块策略与语义完整性📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN篇十九解决的是 「文档怎么变成结构化文本」 ——PDF 的绘图指令被还原成带标题、带表格的 Markdown。文本到手之后还差一步才能入库:一本教材几百页、一份说明书几十页,整篇丢进检索和生成都不现实。本篇拆 RAG 的第二个环节——文本分块:它为什么躲不开,六种策略各自是什么脾气,以及六种放在一张表上该怎么选。
10年前端老司机1 天前
langchain·llm·agent
你的RAG检索正在“高效地重复废话”:一文彻底搞懂MMR算法如果你正在做RAG项目,大概率经历过这样的场景:向量相似度分数很高,检索结果看起来条条精准,可一送进大模型,回答却空洞、片面、车轱辘话来回说。你以为是生成模型不行,换了更大的模型,效果依然不理想。
stereohomology1 天前
人工智能·llm
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览审查对象:VectorCraft(Illustrator)、WordCraft(Word)、PdfCraft(Acrobat)、CADCraft(AutoCAD) 审查时间:2026-10-08 · 全部基于仓库 main 分支快照 + GitHub Release API 实测 方法:README/ROADMAP/MCP 文档/控制协议文档通读 + CLI 源码逐行核实 + 打包脚本逐行核实 + Release 资产清单实测
浮链序1 天前
算法·安全·llm
怎么证明"你这个模型是偷我的"——把蒸馏变成取证工具模型蒸馏这两年从学术话题变成了生意话题:厂商指控对手用输出训练自己的模型,被指控方说是独立训练的,两边谁都拿不出证据。
用户938515635072 天前
人工智能·langchain·llm
从 0 到 1 搭建企业级多模态 RAG 知识库:一个装修公司的 AI 落地实战300 人销售团队、15 天岗前培训、知识散落在各个角落——这是一家江西知名装修公司面临的真实困境。本文完整拆解我主导设计的企业级知识库项目,从产品原型到数据库表设计,从多模态文档解析到 GraphRAG 推理链路,把每个技术决策背后的"为什么"讲透。
deepseek232 天前
大模型·llm·谷歌·ai agent·gemini
Gemini 4 Argon拆解:单次输出100万Token不是上下文游戏,长周期Agent的经济账怎么算谷歌 DeepMind 在 2026 年 9 月 30 日发布 Gemini 4 Argon,距离上一代旗舰 Gemini 3 系列接近十个月,由高级副总裁兼首席 AI 架构师 Koray Kavukcuoglu 亲自撰文介绍。官方博客把它的定位压缩成一句话:在真实世界软件工程、法律与金融等企业知识工作,以及网络安全防御这些复杂工作流中,交付前沿级别的性能表现。CEO Sundar Pichai 亲自在社交媒体上宣布,强调这不是一次常规的跑分升级,而是面向长周期任务的重新设计。整篇发布稿里最值得拆解的不是
BlackStar_L2 天前
大模型·llm·agent
第五章 Coding Agent 与通用 Agent一句话理解:Coding能力不仅用于开发软件,也让Agent能够计算、转换数据、生成产物,并在现有工具不足时临时构造解决方案。
MoonOut2 天前
llm
LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题这是最近比较感兴趣的方向。搜索了一些论文,准备读一下。背景:据观察,现在各家 LLM 普遍存在“输出越来越长”的情况。甚至,有些 Agent 在解决实际问题时,如 coding 场景,会出现“雷霆大思考”:一直 thinking,迟迟不进行真正的输出,导致任务进度停滞,并且浪费用户的 token。这可能与 RL 训练有关:RL 训练过程会鼓励 Agent 思考得更详尽、周密、考虑到各种 Corner case,某种程度上促使 Agent 反复思考、深度思考、以非常长的长度思考;甚至有些场景下,性能指标和长
lucas_AI2 天前
llm·agent
给 Coding Agent 塞文档前先看这篇:什么时候是救命稻草,什么时候帮倒忙💡 一句话总结:这篇论文造了一个「描述保真度」基准(文档好不好,看 AI 能不能只凭它重建代码并跑过原测试),把文档提示词自动优化到 100% 保真,然后诚实地报告:这些高质量文档只在 agent 读不到代码时是救命稻草(测试通过率 8%→71%),在 agent 能读代码的正常场景下毫无提升甚至帮倒忙。做 agent 上下文工程的人值得花 10 分钟读完。
费曼学习法2 天前
llm·agent·ai编程
无人值守AI内容矩阵实战(2):我给 Agent 装了个「声称检测器」,专治它谎报已发布上一篇我拆了整套发布流水线的 4 个组件,今天聚焦一个差点让我翻车的隐蔽问题:模型 0 次真实工具调用,却能输出一篇格式完美、链接齐全的「执行成功汇报」。这篇把检测器的实现思路、代码结构和踩坑过程都摊开讲。
程工造Agent2 天前
llm
temperature 设为 0,就不会产生幻觉了吗?从解码机制到生产选值temperature=0 不能保证消除幻觉,也不能单独保证生产服务的输出完全可复现。 它通常让解码走向贪心选择,但不会替模型核实事实。
Clain2 天前
llm·aigc
全球首款 RTX Spark 电脑开卖:128GB 统一内存 + 1 Petaflop,价格你猜对了吗?10 月 8 日,英伟达和微软在旧金山把 RTX Spark 从发布会的 PPT 推上了货架。华硕、微软、戴尔、惠普、联想、微星六家厂商的首发机型同步开启预售,10 月 16 日陆续发货。这颗把 Grace CPU、Blackwell RTX GPU 和最高 128GB 统一内存揉进一颗芯片的「超级芯片」,终于变成了可以下单的页面。
AI小白Lin2 天前
架构·llm·agent
我的 Agent 迁移"成功"了:每道门都在册,没有一道能跑拷贝不是接线。迁移完那天,我的盘点报告漂亮得像体检单:文件在盘上,字节数正常,Markdown 渲染没毛病,每轮上下文注入也"成功"。