llm

吃饱了得干活5 小时前
llm·agent
Agent 的核心组件:大脑、记忆、手脚与心跳本文是「Agent 基本概念」系列第二篇。 第一篇给出的核心公式是: Agent = LLM(或策略)+ 规划 + 记忆 + 工具 + 执行循环 为了便于展开,这一篇把它细化为七个部分: Agent = 感知 + LLM/策略 + 规划 + 记忆 + 工具 + 行动 + 执行循环 其中 LLM 与规划合并为“大脑与调度器”一节,其余各部分独立展开。 系列规划:① 什么是 AI Agent → ② 核心组件 → ③ 决策与规划 → ④ 记忆与工具 → ⑤ 架构与落地。
孟健7 小时前
人工智能·llm·ai编程
Gemini 4 Argon 对比 GPT-6 Astra:百万 Token 输出很诱人,但我劝你先别迁编程工作流大家好,我是孟健。今天一早在工位坐下,几个技术群和社区里全在刷谷歌 2026 年 9 月 30 日发布的 Gemini 4 Argon。
柒和远方9 小时前
langchain·llm·测试
LangSmith RAG 量化评估:从"感觉还行"到"数据说话"第八十五天学习笔记:用 LangSmith + openevals 给 RAG 应用做回归评估。 对应代码:本目录 src/ 下的 build_dataset.mjs、evaluators.mjs、run_eval.mjs、rag_agent.mjs。
银河技术11 小时前
分布式·微服务·重构·架构·spark·llm·rag
TB级文本去重实战:从单机 OOM 到 Spark / Ray 分布式架构的工程演进适合谁:需要构建离线训练语料去重、并对删除结果承担审计责任的数据平台团队。默认策略:精确去重后,以字符 5-gram + MinHash LSH 找候选、真实 Jaccard 验证、连通分量选代表。不自动覆盖:热点桶、短文、超长文只保留并报告覆盖缺口。
流浪00111 小时前
llm·memory·记忆
大模型技术全景(十三):记忆管理 Memory📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN上上篇把 Agent 之间「怎么说话、怎么传话」讲透了,上篇讲了「哪些动作必须等人点头」。但 Agent 光会通信、会刹车还不够——它还得「记得住」:跨会话保留用户偏好、跨任务累积经验。 这一篇讲记忆管理(Memory),把 Agent 的「外部记忆系统」从定义、分类、短期处理到长期记忆全生命周期一次说清。
XLYcmy21 小时前
ai·llm·agent·智能制造·数字孪生·mom·harness
AI 时代,MOM(制造运营管理系统)该如何演进? 下AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构08 AI 落地场景清单(按可行性排序)
大鹏的NLP博客1 天前
llm·jev
理解 Jev:让大模型从“生成”走向“判断”大模型的一个天然特点是:即使只是做一个简单判断,也习惯通过自回归生成来给出答案。例如:“这个请求应该交给哪个部门?”
SharpCJ1 天前
llm·agent
Koog(1) —— JVM 下的 Agent 框架如今的 Agent 是在是太火爆了。各种 Agent 应用层出不穷,但是基本都是 Python 和 Typescript 为主,这里面的主要原因还是生态。但是接下来,我将用一个系列的文章来介绍一个 Kotlin 语言的 Agent 框架 —— Koog。
桃西西呀1 天前
人工智能·llm·ai编程
用 Laya 把出海 App 的几百条混语评价拆成可统计的判断出海 App 团队有一个活,他们后台每天堆着几百条用户评价,语言杂得很,中文、英文、葡萄牙语、西班牙语混在一起。运营同学最头疼的不是看不懂,而是看不过来。他们真正想做的只有两件事:第一,判断每条评价的感情倾向,是夸还是骂;第二,把里面带着诉求的评价挑出来,比如"希望你们修复导出功能,否则我不再续费",优先排给产品去处理。
sg_knight1 天前
llm·bug·agent·ai编程·glm·智谱·zcode
ZCode Bug 定位实战:把报错丢给 ZCode,它是怎么修的上篇讲完用 Zread 读懂陌生项目,这篇进入开发者每天都要面对的场景——修 Bug。传统修 Bug 流程:看到报错 → 搜索引擎查 → 翻十几篇帖子 → 猜测原因 → 改一版 → 不对 → 再猜。运气好半小时,运气不好一下午。而 ZCode 的 Agent 模式是另一条路:把报错连上下文丢给它,它自己去读代码、定位根因、给出修复方案、改完还能跑测试验证。
AINative软件工程1 天前
后端·llm·ai编程
LLM 应用的 Chaos Engineering 工程实践:给 AI 系统下毒,才能知道它有多抗造LLM 应用的 Chaos Engineering 工程实践:给 AI 系统下毒,才能知道它有多抗造你给 LLM 应用做过故障注入吗?大多数团队连 Provider 挂了怎么办都没想清楚,更别提故意拔网线、篡改 Token、往 Prompt 里塞干扰了。这篇文章讲的就是:怎么用混沌工程的思路,系统地给生产 AI 系统找茬,把那些"理论上能降级"但实际上一崩到底的死角提前炸出来。
吃饱了得干活2 天前
llm·agent
从 LLM 到 Agent:一文彻底搞懂什么是 AI Agent本文是「Agent 基本概念」系列第一篇,本系列将带你了解agen的基本概念。 系列规划:① 什么是 AI Agent → ② 核心组件 → ③ 决策与规划 → ④ 记忆与工具 → ⑤ 架构与落地。
莪_幻尘2 天前
前端·人工智能·llm
Skill 体检:30 个 Skill 全凭感觉?体检器先自曝了 8 个“假 0 分AI 健康三部曲 · 第 1 篇(Skill 体检)这是一个真实故事,所有数字都来自我刚跑完的一次全量体检。
weixin_404551242 天前
开源·llm
开源 LLM 可观测平台深度比较:Langfuse、Phoenix、Helicone、Opik 与 MLflow文档定位: 这是一份选型导向的深度比较文档,聚焦开源/可自部署产品。LLM 可观测是 AI Native SRE 三层框架(见《AI Native SRE》§3)中第三层(L3 语义正确性)的核心工具。本文对五个主流开源平台做横向对比,帮助团队根据自身场景做出选型决策。所有信息基于 2026-06 的公开资料,平台特性演进快,正式选型前建议实地 PoC。
海拉鲁大陆在逃野猪2 天前
llm
从张量到 NPU:解构端侧 AI 的底层执行逻辑在生成式 AI 全面渗透至个人计算设备的今天,"端侧推理"已不再是实验室概念,而是 MacBook Pro、旗舰手机等消费级硬件的标准能力。然而,当用户惊叹于本地大模型"秒级响应"与"离线可用"时,往往容易忽略其背后精密的软件-硬件协同机制。
XLYcmy2 天前
ai·llm·agent·工作流·rag·harness·工业系统
AI 时代,MOM(制造运营管理系统)该如何演进? 中AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构04 架构全景(六层 + 两横切)
仙人掌_lz2 天前
人工智能·llm·llama·vllm·判别模型·jev
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准2026 年 9 月,我把同一个 4B 模型用两种方式放到 RTX 3090 24GB 上,对外都走 OpenAI 兼容接口,做同一件事:读完一篇舆情,只回答一个字母。A 表示文中能看出具体毕业生和他的毕业院校,B 表示看不出来。
闲研随记2 天前
llm·iclr
【文献阅读 ICLR 2026】LLMs get lost in multi-turn conversationLLM是对话接口,不仅能帮助用户明确手头的任务,还能通过多轮对话交互按用户需求定义、探索、改进。这篇论文进行了大规模的模拟实验对比LLM在单轮和多轮对话中的性能。实验证实无论开源闭源LLM的多轮对话明显比单轮对话性能更低,在6项生成任务中平均下降39%。通过对20w+的模拟对话进行分析,性能降低可拆解成2个部分:能力的小幅衰减、不可靠性的显著上升。研究发现,LLM常在对话初期做出预设,并过早尝试生成最终答案,且会过度依赖这些答案。简单来说,LLM一旦在对话中走错方向,就会陷入偏差,无法自我修正。
Together_CZ2 天前
llm·agentic·reasoning·openpangu-2.0·迈向可靠且高效·智能体推理·reliable
openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning——迈向可靠且高效的智能体推理openPangu-2.0 是 openPangu 团队推出的新一代大语言模型系列,旨在解决当前 LLM 从被动对话助手向主动自主智能体演进过程中面临的核心瓶颈: