llm

大鹏的NLP博客2 小时前
llm·jev
理解 Jev:让大模型从“生成”走向“判断”大模型的一个天然特点是:即使只是做一个简单判断,也习惯通过自回归生成来给出答案。例如:“这个请求应该交给哪个部门?”
SharpCJ5 小时前
llm·agent
Koog(1) —— JVM 下的 Agent 框架如今的 Agent 是在是太火爆了。各种 Agent 应用层出不穷,但是基本都是 Python 和 Typescript 为主,这里面的主要原因还是生态。但是接下来,我将用一个系列的文章来介绍一个 Kotlin 语言的 Agent 框架 —— Koog。
桃西西呀5 小时前
人工智能·llm·ai编程
用 Laya 把出海 App 的几百条混语评价拆成可统计的判断出海 App 团队有一个活,他们后台每天堆着几百条用户评价,语言杂得很,中文、英文、葡萄牙语、西班牙语混在一起。运营同学最头疼的不是看不懂,而是看不过来。他们真正想做的只有两件事:第一,判断每条评价的感情倾向,是夸还是骂;第二,把里面带着诉求的评价挑出来,比如"希望你们修复导出功能,否则我不再续费",优先排给产品去处理。
sg_knight8 小时前
llm·bug·agent·ai编程·glm·智谱·zcode
ZCode Bug 定位实战:把报错丢给 ZCode,它是怎么修的上篇讲完用 Zread 读懂陌生项目,这篇进入开发者每天都要面对的场景——修 Bug。传统修 Bug 流程:看到报错 → 搜索引擎查 → 翻十几篇帖子 → 猜测原因 → 改一版 → 不对 → 再猜。运气好半小时,运气不好一下午。而 ZCode 的 Agent 模式是另一条路:把报错连上下文丢给它,它自己去读代码、定位根因、给出修复方案、改完还能跑测试验证。
AINative软件工程11 小时前
后端·llm·ai编程
LLM 应用的 Chaos Engineering 工程实践:给 AI 系统下毒,才能知道它有多抗造LLM 应用的 Chaos Engineering 工程实践:给 AI 系统下毒,才能知道它有多抗造你给 LLM 应用做过故障注入吗?大多数团队连 Provider 挂了怎么办都没想清楚,更别提故意拔网线、篡改 Token、往 Prompt 里塞干扰了。这篇文章讲的就是:怎么用混沌工程的思路,系统地给生产 AI 系统找茬,把那些"理论上能降级"但实际上一崩到底的死角提前炸出来。
吃饱了得干活1 天前
llm·agent
从 LLM 到 Agent:一文彻底搞懂什么是 AI Agent本文是「Agent 基本概念」系列第一篇,本系列将带你了解agen的基本概念。 系列规划:① 什么是 AI Agent → ② 核心组件 → ③ 决策与规划 → ④ 记忆与工具 → ⑤ 架构与落地。
莪_幻尘1 天前
前端·人工智能·llm
Skill 体检:30 个 Skill 全凭感觉?体检器先自曝了 8 个“假 0 分AI 健康三部曲 · 第 1 篇(Skill 体检)这是一个真实故事,所有数字都来自我刚跑完的一次全量体检。
weixin_404551241 天前
开源·llm
开源 LLM 可观测平台深度比较:Langfuse、Phoenix、Helicone、Opik 与 MLflow文档定位: 这是一份选型导向的深度比较文档,聚焦开源/可自部署产品。LLM 可观测是 AI Native SRE 三层框架(见《AI Native SRE》§3)中第三层(L3 语义正确性)的核心工具。本文对五个主流开源平台做横向对比,帮助团队根据自身场景做出选型决策。所有信息基于 2026-06 的公开资料,平台特性演进快,正式选型前建议实地 PoC。
海拉鲁大陆在逃野猪1 天前
llm
从张量到 NPU:解构端侧 AI 的底层执行逻辑在生成式 AI 全面渗透至个人计算设备的今天,"端侧推理"已不再是实验室概念,而是 MacBook Pro、旗舰手机等消费级硬件的标准能力。然而,当用户惊叹于本地大模型"秒级响应"与"离线可用"时,往往容易忽略其背后精密的软件-硬件协同机制。
XLYcmy1 天前
ai·llm·agent·工作流·rag·harness·工业系统
AI 时代,MOM(制造运营管理系统)该如何演进? 中AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构04 架构全景(六层 + 两横切)
仙人掌_lz1 天前
人工智能·llm·llama·vllm·判别模型·jev
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准2026 年 9 月,我把同一个 4B 模型用两种方式放到 RTX 3090 24GB 上,对外都走 OpenAI 兼容接口,做同一件事:读完一篇舆情,只回答一个字母。A 表示文中能看出具体毕业生和他的毕业院校,B 表示看不出来。
闲研随记1 天前
llm·iclr
【文献阅读 ICLR 2026】LLMs get lost in multi-turn conversationLLM是对话接口,不仅能帮助用户明确手头的任务,还能通过多轮对话交互按用户需求定义、探索、改进。这篇论文进行了大规模的模拟实验对比LLM在单轮和多轮对话中的性能。实验证实无论开源闭源LLM的多轮对话明显比单轮对话性能更低,在6项生成任务中平均下降39%。通过对20w+的模拟对话进行分析,性能降低可拆解成2个部分:能力的小幅衰减、不可靠性的显著上升。研究发现,LLM常在对话初期做出预设,并过早尝试生成最终答案,且会过度依赖这些答案。简单来说,LLM一旦在对话中走错方向,就会陷入偏差,无法自我修正。
Together_CZ1 天前
llm·agentic·reasoning·openpangu-2.0·迈向可靠且高效·智能体推理·reliable
openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning——迈向可靠且高效的智能体推理openPangu-2.0 是 openPangu 团队推出的新一代大语言模型系列,旨在解决当前 LLM 从被动对话助手向主动自主智能体演进过程中面临的核心瓶颈:
桃西西呀1 天前
人工智能·llm·ai编程
Laya 源码级原理拆解之四:路由检测与服务部署之一讲了 Laya 的整体架构和运行入口,之二讲了序列打包和决策头,也就是它怎么在不逐 token 生成的前提下给每个选项打分,之三讲了 structured、shortlist、email 三个把模型接进业务的胶水模块。这一篇我拆最后一段链路,也就是模型真正被调用之前那层看不见的调度:同一份代码背后其实蹲着三套参数(英文 checkpoint、多语言 checkpoint、类型化决策 checkpoint),到底用哪套不是你写的,是它自己选的。我用一个真实场景串起这一篇,一封客服工单进来,内容可能是英文
桃西西呀1 天前
人工智能·llm·ai编程
Laya 源码级原理拆解之三:字段编译与业务胶水前两周我一直在拆 Laya 这个开源判断引擎。之一讲了整体架构和运行入口,之二讲了序列打包和决策头,也就是它怎么在不逐 token 生成的前提下,给请求时给定的每个选项打分。这一篇我接着往下拆三个模块,它们是真正把模型接进业务的那层胶水:你定义一个 JSON Schema,它替你把字段编译成 choice、score、noul 三种判断形状;选项太多时它帮你做粗到细的预筛;邮件进来时它先把引文、签名、免责声明切掉再送进模型。
stereohomology1 天前
llm
我对大模型训练的两个态度开源普惠,不光是把参数开源,最好训练过程、训练数据、等等细节也都公布其实更好这样大模型使用的主要成本就变成算力设备折旧、维护、和能源消耗
柒和远方1 天前
python·llm·agent
DocResearch 项目面试:把每个模块讲明白,而不是背术语这篇文章默认你已经运行过 demo,并大致理解 项目理解文档 中的例子。面试时不需要把本文一次讲完。你的目标是:别人随便指一个模块,你都能说明它为什么存在、输入输出是什么、核心代码怎么工作、还有什么做不到。
柒和远方1 天前
python·llm·agent
DocResearch 项目理解:从一条命令到一份有出处的报告这篇文章不是功能清单,也不要求你先懂 Python Agent 框架。我们只跟着一个问题走:我有三份关于 pgvector、Milvus 和选型原则的资料。请比较两种方案用于小型知识库时的部署维护与检索能力;有依据才下结论,没有数据就说缺什么。
the局外人1 天前
后端·langchain·llm
读懂LangGraph 的分支执行逻辑一个 AI 请求只有一个答案时,流程很直;一旦同一输入要走几个方向,代码就像突然遇到一组路口:选哪条路、哪些路能同时走、最后在哪里汇合。LangGraph 把这些路口变成可以运行的图。