llm

海拉鲁大陆在逃野猪2 小时前
llm
从张量到 NPU:解构端侧 AI 的底层执行逻辑在生成式 AI 全面渗透至个人计算设备的今天,"端侧推理"已不再是实验室概念,而是 MacBook Pro、旗舰手机等消费级硬件的标准能力。然而,当用户惊叹于本地大模型"秒级响应"与"离线可用"时,往往容易忽略其背后精密的软件-硬件协同机制。
XLYcmy2 小时前
ai·llm·agent·工作流·rag·harness·工业系统
AI 时代,MOM(制造运营管理系统)该如何演进? 中AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构04 架构全景(六层 + 两横切)
仙人掌_lz4 小时前
人工智能·llm·llama·vllm·判别模型·jev
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准2026 年 9 月,我把同一个 4B 模型用两种方式放到 RTX 3090 24GB 上,对外都走 OpenAI 兼容接口,做同一件事:读完一篇舆情,只回答一个字母。A 表示文中能看出具体毕业生和他的毕业院校,B 表示看不出来。
闲研随记5 小时前
llm·iclr
【文献阅读 ICLR 2026】LLMs get lost in multi-turn conversationLLM是对话接口,不仅能帮助用户明确手头的任务,还能通过多轮对话交互按用户需求定义、探索、改进。这篇论文进行了大规模的模拟实验对比LLM在单轮和多轮对话中的性能。实验证实无论开源闭源LLM的多轮对话明显比单轮对话性能更低,在6项生成任务中平均下降39%。通过对20w+的模拟对话进行分析,性能降低可拆解成2个部分:能力的小幅衰减、不可靠性的显著上升。研究发现,LLM常在对话初期做出预设,并过早尝试生成最终答案,且会过度依赖这些答案。简单来说,LLM一旦在对话中走错方向,就会陷入偏差,无法自我修正。
Together_CZ6 小时前
llm·agentic·reasoning·openpangu-2.0·迈向可靠且高效·智能体推理·reliable
openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning——迈向可靠且高效的智能体推理openPangu-2.0 是 openPangu 团队推出的新一代大语言模型系列,旨在解决当前 LLM 从被动对话助手向主动自主智能体演进过程中面临的核心瓶颈:
桃西西呀7 小时前
人工智能·llm·ai编程
Laya 源码级原理拆解之四:路由检测与服务部署之一讲了 Laya 的整体架构和运行入口,之二讲了序列打包和决策头,也就是它怎么在不逐 token 生成的前提下给每个选项打分,之三讲了 structured、shortlist、email 三个把模型接进业务的胶水模块。这一篇我拆最后一段链路,也就是模型真正被调用之前那层看不见的调度:同一份代码背后其实蹲着三套参数(英文 checkpoint、多语言 checkpoint、类型化决策 checkpoint),到底用哪套不是你写的,是它自己选的。我用一个真实场景串起这一篇,一封客服工单进来,内容可能是英文
桃西西呀7 小时前
人工智能·llm·ai编程
Laya 源码级原理拆解之三:字段编译与业务胶水前两周我一直在拆 Laya 这个开源判断引擎。之一讲了整体架构和运行入口,之二讲了序列打包和决策头,也就是它怎么在不逐 token 生成的前提下,给请求时给定的每个选项打分。这一篇我接着往下拆三个模块,它们是真正把模型接进业务的那层胶水:你定义一个 JSON Schema,它替你把字段编译成 choice、score、noul 三种判断形状;选项太多时它帮你做粗到细的预筛;邮件进来时它先把引文、签名、免责声明切掉再送进模型。
stereohomology8 小时前
llm
我对大模型训练的两个态度开源普惠,不光是把参数开源,最好训练过程、训练数据、等等细节也都公布其实更好这样大模型使用的主要成本就变成算力设备折旧、维护、和能源消耗
柒和远方8 小时前
python·llm·agent
DocResearch 项目面试:把每个模块讲明白,而不是背术语这篇文章默认你已经运行过 demo,并大致理解 项目理解文档 中的例子。面试时不需要把本文一次讲完。你的目标是:别人随便指一个模块,你都能说明它为什么存在、输入输出是什么、核心代码怎么工作、还有什么做不到。
柒和远方8 小时前
python·llm·agent
DocResearch 项目理解:从一条命令到一份有出处的报告这篇文章不是功能清单,也不要求你先懂 Python Agent 框架。我们只跟着一个问题走:我有三份关于 pgvector、Milvus 和选型原则的资料。请比较两种方案用于小型知识库时的部署维护与检索能力;有依据才下结论,没有数据就说缺什么。
the局外人9 小时前
后端·langchain·llm
读懂LangGraph 的分支执行逻辑一个 AI 请求只有一个答案时,流程很直;一旦同一输入要走几个方向,代码就像突然遇到一组路口:选哪条路、哪些路能同时走、最后在哪里汇合。LangGraph 把这些路口变成可以运行的图。
爱上纯净的蓝天20 小时前
人工智能·大模型·llm·模型评估·架构设计
只输出选项和概率的模型:判别层的接口契约与阈值工程最近在整理公司内部那套工单自动分流的链路,顺手把一类新模型放进去试了一遍。这类模型不写一个字,只回一个选项、一个档位或者一个概率。刚开始我以为它不过是"便宜版分类器",跑了两周之后发现,它在系统里的位置、该盯的指标、出问题的姿势,跟分类器和大模型都不一样。这篇把这两周的结论整理一下,偏架构和工程,不涉及模型内部原理。
流浪00121 小时前
llm·hitl·人工介入·hotl·hootl
大模型技术全景(十二):人工介入 HITL、HOTL 与 HOOTL📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN上篇文章把 Agent 之间「怎么说话、怎么传话」讲透了——但光会通信还不够。Agent 一旦自主跑起来,遇到高风险操作、低置信度判断、或者踩到红线,必须能「踩刹车、等人类点头」再继续。 否则一个删除指令、一笔转账、一封发给全公司的邮件,模型一自信就全发出去了,后果没法撤回。这一篇讲人工介入(Human-in-the-Loop),以及它的两个近亲 HOTL、HOOTL,把「人该在哪儿、管什么」一次说清。
Lintongzg1 天前
笔记·学习·性能优化·llm
千卡训练的隐形账单:通信不是瓶颈上一篇 GPU 为什么会挨饿 把视角从单点分析推到全链路优化。今天进入 Datawhale mlsysim 学习活动的第五阶段,问题换了一句话:从一台机器走到一千张卡,成本会怎么变? 对应教程:06 Scaling to 1000 GPUs、07 Geography is a Systems Variable、08 The $9M Question。今天跑下来有两个意外:规模扫描那张表里,通信开销不是随规模上升,而是从 1336.8ms 掉到 319.1ms;而可靠性部分的结论,交叉点位置比教程说的远得多
武子康1 天前
人工智能·llm·agent
Cosmos Curator 清洗视频时,哪些片段应该留下?假设一个机器人团队准备整理仓库里的巡检录像。画面中大量时间只有货架和地面,真正值得研究的瞬间却很短:机器人停在障碍物前、夹爪接触后没有移动,或者门已经打开,机器人仍然等待。团队想先过滤“几乎没有运动”的片段,再让视觉语言模型生成描述,以节省后面的处理开销。
我想问问天1 天前
人工智能·llm·aigc
Jev 是做什么的?聊聊它能帮 LLM 分担哪些工作假设我们要做一个客服系统,用户发来一句:“我的信用卡被扣了两次,请尽快处理。”系统得先知道这件事归哪个部门管、急不急、要不要转人工。后面可能还要查订单、查账单,最后给用户一段回复。光是回复之前,就已经有好几个判断要做了。
谢白羽1 天前
llm·vllm·大模型部署·sglang
对比DP8+EP与TP8在DS MoE部署性能MoE的Transformer层执行路径如下: 上图是以DP8+EP部署模型的执行流程。一个token进入本地Attention层(完整att)计算后通过路由发送给激活专家所在卡(注意,未必在本地了)做GEMM,最后专家模块返回结果合并输出进入下一层。
XLYcmy1 天前
ai·llm·agent·模型·mom·harness·工业系统
AI 时代,MOM(制造运营管理系统)该如何演进? 上AI 时代,MOM(制造运营管理系统)该如何演进?——从零设计一套适配多品类产线的通用 MOM 架构智能制造 / 工业软件 / MOM 架构
凉凉的知识库1 天前
开源·llm·agent
Agent 如何拥有长期记忆:六个主流项目的设计思路对比想象一下,你连续几天都在和同一个 AI 助手讨论旅行计划。第一天,你告诉它自己不坐红眼航班;第二天,你补充说更喜欢靠过道的位置;到了第三天,它却像第一次见到你一样,又从头询问所有偏好。
桃西西呀1 天前
人工智能·llm·ai编程
Laya 源码级原理拆解之二:序列打包与决策头我在之一里把 Laya 的整体架构和运行入口拆完了,当时留了一个最关键的疑问没有展开:它号称一次前向就把判断吐出来,输出 token 还是免费的,这件事在代码层面到底是怎么发生的。这一篇我直接进 common.py 和 agent.py,把序列打包 build_sequence 和决策头 DecisionModel 的源码逐行走查一遍,再把温度缩放和那套容易踩错的双置信度说清楚。最后看一下 fast.py 和 tl_kernels.py 怎么把同样的决策换一组融合核跑在 GPU 上。