llm

10年前端老司机6 小时前
langchain·llm·agent
你的RAG检索正在“高效地重复废话”:一文彻底搞懂MMR算法如果你正在做RAG项目,大概率经历过这样的场景:向量相似度分数很高,检索结果看起来条条精准,可一送进大模型,回答却空洞、片面、车轱辘话来回说。你以为是生成模型不行,换了更大的模型,效果依然不理想。
stereohomology7 小时前
人工智能·llm
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览审查对象:VectorCraft(Illustrator)、WordCraft(Word)、PdfCraft(Acrobat)、CADCraft(AutoCAD) 审查时间:2026-10-08 · 全部基于仓库 main 分支快照 + GitHub Release API 实测 方法:README/ROADMAP/MCP 文档/控制协议文档通读 + CLI 源码逐行核实 + 打包脚本逐行核实 + Release 资产清单实测
浮链序10 小时前
算法·安全·llm
怎么证明"你这个模型是偷我的"——把蒸馏变成取证工具模型蒸馏这两年从学术话题变成了生意话题:厂商指控对手用输出训练自己的模型,被指控方说是独立训练的,两边谁都拿不出证据。
用户9385156350712 小时前
人工智能·langchain·llm
从 0 到 1 搭建企业级多模态 RAG 知识库:一个装修公司的 AI 落地实战300 人销售团队、15 天岗前培训、知识散落在各个角落——这是一家江西知名装修公司面临的真实困境。本文完整拆解我主导设计的企业级知识库项目,从产品原型到数据库表设计,从多模态文档解析到 GraphRAG 推理链路,把每个技术决策背后的"为什么"讲透。
deepseek2315 小时前
大模型·llm·谷歌·ai agent·gemini
Gemini 4 Argon拆解:单次输出100万Token不是上下文游戏,长周期Agent的经济账怎么算谷歌 DeepMind 在 2026 年 9 月 30 日发布 Gemini 4 Argon,距离上一代旗舰 Gemini 3 系列接近十个月,由高级副总裁兼首席 AI 架构师 Koray Kavukcuoglu 亲自撰文介绍。官方博客把它的定位压缩成一句话:在真实世界软件工程、法律与金融等企业知识工作,以及网络安全防御这些复杂工作流中,交付前沿级别的性能表现。CEO Sundar Pichai 亲自在社交媒体上宣布,强调这不是一次常规的跑分升级,而是面向长周期任务的重新设计。整篇发布稿里最值得拆解的不是
BlackStar_L16 小时前
大模型·llm·agent
第五章 Coding Agent 与通用 Agent一句话理解:Coding能力不仅用于开发软件,也让Agent能够计算、转换数据、生成产物,并在现有工具不足时临时构造解决方案。
MoonOut17 小时前
llm
LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题这是最近比较感兴趣的方向。搜索了一些论文,准备读一下。背景:据观察,现在各家 LLM 普遍存在“输出越来越长”的情况。甚至,有些 Agent 在解决实际问题时,如 coding 场景,会出现“雷霆大思考”:一直 thinking,迟迟不进行真正的输出,导致任务进度停滞,并且浪费用户的 token。这可能与 RL 训练有关:RL 训练过程会鼓励 Agent 思考得更详尽、周密、考虑到各种 Corner case,某种程度上促使 Agent 反复思考、深度思考、以非常长的长度思考;甚至有些场景下,性能指标和长
lucas_AI17 小时前
llm·agent
给 Coding Agent 塞文档前先看这篇:什么时候是救命稻草,什么时候帮倒忙💡 一句话总结:这篇论文造了一个「描述保真度」基准(文档好不好,看 AI 能不能只凭它重建代码并跑过原测试),把文档提示词自动优化到 100% 保真,然后诚实地报告:这些高质量文档只在 agent 读不到代码时是救命稻草(测试通过率 8%→71%),在 agent 能读代码的正常场景下毫无提升甚至帮倒忙。做 agent 上下文工程的人值得花 10 分钟读完。
费曼学习法17 小时前
llm·agent·ai编程
无人值守AI内容矩阵实战(2):我给 Agent 装了个「声称检测器」,专治它谎报已发布上一篇我拆了整套发布流水线的 4 个组件,今天聚焦一个差点让我翻车的隐蔽问题:模型 0 次真实工具调用,却能输出一篇格式完美、链接齐全的「执行成功汇报」。这篇把检测器的实现思路、代码结构和踩坑过程都摊开讲。
程工造Agent17 小时前
llm
temperature 设为 0,就不会产生幻觉了吗?从解码机制到生产选值temperature=0 不能保证消除幻觉,也不能单独保证生产服务的输出完全可复现。 它通常让解码走向贪心选择,但不会替模型核实事实。
Clain17 小时前
llm·aigc
全球首款 RTX Spark 电脑开卖:128GB 统一内存 + 1 Petaflop,价格你猜对了吗?10 月 8 日,英伟达和微软在旧金山把 RTX Spark 从发布会的 PPT 推上了货架。华硕、微软、戴尔、惠普、联想、微星六家厂商的首发机型同步开启预售,10 月 16 日陆续发货。这颗把 Grace CPU、Blackwell RTX GPU 和最高 128GB 统一内存揉进一颗芯片的「超级芯片」,终于变成了可以下单的页面。
AI小白Lin17 小时前
架构·llm·agent
我的 Agent 迁移"成功"了:每道门都在册,没有一道能跑拷贝不是接线。迁移完那天,我的盘点报告漂亮得像体检单:文件在盘上,字节数正常,Markdown 渲染没毛病,每轮上下文注入也"成功"。
小林ixn18 小时前
llm·agent
DeepAgent 实战:从零搭建一个会自己分工的深度调研助手你以为写 Agent 最难的是 Prompt?其实最难的是怎么让一堆 Agent 不打架、不跑偏、不循环。
范中勤20 小时前
llm·agent·claude code·subagent·异步架构
Agent IDE 双层异步调用机制:前端流式与后端多分支调度,到底各自解决什么问题在 Claude Code、Cursor、Workbuddy 这类代码 Agent 产品里,"异步"这个词被用得极滥。同一次对话里,前端在流式吐字、后端在并行跑三个子代理、模型在逐 token 生成——这三件事都叫异步,但它们不在同一层。
AINative软件工程21 小时前
性能优化·llm·ai编程
LLM 应用的预取工程实践:用预测性调用把首 Token 延迟砍掉 60%你已经上了 SSE 流式输出,TTFT 稳定在 800ms,P99 也控制在 1.2 秒以内。你觉得延迟优化到头了。
孟健1 天前
人工智能·llm·ai编程
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优大家好,我是孟健。今天刚结束本地开发工作流的压测调试,坐下来整理这篇记录。很多同行经常问我:本地跑大模型写代码,到底能不能替代云端 API?如果你的印象还停留在本地 27B 模型只能吐出 14 tok/s、光是等补全就足以打断思路的阶段,那么这套基于投机解码与底层计算图优化的方案,值得你重新算一笔账。
Flynt1 天前
llm
HN 614 分的 16.9MB 语音模型,我在 1 核 2G 上实测了一遍语音识别模型这两年越做越大,动辄几个 GB,挑硬件像挑显卡。所以 Cactus 上周发布的 Whistle 让我多看了两眼:一个 16.9 MB 的单文件模型,CPU 直接跑,零依赖,宣称词错率(WER)在 LibriSpeech test-clean 上做到 4.3,比 145.3 MB 的 Whisper base 还低。
goehou2 天前
docker·ai·llm·部署·教程·容器化
AI 应用上线实战:从本地脚本到 Docker 容器化(密钥、健康检查、镜像瘦身)LLM 系列又一篇。垂类 Agent 篇讲了系统架构,Harness 篇讲了开发环境——这篇讲最后一公里:上线。本地跑得好好的 AI 应用,一进容器就环境崩、密钥泄漏、启动超时,这篇把链路走通。
CopyCode2 天前
前端·llm·agent
Agent 开发不是模型训练:一个前端的入门认知这篇文章想先讲清楚一件更基础的事:Agent 到底是什么;同时会按当前 Demo 给出一套能跟着跑通的搭建步骤,方便你自己验证 Agent Loop。
流浪0012 天前
llm·大语言模型·rag
大模型技术全景(十八):RAG 检索增强生成与知识时效性问题📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN篇十七把幻觉的根因拆成了三层,「知识缺、知识旧」 那一层留给工程去治,治它的主流架构就是 RAG。但企业真正卡住的地方往往不是模型不够聪明,而是知识在自己手里、模型碰不到。本篇讲 RAG 是什么、为什么非它不可、哪些场景已经跑出了可核实的数字。