llm

元Y亨H18 分钟前
google·langchain·llm
大模型技术 模型调用结果解析 概述在 LangChain 的开发流程中,模型调用结果解析(Output Parsers) 是至关重要的一环。
元Y亨H23 分钟前
llm·ollama
大模型技术 Ollama 概述如果说 LangChain 是构建 AI 应用的“大脑框架”,那么 Ollama 就是让这个大脑在你的本地电脑上跑起来的“发动机”。
chaors1 小时前
llm·agent·ai编程
DeepResearchSystem 0x06:LLM as Judge至此,DeepResearchSystem 已经是一个多 Agent 协作的智能体研报系统。但是到此就结束了吗?用我们之前客户端的思维,一个产品从开发完成到上线之前往往还需要经历严格的测试,以保证产品可用性和性能。那么对于一个 Agent?如何确保其可用性呢?怎么去对一个 Agent 做测试?
武子康5 小时前
人工智能·chatgpt·llm
GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。
Michaelliu_dev11 小时前
人工智能·llm·多模态大模型·vit·llava·rope·mllm
多模态大模型推理流程解析本文想从数据流的方式走一遍多模态大模型推理流程,但不包含vit和llm具体的计算流程,因为里面基本是常见的attention计算方式。attention的计算方式可以参考《Attention Is All You Need》算法详解
玉鸯11 小时前
python·llm·agent
Agent 的任务编排:从 System Prompt 到 Hierarchical Multi-Agent导读:Agent 领域有一个越来越难回避的问题:我们在编排上花的功夫,有多少是真正创造价值的?Dennis 等人 2026 年 4 月的一篇论文直接宣告"in-context prompting 让 Agent 编排过时了"。把完整流程写进 system prompt,效果居然碾压了 LangGraph 精心编排的同一套模型。
土豆125014 小时前
人工智能·llm
DeepSeek V4-Flash 正式版深度解读:一行 changelog 里的暗涌与野心一句话定位:这是一篇给开发者、AI 从业者和关心大模型行业的人的深度解读——不吹不黑,逐条拆解官方更新日志,算清楚这笔账,再斗胆预测 DeepSeek 下一步的棋。
Michaelliu_dev15 小时前
人工智能·llm·位置编码·多模态大模型·rope·旋转位置编码·mllm
RoPE通俗讲解现有的attention结构如下图所示,输入的N长度的features之间在计算attention的时候是没有位置关系的。但是在不管是文本、图片还是视频两个feature之前是有先后、远近关系的。为了让模型能够学到这种关系,现在有大量的文章提出位置编码相关的内容。其中RoPE是比较常用的一种位置编码,包括后续一系列改进的位置编码都是在RoPE基础上做的,例如Qwen用于多模态的MD-RoPE可外推的Yarn。
To_OC1 天前
人工智能·node.js·llm
从 0 到 1:Milvus + 大模型打造私人记忆知识库说实话,向量数据库这词我听了快半年了,每次看 RAG 相关的文章都能看到 Milvus、Pinecone 这些名字,但一直没往心里去。
孙启超1 天前
人工智能·llm·embedding·rag·向量化·chunking·文档切分
【AI应用开发】 RAG篇(四):Prompt 工程与进阶技术前几篇搞定了怎么存、怎么搜,本篇进入 RAG 的"最后一公里"——Prompt 工程和进阶优化技术。检索结果再好,Prompt 写得烂,答案是垃圾;检索质量卡在瓶颈,不上混合检索和查询优化,天花板就是 70 分。
周末程序猿1 天前
llm·agent
图解 120 个大语言模型(LLM)核心概念(91-120)
众人皆醒我独醉1 天前
面试·llm·ai编程
TGI:HuggingFace 的官方推理服务——不止 PagedAttention,更懂模型生态LLM 推理服务系列 · 第 2 篇vLLM 的核心创新是 PagedAttention。但 PagedAttention 只解决了一个问题:显存管理。实际的 LLM 推理服务还需要:模型权重分片、量化、Token 化、LoRA 热切换、多模态输入、水印生成、语法约束输出……
众人皆醒我独醉1 天前
面试·llm·ai编程
vLLM:PagedAttention 如何让 LLM 推理吞吐提升 24 倍LLM 推理服务系列 · 第 1 篇2023 年 6 月,UC Berkeley 的团队发布 vLLM,直接把 LLM 推理吞吐提升了 24 倍(相比 HuggingFace Transformers 默认实现)。一篇论文一个开源项目,半年内 GitHub 冲到 40K+ stars,成了 LLM 推理服务的默认选择。
张彦峰ZYF1 天前
人工智能·开源·llm·agent
全球开源大模型生态-从开放权重到开放智能系统:发展、进展、主力模型成就与方向分析目录一、2026 年全球开放生态的六个结论(一)基本结论汇总(二)全球开源大模型生态:七层协同栈二、发展脉络:开放大模型经历了三次跃迁
用户7783366132112 天前
llm·api·agent
从 0 搭一个 SERP API + LLM Agent 端到端实战(2026年7月)我之前做的 AI Agent 跑生产 6 个月,现在把完整搭建过程复盘一遍。从环境到部署,5 步搭起来一个能问实时问题的 AI Agent。
Trailblazer_lv9992 天前
llm
435GB 模型 + 64GB 内存 = 3 tok/s?我做到了,但答案全是❓TL;DR:64GB 笔记本跑 753B 模型,3 tok/s 到了,但输出全是乱码。排查 48 小时锁定真凶——Windows 和 Linux 的浮点行为差异导致 MLA 计算发散。
武子康2 天前
人工智能·stable diffusion·llm
不要问模型是 Transformer 还是 Diffusion:一套五层技术栈检查法(系统角色 / 表示空间 / 网络骨架 / 训练范式 / 推理算法)Transformer、VAE、Diffusion、Flow 和 Solver 经常被放在同一张比较表里,但它们回答的是不同问题。本文建立系统角色、表示空间、网络骨架、训练/生成范式和推理算法五层检查法,并用 DiT 与 π0 说明如何从论文和仓库恢复真实技术栈。
带娃的IT创业者2 天前
大模型·llm·漏洞分析·hugging face·供应链安全·ai安全
深度解析:大模型供应链安全危机与Hugging Face评估漏洞实战复盘👋 大家好,我是 带娃的IT创业者,CSDN 人工智能领域新星创作者,一边带娃一边创业的全栈工程师。专注 AI 大模型应用落地、Python 实战进阶与 AI 开发工具链(Python / FastAPI / 大模型 / AI 编程)。
Revolution612 天前
人工智能·llm·claude
多个 Agent 同时工作时,主 Agent 怎样接收队友结果本文是「从零理解 Claude Code:20 个 Agent Harness 机制」系列的第 15 篇。 源码仓库:shareAI-lab/learn-claude-code 对应章节:s15:Agent Teams