llm

不好听6131 小时前
llm
LLM Benchmark :大模型评测背后的门道每次新模型发布,厂商都在拿各种 Benchmark 数字轰炸你。这篇文章帮你搞清楚:这些数字到底意味着什么,哪些值得看,哪些可以忽略,以及如何用 Benchmark 真正选出适合自己业务的模型。
smartfish_liu2 小时前
llm·agent
分享: 如何利用workbuddy来构建批量自动化任务.本文实现利用workbuddy来 实现一个批量化的 复杂任务示例: 要完成的目标. 批量自动化地让 workbuddy实现 阅读链接, 先转纯文本保存, 再写出总结摘要保存, 最后提取10大关键字保存.
To_OC2 小时前
人工智能·gpt·llm
还在追顶配模型?GPT 5.6 已经把玩法彻底改了这两天帮朋友整理一份行业研报的基础资料,前前后后跑了大几十轮 API,今早一看账单愣了 —— 快两百块的额度,一半都花在了用户反馈分类、资料格式整理这种没什么技术含量的活上。
一只小bit5 小时前
机器学习·langchain·llm·langgraph
LangGraph 子图使用和房源搜索Agent综合案例实现在LangGraph中,子图是另一个图中的一个节点,可以独立开发和测试,也可以被多个主图复用。子图可用于:
千天夜7 小时前
人工智能·深度学习·llm·gpt-3·llama
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?论文:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models 作者:Jason Wei、Xuezhi Wang、Dale Schuurmans 等 会议:NeurIPS 2022 博文作者:千天夜
To_OC7 小时前
人工智能·llm·agent
别再被跑分骗了:大模型 Benchmark 到底在考什么?每次新模型一发布,我点开宣传页第一眼就是扫那一排数字。MMLU 90+、GPQA 登顶、HumanEval 行业领先…… 各家都把自己的分数摆得明明白白,清一色的 “业界第一梯队”。
JouYY11 小时前
架构·llm·agent
大模型底层学习(二)- 预训练(Pre-training)流程概览过去半年在 Agent 方向投入了大量精力,从 Agent 记忆架构设计到 Skill 工程化落地,积累了不少实践经验。但回头审视,发现自己一直停留在应用层——知道怎么调、怎么排、怎么蒸馏,但对底层为什么是这样缺乏系统理解。
zzzll111111 小时前
人工智能·架构·大模型·llm
Agent 开发的五种架构范式及选型思路随着大语言模型(LLM)能力的飞速发展,基于 LLM 的智能体(Agent)已成为构建下一代 AI 应用的核心组件。然而,面对复杂的业务场景,开发者常常面临一个关键抉择:应该采用哪种 Agent 架构?
浮生望12 小时前
llm
React+TS+Tailwind实战:在浏览器里跑DeepSeek-R1端侧模型React+TS+Tailwind搭建DeepSeek-R1-WebGPU端侧推理。拆解函数组件、JSX、合成事件、useState、Progress封装、组件树,展示AI时代前端工程化实践。
吃饱了得干活12 小时前
langchain·llm·agent
LangChain Agent 高级玩法:命名、结构化输出与流式模式让你的 Agent 不止于“聊天”,还能精准提取数据、实时反馈进度LangChain 的 create_agent 让我们能轻松构建具备工具调用能力的智能体。但很多同学只停留在“一问一答”的层面,对于 Agent 的身份标识、结构化输出、流式控制 这些高级特性却了解甚少。
AINative软件工程14 小时前
llm·ai编程
LLM 生产环境的 Prompt 注入防御工程实践:5 层防护体系与真实攻防案例上线三个月后,我们的内部 AI 助手收到了这样一条消息:这条消息没有触发任何报警,LLM 照常处理了它——然后输出了一段让我们团队沉默了五分钟的内容:它开始逐字复述 system prompt。
smartfish_liu1 天前
llm·agent
LLM.deepseek: 2026-7-24工作总结今日工作总结(2026-07-24)一、主要工作内容SANDBOX域函数测试与验证SANDBOX域新函数框架创建
小林ixn1 天前
人工智能·llm·测试
大模型的“高考成绩单”:读懂Benchmark,选对真·生产力模型跑分是门槛,不等于生产力。GPT-5.6 真正带来的,不是更聪明,而是一套“按难度分配任务”的工作系统。
冬奇Lab1 天前
人工智能·llm·agent
AI 评测系列(04):RAG 评测——RAGAS 四指标实战与一个反直觉发现RAGAS(RAG Assessment)是专门为 RAG 系统设计的评测框架,四个指标各自衡量 RAG 流水线的不同环节:
Darling噜啦啦1 天前
llm
GPT-5.6 意味着什么?从 Benchmark 跑分到模型分层,读懂 AI 行业的三个真相2026 年 7 月 9 日,OpenAI 正式发布 GPT-5.6 系列,一口气推出 Sol、Terra、Luna 三个分层的模型 $TRAE_REF。消息一出,讨论迅速集中到两个问题:"跑分涨了多少?谁是最强模型?"但如果我们只关注跑分,就彻底错过了这次发布背后真正的行业信号。本文将从 Benchmark 体系的本质、GPT-5.6 的模型分层策略、以及"可编程工具调用"三大维度,帮你建立对当前 AI 行业竞争格局的清醒认知。
吴佳浩1 天前
人工智能·llm·agent
今天我们讲讲大模型的“核心”技术:蒸馏(Model Distillation)作 者:吴佳浩Alben撰稿时间:2026.7.18更新时间:2026.7.23很多人都会有一个疑问。 现在开源模型遍地都是,DeepSeek 的推理成本已经低到令人惊讶,为什么各家大模型公司仍在持续投入模型蒸馏? 如果只是站在 API 使用者的角度,这个问题确实很难理解——按量付费、直接调用,多简单。但当你真正开始训练、部署和维护一个大模型时,答案会变得完全不同。 据业内普遍推测,**Claude 的实际参数规模已逼近 6 万亿。**一次完整训练,成本高达数千万甚至上亿美元;每一次在线推理,都在持续消耗
GPUStack1 天前
ai·大模型·llm·gpu·vllm·gpu集群·gpustack
怎么优雅地在GPUStack上使用minerU?如果你搞过 AI 知识库,那你一定听过 MinerU 的大名。这家伙专治各种不服——哦不,专治各种复杂的 PDF 文档,甭管是密密麻麻的公式还是乱七八糟的表格,它都能精准地转成 Markdown 格式。在 AI 知识库里,海量的 PDF 嗷嗷待哺,等着被转成 MD 喂进去呢。
chaors1 天前
langchain·llm·ai编程
DeepRearchSystem 0x00:初识最近在关注 跨境电商 相关的东西,难免会从网上搜索各种资料。但是吧,感觉事倍功半的几点有:正好最近也算系统性学历 LLM 相关的知识,于是就想做一个从某一议题出发最终输出系统性研究报告的 Agent。由于不仅仅是简单的搜索,而是带迭代逻辑的深度搜索。这也是 DeepRearchSystem 的缘起。
浮生望1 天前
llm
文档切割与RAG管线:从网页爬取到语义检索的完整闭环摘要: 从网页爬取到向量检索,拆解RAG知识库构建链路:cheerio提取网页内容、RecursiveCharacterTextSplitter语义切割、向量存储与相似度检索,理解文档分块背后的设计哲学。
浮生望1 天前
llm
知识蒸馏:大模型教小模型,远不止背答案那么简单摘要:从 DeepSeek 被指控蒸馏 OpenAI 的争议切入,拆解知识蒸馏的核心机制——硬标签只背答案,软标签才是思维方式的传承,用化学蒸馏和米其林大厨带徒弟两个类比,把暗知识的本质讲透。