llm

XLYcmy5 小时前
pdf·llm·json·agent·token·csv·dify
PDF论文处理器 - 完整使用指南PDF论文处理器是一个专门为网安科研论文设计的PDF文本分割工具,旨在将英文论文PDF文件转化为Dify知识库可直接使用的高质量数据块。
cuguanren5 小时前
人工智能·ai·大模型·llm·agent·上下文管理·会话记忆管理
Agent 框架的会话记忆管理机制会话记忆(上下文管理)是 Agent 从「Demo 玩具」走向「工程可用」的核心能力之一。对应 Agent Loop 的五类演进路径,不同阶段的框架在记忆的存储结构、生命周期、持久化能力、并发隔离等维度呈现出明显的分层差异,整体沿着「线性堆叠 → 结构化状态 → 持久化快照 → 跨会话长效记忆」的路径迭代。
the局外人6 小时前
python·langchain·llm
别再背 Chain、Agent、Memory 了:用一条“智能流水线”学会 LangChain适合读者:会写基础 Python,知道 LLM 能对话,但还没有真正用过 LangChain。版本说明:本文按照 LangChain v1 的现行思路编写,示例需要 Python 3.10 或更高版本。旧教程里的 LLMChain、ConversationChain 等已归入 langchain-classic,不要把新旧 API 混着抄。
DigitalOcean6 小时前
llm·agent·chatglm (智谱)
GLM 5.3 已上线 DigitalOcean AI 推理云平台:Agent 任务的高性价比底座来了GLM-5.3-Flash 已上线 DigitalOcean AI 推理云平台:3200 亿参数、每 Token 仅激活 180 亿参数,支持 100 万 Token 上下文与原生图像/视频输入。DigitalOcean 调用价格低至每百万输入 Token 0.15 美元,并支持统一 API、多模型路由与模型评估。
QuZhengRong7 小时前
人工智能·学习·设计模式·llm·agent
【AI】Agent 全栈进阶|Agent 设计模式通常情况下,Agent 很少能仅靠一轮对话就完成任务,例如排查一个经营问题要查多次数据,做一份调研要分几个方向收集材料。当执行任务的步骤变多时,自然而然就会出现一个问题:任务该怎么推进?
AINative软件工程10 小时前
llm
LLM 应用的 Rate Limit 工程实践:令牌桶、滑动窗口与 API 配额管理的生产设计你以为 retry 几次就搞定了限流问题,直到某个高峰夜晚你的服务在大模型 API 429 上抖了整整两小时。
今日无bug11 小时前
llm·agent·mcp
MCP 入门实战:Tool 和 LLM 解耦?跨进程跨语言调用工具原来是这么回事你有没有遇到过这样的窘境:用 LangChain 写了一堆 Tool,结果发现只能在当前项目里用?换个项目就得重新拷一遍?更糟糕的是,团队里有人用 Java、有人用 Python,大家的 Tool 完全没法共享?
武子康11 小时前
人工智能·llm·agent
拆开 Pi Monorepo:改模型、循环、产品和 UI 时,代码应该放在哪一层团队准备给 Coding Agent 增加一个新 Provider。最省事的做法,是在主应用里直接写认证、请求体转换和流式解析。过两周 Tool Call 格式不兼容,又在同一个目录加一层修补。再过一个月 Web、CLI 和评测都需要这个 Provider,三套实现开始各自演化。
武子康11 小时前
人工智能·llm·agent
一次 Agent 失败后,到底该改模型、Prompt 还是 Router?摘要:一条失败 Trace 往往同时暴露模型、Prompt、Router、工具合同和产品逻辑问题。本文给出四步归因顺序,并用 change_candidate 把可推翻的责任面假设、单一主要变化、固定上下文、评测版本和回退门槛绑定在一起。
谢白羽12 小时前
笔记·llm·论文·agent·vllm·大模型部署·sglang
SGLang模型加载过程笔记1.如果dp_size大于1 PP = 2 TP = 2 DP = 1因此会创建:2.如果dp_size大于1 DP Controller 根据轮询、当前请求数或 Token 数,把每个请求交给负载较低的模型副本。
xing-xing14 小时前
语言模型·llm
AutoDL部署大模型dots.ocr网址:https://www.autodl.com帮助文档: https://www.autodl.com/docs/ssh_proxy/
魔术师Grace1 天前
llm·agent·强化学习
Agent总出错,什么时候才该训练模型?一个电商客服 Agent 上线后,连续出了三种问题:退货政策答成了去年的版本;查询订单时没有调用物流接口;用户要求退款时,它又直接执行了操作。
Flynt1 天前
llm·ai编程·chatglm (智谱)
上周我在OpenRouter上用了个匿名模型,结果账单告诉我它是国产的上周有一件事挺有意思。 OpenRouter上冒出来一个叫Ox Alpha的匿名模型,没标厂商,没写参数量,就是纯盲测。我当时看到的时候,它已经冲到周榜第一了。随手调了一下,编程能力确实不错,反应也快,心想这是哪家的新模型。中文社区更直接,给它起了个名叫"牛来"。 然后昨天(8月26日)晚上智谱官宣了:Ox Alpha就是GLM-5.3-Flash。 好吧,我承认我当时第一反应是"行吧又一个大模型"。但仔细看了一眼背后的数据之后,我花了一个晚上把几个小项目的API从Claude换了过去。 为什么换?因为价
@atweiwei1 天前
人工智能·架构·rust·langchain·llm·agent·ai编程
用 Rust 构建 Agent 应用的高性能框架:langchainrust 架构全景一个 LLM Agent 应用要用到的东西很多:模型接入、提示词、链式组合、状态机编排、工具调用、检索增强、多轮记忆、护栏、评测、可观测,还要跟 MCP 工具、别的 Agent 互联。langchainrust 用 21 个 crate、5 层架构把它们组织成一套完整运行时。本文从地基拆到屋顶,每个设计点都附真实源码与取舍。
武子康1 天前
人工智能·llm·agent
看不见的 Reasoning State,为什么不能拥有看得见的工具权限一次 Agent 工具调用结束后,系统把模型返回的 reasoning、signature 或 encrypted_content 连同消息一起存进数据库。下一轮换了会话、切了模型,甚至把轨迹发到可观测平台,应用仍把这块不可读内容原样带回 API。
DigitalOcean1 天前
llm·agent
实测:25 万条数据只花 7.04 美元,LLM 批量推理到底有多省?7 个 JSONL 文件、一个模型访问密钥,以及计算出来的 7.04 美元成本——这就是我们通过 DigitalOcean 统一的 批量推理(Batch Inference)API 对 25 万条真实消费者投诉进行分类和信息补充所需要的全部东西:为每条记录标记产品类别、分析情绪和紧急程度、提取实体、生成摘要,并在最后将每个答案与数据集自带的真实标签进行评分对比。如果使用完全相同的 Token 量、按无服务器推理(Serverless Inference)价格计算,成本则为 14.07 美元。我们分别使用
leeyi1 天前
llm·aigc·agent
Agent 怎么测试:mock LLM + 状态机表驱动,不调真模型的测试策略(第96篇-E82)上一篇 讲了 Callbacks 回调机制,可以在 Agent 执行的每个环节注入监控。但有一个更根本的问题:怎么测试 Agent?
殷紫川1 天前
llm·agent·ai编程
长程任务 Agent 为什么总半途而废?PLAN-AND-ACT 用"先规划后动手"给出 SOTA 答案❝长程 Agent 翻车,往往不是模型不够聪明,而是被"规划"和"执行"两件事同时压垮了。论文来源:Lutfi Eren Erdogan, Nicholas Lee, Sehoon Kim, Suhong Moon, Hiroki Furuta, Gopala Anumanchipalli, Kurt Keutzer, Amir Gholami —— PLAN-AND-ACT: Improving Planning of Agents for Long-Horizon Tasks,ICML 2025(ar
jump_jump1 天前
人工智能·llm·ai编程
我让本地 Qwen3.8 27B 搭了一个内网穿透服务最近看到不少关于 Qwen3.8 的讨论,我也想试一下,于是把 BF16 版本的 Qwen3.8 27B 下载到本地,通过 DeepSeek Harness 调用,并把推理档位设为 xhigh。
武子康2 天前
人工智能·llm·agent
Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态Anthropic 已经公开确认:支持标记的 Claude 模型会把不可见水印嵌入生成文本。这个变化覆盖 Claude API、Claude、Claude Code、Claude Cowork、Claude Tag,以及 AWS、Google Cloud 和 Microsoft Foundry 等入口。