llm

Flynt3 小时前
llm·ai编程·chatglm (智谱)
上周我在OpenRouter上用了个匿名模型,结果账单告诉我它是国产的上周有一件事挺有意思。 OpenRouter上冒出来一个叫Ox Alpha的匿名模型,没标厂商,没写参数量,就是纯盲测。我当时看到的时候,它已经冲到周榜第一了。随手调了一下,编程能力确实不错,反应也快,心想这是哪家的新模型。中文社区更直接,给它起了个名叫"牛来"。 然后昨天(8月26日)晚上智谱官宣了:Ox Alpha就是GLM-5.3-Flash。 好吧,我承认我当时第一反应是"行吧又一个大模型"。但仔细看了一眼背后的数据之后,我花了一个晚上把几个小项目的API从Claude换了过去。 为什么换?因为价
@atweiwei6 小时前
人工智能·架构·rust·langchain·llm·agent·ai编程
用 Rust 构建 Agent 应用的高性能框架:langchainrust 架构全景一个 LLM Agent 应用要用到的东西很多:模型接入、提示词、链式组合、状态机编排、工具调用、检索增强、多轮记忆、护栏、评测、可观测,还要跟 MCP 工具、别的 Agent 互联。langchainrust 用 21 个 crate、5 层架构把它们组织成一套完整运行时。本文从地基拆到屋顶,每个设计点都附真实源码与取舍。
武子康6 小时前
人工智能·llm·agent
看不见的 Reasoning State,为什么不能拥有看得见的工具权限一次 Agent 工具调用结束后,系统把模型返回的 reasoning、signature 或 encrypted_content 连同消息一起存进数据库。下一轮换了会话、切了模型,甚至把轨迹发到可观测平台,应用仍把这块不可读内容原样带回 API。
DigitalOcean7 小时前
llm·agent
实测:25 万条数据只花 7.04 美元,LLM 批量推理到底有多省?7 个 JSONL 文件、一个模型访问密钥,以及计算出来的 7.04 美元成本——这就是我们通过 DigitalOcean 统一的 批量推理(Batch Inference)API 对 25 万条真实消费者投诉进行分类和信息补充所需要的全部东西:为每条记录标记产品类别、分析情绪和紧急程度、提取实体、生成摘要,并在最后将每个答案与数据集自带的真实标签进行评分对比。如果使用完全相同的 Token 量、按无服务器推理(Serverless Inference)价格计算,成本则为 14.07 美元。我们分别使用
leeyi9 小时前
llm·aigc·agent
Agent 怎么测试:mock LLM + 状态机表驱动,不调真模型的测试策略(第96篇-E82)上一篇 讲了 Callbacks 回调机制,可以在 Agent 执行的每个环节注入监控。但有一个更根本的问题:怎么测试 Agent?
殷紫川10 小时前
llm·agent·ai编程
长程任务 Agent 为什么总半途而废?PLAN-AND-ACT 用"先规划后动手"给出 SOTA 答案❝长程 Agent 翻车,往往不是模型不够聪明,而是被"规划"和"执行"两件事同时压垮了。论文来源:Lutfi Eren Erdogan, Nicholas Lee, Sehoon Kim, Suhong Moon, Hiroki Furuta, Gopala Anumanchipalli, Kurt Keutzer, Amir Gholami —— PLAN-AND-ACT: Improving Planning of Agents for Long-Horizon Tasks,ICML 2025(ar
jump_jump12 小时前
人工智能·llm·ai编程
我让本地 Qwen3.8 27B 搭了一个内网穿透服务最近看到不少关于 Qwen3.8 的讨论,我也想试一下,于是把 BF16 版本的 Qwen3.8 27B 下载到本地,通过 DeepSeek Harness 调用,并把推理档位设为 xhigh。
武子康12 小时前
人工智能·llm·agent
Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态Anthropic 已经公开确认:支持标记的 Claude 模型会把不可见水印嵌入生成文本。这个变化覆盖 Claude API、Claude、Claude Code、Claude Cowork、Claude Tag,以及 AWS、Google Cloud 和 Microsoft Foundry 等入口。
缘友一世13 小时前
架构·llm·lrm·qwen4
Qwen3.8-Flash-Next(Qwen4架构预览模型)这几年大模型一直在「变大」:参数从几十亿涨到几千亿、甚至几万亿。按常理,模型越大,跑一次花的算力越多、速度越慢、成本越高。但2026年8月底,Qwen 团队放出的一台新模型,却讲了一个相反的故事:**参数巨大,但跑起来飞快、成本极低。**它就是 Qwen3.8-Flash-Next。
众人皆醒我独醉1 天前
面试·kubernetes·llm
自动扩缩容:KPA/HPA/KEDA 三条路径KServe 源码拆解系列 · 第 7 篇第 6 篇你追着请求走完了整条路:VirtualService → ksvc → 推理 Pod。但有个问题一直悬着:Pod 的数量是谁定的?流量翻倍时谁来加 Pod?夜里没人调用时谁来把 GPU 腾出来?——这篇拆自动扩缩容的控制面:YAML 里的几个字段,怎么变成 HPA、KEDA ScaledObject 和 Knative 的注解。
武子康1 天前
人工智能·llm·agent
262K 跑过,128K 却被脚本拦下:A6000 跑分里的三种“失败”不能混为一谈同一个单卡 A6000 服务,较早的超长上下文探针跑到了目标 262K;几个阶段之后,一次目标 128K 的测试却留下了这行日志:
修远客1 天前
llm·agent
质检系统:Agent的自我审查 — 不自检的Agent就像没有编辑的报社LLM 能写出流畅的文章,但不代表文章没问题 — 夸大宣传、敏感词、AI味书面语、内容重复,这些坑 LLM 自己看不见。
sg_knight2 天前
linux·windows·macos·llm·agent·ai编程·opencode
openCode 安装与初始化配置(Windows / macOS / Linux)前五篇把 openCode 是什么、和 Cursor 怎么选、核心概念全讲清楚了。这篇直接装机——macOS、Linux 原生安装 + Windows WSL2 全流程,从零到能用的完整路径。
Shawn_Shawn2 天前
后端·llm·领域驱动设计
本体论的基本核心概念本体不是某一张表,而是整个组织共享的语义模型:它定义了企业里有哪些实体类型、实体有哪些属性、实体之间如何关联、可以对实体执行哪些操作。
XLYcmy5 天前
llm·负载均衡·强化学习·多模态·ppo·dpo·grpo
小红书 算法一面 十二在 **MoE(混合专家模型)** 场景中,**负载均衡** 是指**门控网络将输入 token 均匀分配给各个专家子网络**,使得每个专家接收的计算任务量(token 数量、计算开销)保持相对均衡,避免出现“热门专家过载、冷门专家闲置”的现象。
uncle_ll2 天前
架构·llm·agent·rag·llamaindex
LlamaIndex 全栈实战指南:架构解构、RAG 核心原理与私有知识库工程化落地方案大语言模型(LLM)面临知识时效性滞后、私有数据盲区与事实幻觉三大工程瓶颈。检索增强生成(RAG, Retrieval-Augmented Generation) 是解决私有数据问答成本最低、准确率最高的工程路径。
蛋先生DX2 天前
llm·llama·ollama
大模型本地部署神器的瘦身进阶原理,就这两招?温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索同名标题或【蛋先生说识】丹尼尔:蛋兄,本地跑大模型,有啥好工具推荐不?
众人皆醒我独醉2 天前
面试·kubernetes·llm
流量路由:Istio 与 Knative 的集成KServe 源码拆解系列 · 第 6 篇第 5 篇结束时,模型已经躺进 Pod 的 /mnt/models:storage-initializer 下载完,推理容器就绪。但集群外面一条 curl,凭什么能精确命中这个 Pod?中间隔着一整套指路系统:网关、VirtualService、Knative Route。本篇拆这套系统,也把概述文一笔带过的 canaryTrafficPercent 拆到源码层:百分比如何变成路由权重。而流量怎么分,直接连着下一篇的主角——自动扩缩容。
温暖的苹果2 天前
ai·llm·agent·vibecoding·opencode
opencode 配置完全指南:配置文件、目录与字段详解一份面向 opencode 用户的配置指南:讲清楚配置写在哪里、每个字段是干什么的、provider / skill / plugin / command / 自定义工具各自从哪些目录被自动发现,以及合并优先级。文末附一章内部实现原理,供想深挖的读者参考。
七点半.2 天前
人工智能·llm
LLM 工程能力LLM内部是怎么工作的? 人工智能与LLM基础理论接下来开始:作为开发者,我怎么控制LLM?先建立一个非常重要的认知: Prompt不是: