llm

Patrick在香港10 小时前
python·llm·智能路由器·api·架构设计·成本优化
模型路由器实测:12 个任务省 77%,旗舰过载时的降级要打出显式标记“API 要涨了:留下、换模型还是上路由?”——这句话里最值钱的词是"路由"。用一整个工作日的 12 个任务实测一个成本感知路由器:同样的活,全用旗舰模型要 1200 个归一化成本单位,路由后只花 276,省 77%。方法是朴素的三层结构:mini=8 / mid=30 / flagship=100,按价格升序找"最便宜的能胜任档位",复杂度标签由应用侧打——faq reply 落 mini、contract review 才配旗舰。
桃西西呀11 小时前
人工智能·gpt·llm
"循环深度"让小模型免费变大?GPT-6 Astra 背后的潜空间推理原理,8 个误读我替你拆了2026-09-03,OpenAI 正式发布 GPT-6 Astra。中文技术社区一个词刷屏:循环深度(Recurrent Depth)。伴随它一起传播的,还有一句更抓人的话——"35 亿参数的小模型,等效调用 500 亿参数的算力"。评论区已经出现了"小模型免费变大""scaling law 被推翻""6 层假装 96 层"这类说法。
Sophnet云平台17 小时前
大数据·人工智能·llm·制造·token·云平台
从 IT 自嗨到业务可用,制造企业 AI 平台的落地实践几十万投入把 AI 平台部署上线,IT团队测试全部跑通,结果销售、商务这些一线业务员工根本不会用,AI 项目变成IT部门自嗨。
JouYY17 小时前
架构·llm·agent
大模型底层学习(四)- 混合精度训练与分布式训练混合精度训练(Mixed Precision Training)是一种在模型训练中同时使用多种数值精度(如FP32 + FP16/BF16)的技术。核心思路:前向传播和反向传播用低精度(16位)计算来加速、省显存,而权重更新和优化器状态用高精度(32位)保留来保证数值稳定性。
桃西西呀20 小时前
人工智能·机器学习·llm
9月1日起AI图要被标记了,机器怎么一眼认出哪张是 AI 画的?9月1日开始,国内生成式 AI 内容要显式标注了。朋友圈里有人调侃:以前靠肉眼找 AI 图的破绽,现在得靠机器先替我们筛一遍。问题来了,机器自己没有眼睛,它凭什么能分辨一张图是相机拍的还是模型生成的?
流浪00120 小时前
人工智能·llm
大模型技术全景(四):国内外大语言模型格局,技术路线与能力图谱上一篇文章讲了 LLM 的通用原理。现实中,这些原理被不同厂商做成了不同产品——有的侧重推理,有的侧重多模态,有的选择开源。
武子康2 天前
人工智能·llm·agent
机器人策略 90% 与 92%:为什么两个百分点通常不足以证明更摘要:100 次 rollout 中成功 90 次和 92 次,不能仅凭两个百分点给策略排序。本文从单组区间、差值区间、配对四格、任务层级与功效设计出发,给出一份可在实验前签署、实验后复核的机器人成功率证据合同。
阿里云大数据AI技术2 天前
人工智能·开源·llm
PAI支持一键部署Qwen3.8-Flash-Next、GLM-5.3等最新开源模型近日,Qwen3.8-Flash-Next 和 GLM5.3 相继发布。PAI 支持一键部署 Qwen3.8-Flash-Next、GLM-5.3 和 GLM-5.3-Flash-BF16。
吴佳浩2 天前
人工智能·神经网络·llm
企业如何把通用大模型训练成行业模型:Continued Pre-Training实战指南作者:吴佳浩Alben撰稿时间:2026.5.3 更新时间:2026.8.18今天咱们的目标读者是:负责大模型落地的工程师、算法团队、AI Infra 团队
吴佳浩2 天前
人工智能·llm·agent
大模型是怎么来的:从数据到 Foundation Model作者:吴佳浩Alben撰稿时间:2026.5.1 更新时间:2026.8.17核心问题:一个百亿、千亿参数的大模型到底如何诞生?
武子康2 天前
人工智能·llm·agent
转写完全正确,语音 Agent 为什么还是做错了决定摘要:同一个实时语音系统可能在诊断题里识别哭腔、恐惧或讽刺,进入多轮业务任务后却继续按文字执行。本文不把情绪标签当真值,而是交付三组配对测试和一条 Voice Evidence Decision Trace,用 terminal action 验证声音证据是否真正改变决定。
Darling噜啦啦2 天前
前端·后端·llm
从 SSE 到 LLM 流式输出:搞懂前端实时通信的两种姿势ChatGPT 的打字机效果是怎么做的?为什么 AI 回答能一个字一个字蹦出来?答案就是流式输出。但前端实时通信有两条技术路线——SSE(Server-Sent Events)和 LLM Stream API,它们原理相似却场景不同。本文从一个原生 Node.js SSE Demo 出发,到 LangChain 的 LLM 流式调用,彻底拆解流式输出的全链路。为什么 HTTP 能"边传边显示"?EventSource 为什么只能 GET?chunk 到底是什么?建议收藏后跟着代码实操。
William一直在路上2 天前
学习·ai·llm
MCP 规范版本对比:2025-11-25 vs 2026-07-28
DO_Community2 天前
人工智能·llm·aigc·agent·ai编程
Baseten vs DigitalOcean、RunPod:7 个 AI 模型部署平台横向对比Baseten 已经建立起较强的市场认知:它以专属、单租户 GPU 部署为核心,并通过开源的 Truss 框架来打包和交付模型。同时,它在安全合规方面也做得相当扎实。这和那些构建在第三方硬件之上的 LLM 路由器是完全不同的定位,因此尤其适合需要把自定义模型真正部署到生产环境的 AI 产品团队。
circuitsosk2 天前
前端·javascript·python·react.js·llm·ai agent
任务规划器的三种范式对比:ReAct、Plan-and-Execute 与 Tree-of-Thought 在真实业务中的取舍上一篇文章讲 Function Calling,解决的是"模型如何调用工具";但工具再多,没有规划能力,Agent 就只能做"一次调用"的简单问答。真正复杂的业务诉求——“帮我对比三家供应商的报价并生成采购建议”——需要 Agent 自己拆解成多个子任务、决定执行顺序、根据中间结果调整后续步骤。这个"拆解与决策"的过程,就是任务规划。
吴佳浩2 天前
llm·agent·nvidia
32GB 显存,凭什么跑 56GB 大模型?从 Shared Memory 到 AI 异构内存架构从 Shared GPU Memory、CPU Offload 到 GGUF,看懂消费级硬件如何突破显存限制。
吴佳浩2 天前
llm·agent·mcp
为什么每个人最终都会使用 Agent?从 LLM 到 Agent,看懂 AI 为什么一定会走向执行时代作者:吴佳浩Alben撰稿时间:2026.8.2更新时间:2026.8.4先问一个问题。如果 ChatGPT、Claude 已经这么聪明——能写代码、能写论文、能通过各种专业考试——为什么 OpenAI、Anthropic、Google、微软,几乎在同一个时间窗口,不约而同地把研发重心转向了同一个方向:Agent?
xiaohe06013 天前
游戏·llm·agent
🎮 豆包完胜 DeepSeek ?!零玩家竞技场,AI Agent 专属对弈!“斗之力,三段!”望着测验魔石碑上面闪亮得甚至有些刺眼的五个大字,豆包面无表情,唇角有着一抹自嘲,紧握的手掌,因为大力,而导致略微尖锐的指甲深深的刺进了掌心之中,带来一阵阵钻心的疼痛……
DigitalOcean3 天前
llm
加了 1 个参数,GLM-5.3-Flash 便宜了 6.3 倍我们问了 GLM-5.3-Flash 一个非常简单的问题:SSH 默认使用哪个端口。它用了 625 个输出 Token,最后才给出答案:“22”。