llm

tachibana225 分钟前
人工智能·ai·大模型·llm·prompt
文件上传分布式限流如何做?在微服务与云原生架构中,文件上传是典型的网络密集型(Network-Intensive)与 IO 密集型(IO-Intensive)业务。传统的 API 限流手段通常基于请求频次(QPS)进行控制,这在普通 JSON/Form 接口场景下效果显著。然而在文件上传场景中,仅仅限制 QPS 存在致命盲区:一个 1KB 的元数据查询请求与一个 2GB 的高清视频上传请求,对系统网卡带宽、内存缓冲区、磁盘 IOPS 以及后端对象存储造成的压力相差数百万倍。
浮生望11 小时前
llm
Harness 工程:用 Best of N Sampling + LLM as Judge 构建自动化代码生成流水线将LLM生成、评测、择优三阶段解耦为流水线,通过Best of N Sampling并行生成候选、LLM as Judge自动评分,实现prompt到最优代码的闭环筛选,解决LLM输出不稳定问题。
To_OC11 小时前
人工智能·llm·agent
别死磕 Prompt 了!我用 Harness 流水线,让大模型自动产出高质量代码前阵子用大模型批量写工具函数,踩了个巨恶心的坑。就拿最简单的数组去重来说,同一句提示词丢进去,三次生成的结果里总有一两个藏着暗坑 —— 要么没处理 NaN,要么对象引用去重逻辑写错,更气人的是有时候表面能跑,边界情况直接拉胯。我得挨个复制出来跑测试、改 bug,一下午净干重复活了。
qpsj16 小时前
python·llm
让 LLM 控制 AutoCAD/ZWCAD:COM 自动化 + MCP 封装上一篇定了调:让 LLM 操作 CAD,AutoCAD 的 COM 是 ROI 最高的一条——半天能打通,ZWCAD 白捡。这篇把它拆开,从"坐标传不进去"这个坑讲起,把 API 挨个过一遍,最后讲怎么把这些能力封装成 LLM 能调的 MCP 工具。所有代码都是实测跑通的,不是文档抄的。
demo007x16 小时前
程序员·llm·agent
CoT(Chain-of-Thought)大语言模型(LLM)中广泛研究和应用的一种方法,用于增强模型的推理能力和解决复杂问题的能力。与直接生成答案的方式相比,思维链能够帮助模型以类人逻辑的方式逐步拆解问题,逐步推导最终答案。
qpsj16 小时前
人工智能·llm
让 LLM 操作 CAD:四条技术路线的取舍给 agent 接 CAD 能力这件事,我一开始把重心放错了。我以为难点在"让 LLM 听懂'画一个 300×200 的钢板'这种话",于是花了很多时间调 prompt、设计 JSON schema。两周跑下来发现,语义理解是整条链路上最不值一提的一环——真正的坑全在 CAD 那一侧:坐标为什么非得是 VARIANT、插件为什么必须放安装目录、三维建模为什么只能在主线程、几十万张 DWG 凭什么这么难读。这些脏活,跟 LLM 一点关系都没有。
qpsj16 小时前
llm
ZW3D 插件开发实战:从搜索面板到 LLM 远程建模上一篇讲 AutoCAD 的 COM,半天能通。这篇进 ZW3D——国产三维 CAD,没有 COM 接口,只能写 C++ 插件。这是我四条路线里花时间最多的一条,坑也最多:DLL 放错目录、Init 不调用、中文乱码、线程安全。这篇按我实际踩坑的顺序写,从"一个搜索面板"做起,最后讲到"给 LLM 远程建模"。
林一l17 小时前
llm
大模型推理全流程以输入 "今天天气真" → 输出 "好" 为起点,覆盖 Prefill(预填充)与 Decode(逐词生成)两个阶段,含 KV Cache 加速原理。
孙启超20 小时前
人工智能·缓存·llm·向量数据库·bm25·向量化·ai应用开发
【AI应用开发】什么是混合检索(Hybrid Search)?向量检索 + BM25 关键词检索,适用场景与 RRF 融合原理混合检索(Hybrid Search)= 向量检索(语义匹配)+ BM25 关键词检索(精确匹配),通过 RRF 等融合算法合并两路结果,取两者之长补各自之短。
货拉拉技术1 天前
llm
货拉拉大模型记忆系统(一):从提取到召回的工程实践记忆不是保存过去,而是让过去在需要时,以正确的方式回来。人会在一次次交流中积累对一个人的了解:他不感兴趣什么、买过什么、还在担心什么。对 AI 来说,这些聊天历史默认不会被带进下一次会话。同一位司机已经说过不感兴趣、接过什么单、还在担心什么;下一次电话里,AI 却把这些全忘了。
武子康1 天前
人工智能·llm·agent
Pi Agent 为什么不内置 MCP:工具发现与上下文成本的真实争议一个 Coding Agent 原来只有 read、write、edit、bash 四个通用工具。团队接入工单、 数据库、监控、云平台和内部知识库后,工具很快增加到几十个。最直接的做法,是把每个 MCP Server 暴露的工具定义都交给模型:名字、描述、参数 Schema、返回结构一次性进入上下文。
小四的小六1 天前
llm·openai·ai编程
端侧模型量化踩坑之后:我重新想清楚了“快、准、小“只能选两个摘要: 当模型量化导致准确率下降15个百分点时,上线还是不上线?本文基于真实踩坑经历,提出了一个分场景决策框架:核心功能谨慎量化、辅助功能可适度量化,但关键在于厘清"用户对不同功能的质量容忍度差异"。文末附可直接复用的量化上线决策清单,助你避开我踩过的坑。
Do1you1believe1light1 天前
llm·agent·ai编程
我拆开了 Prime Agent:然后哭着想要给它真正的智能我开始研究 agent 时,第一个问题是架构该听谁的。LangGraph 把流程画成图,另一个派别说让模型自己决定下一步。两边我都试过。真正让我想明白的,是把 Prime Agent 的源码从头追到尾。答案藏在协议层。所有 agent 框架的公共骨架,都是模型协议怎么翻译、怎么转发。
想要成为糕糕手1 天前
前端·react.js·llm
🚀 在浏览器里跑 DeepSeek-R1?WebGPU 端侧推理实战(五)—— 中断、重置、缓存与流式生成📌 上篇回顾:我们完成了下载进度条和聊天界面——Worker 预热、三种下载事件闭环、受控输入框与三态按钮联动,UI 链路已经打通。 🎯 本篇目标:让模型真正能聊起来——中断控制、KV 缓存加速、流式输出、思考标签识别,打通从用户输入到流式回复的完整推理链路。 🔜 下篇预告:把文字变成真正的聊天气泡——消息渲染、思考折叠、流式填充、自适应输入框、粘性滚动、TS 类型化,以及一路踩过的坑。
贵慜_Derek1 天前
人工智能·算法·llm
vLLM-07|MegaMoE 与 FusedMoE:路由相同,算 expert 完全不同02 篇把 --moe-backend deep_gemm_mega_moe 与 --enable-expert-parallel 标成 Flash eval 的硬约束;06 篇讲完 KV 怎么占显存。本文想要分享的是:MoE 一层 forward 里,谁负责选 expert、谁负责算 expert,以及 MegaMoE 与 FusedMoE 在分片轴上的差别。跨卡 all2all、DeepEP 在 15 篇;权重 finalize_mega_moe_weights 在 14 篇。以下以 vLLM mai
阿弱1 天前
llm·agent
从Plan-Execute到混合PEV:一个运维诊断Agent的架构演进实录在构建运维诊断Agent时,我踩进了一个经典的坑:用Plan-Execute架构去应对高不确定性的诊断场景,结果推理割裂、流程卡死。
烬羽1 天前
人工智能·llm·deepseek
Worker 里的推理引擎:消息怎么来,Token 怎么回本文为原创。基于真实项目 webgpu-deepseek(WebGPU + Transformers.js 在浏览器本地跑 DeepSeek-R1-Distill-Qwen-1.5B)讲解。
小当家.1051 天前
java·后端·spring·缓存·llm·agent
LLM服务缓存与连接池管理:三层缓存架构与ChatClient池化LLM 服务的调用成本远高于传统服务——单次调用延迟 1-10 秒,费用 $0.01-0.1。传统 Web 服务的缓存体系(基于精确键匹配)在 LLM 场景下部分失效,因为用户的输入是自然语言,同样的语义可以用无数种表述方式。
AINative软件工程1 天前
llm·ai编程
LLM 应用的健康检查工程实践:Readiness、Liveness 与 AI 特有健康维度的生产设计上周,我们的生产环境出了一个诡异的故障。用户反馈 AI 助手"返回乱码",但监控面板上所有指标绿灯——进程存活,HTTP 响应 200,CPU/内存正常。翻日志找了二十分钟才发现:GPU 内存已经碎片化到无法分配完整的 attention 矩阵,推理引擎在无声地返回全是空格的字符串。
CodeDevMaster2 天前
docker·llm
关于PaddleOCR-VL部署与使用说明起因是要做一个关于票据OCR识别+LLM的综合应用,在部署PaddleOCR-VL时踩了不少坑,主要是因为GPU显存、计算等级、CUDA版本、选择的部署方案等多维度导致,特此记录。