llm

小当家.1057 分钟前
java·后端·spring·缓存·llm·agent
LLM服务缓存与连接池管理:三层缓存架构与ChatClient池化LLM 服务的调用成本远高于传统服务——单次调用延迟 1-10 秒,费用 $0.01-0.1。传统 Web 服务的缓存体系(基于精确键匹配)在 LLM 场景下部分失效,因为用户的输入是自然语言,同样的语义可以用无数种表述方式。
AINative软件工程1 小时前
llm·ai编程
LLM 应用的健康检查工程实践:Readiness、Liveness 与 AI 特有健康维度的生产设计上周,我们的生产环境出了一个诡异的故障。用户反馈 AI 助手"返回乱码",但监控面板上所有指标绿灯——进程存活,HTTP 响应 200,CPU/内存正常。翻日志找了二十分钟才发现:GPU 内存已经碎片化到无法分配完整的 attention 矩阵,推理引擎在无声地返回全是空格的字符串。
CodeDevMaster16 小时前
docker·llm
关于PaddleOCR-VL部署与使用说明起因是要做一个关于票据OCR识别+LLM的综合应用,在部署PaddleOCR-VL时踩了不少坑,主要是因为GPU显存、计算等级、CUDA版本、选择的部署方案等多维度导致,特此记录。
众人皆醒我独醉17 小时前
人工智能·面试·llm
分布式训练与 Ring AllReduce:从单卡绝望到多卡协同AI 加速器系列 · 第 1 篇一台 GPU 装不下模型,训练要跑三个月——这就是大模型训练的真实处境。分布式训练不是在"加速",它是在"救火"。当 LLaMA 405B 用 16,000 张 H100 训练 54 天时,你面对的不是"怎么写训练循环",而是"怎么让 16,000 张卡像一台机器一样工作"。本文从数据并行的本质讲起,到 Ring AllReduce 通信原语,再到 PyTorch DDP 实战,帮你建立分布式训练的完整心智模型。
艺杯羹1 天前
网络·安全·网络安全·ai·llm·大语言模型·ai安全
LLM越狱与安全护栏攻防大演进:从奶奶漏洞到输入输出双重检测模型目录1. 角色扮演攻防战:从“奶奶漏洞”到强化学习安全对齐1.1. 角色扮演攻击的底层机制1.2. 静态拦截与强化学习对齐(RLHF/SFT)
熊猫钓鱼>_>21 小时前
人工智能·大模型·llm·agent·tts·混元3d·多skill协同
AI 3D 虚拟盲盒工坊:用腾讯云混元3D + TTS Skills 打造会说话的三维收藏品我桌上摆着十几个盲盒——泡泡玛特的 Dimoo、寻找独角兽的 Amy,还有一些叫不上名字但一眼看中的小东西。每次拆盒时那种"不知道会是什么"的期待感,总让我乐此不疲。有天晚上我在整理这些小玩意儿,顺手刷到了腾讯云 AI Skills 最佳实践征集的活动页。
做前端的娜娜子1 天前
人工智能·llm·掘金·金石计划
第二个 AI 调用——invoke 阻塞式与 stream 流式生成接上篇《第一个 AI 调用——TypeScript 工程初始化与配置管理》,本篇在已经能成功调用大模型的基础上,深入对比 LangChain.js 里两种最常用的调用方式:invoke(阻塞式) 和 stream(流式)。读完你就能根据场景选对姿势,并避开几个真实的坑。
想要成为糕糕手1 天前
前端·llm·agent
🐎 从“幻觉”到“可控”:手把手构建一个 LLM 自优化流水线 Harness让大模型“边想边做,做后再想”,在生成与评测的闭环中自动筛选最优答案用过 LLM 的朋友一定有过这样的体验:
武子康1 天前
人工智能·llm·agent
上下文装不下以后:Pi Compaction 怎样压缩历史,又会丢掉什么一个 Coding Agent 已经连续工作两小时:读过几十个文件,尝试过三条修复路线,跑了多轮测试,还记着用户最早说的“不能改公开 API”。此时上下文接近上限,系统自动生成摘要,然后继续工作。
众人皆醒我独醉1 天前
人工智能·面试·llm
Embedding:把词变成向量——AI 理解语义的唯一方式LLM 基础系列 · 第 5 篇前面四篇讲了 Transformer 的架构、Attention 的机制、Token 的切分、Context Window 的范围。这一篇回到起点——每个 Token 进入 Transformer 之前,被变成了一个高维向量。这个向量就是 Embedding。
武子康1 天前
人工智能·llm·agent
打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛语音 Agent 正在解释一个步骤,用户轻声说了句“嗯”。系统立刻停止播放,把“嗯”当成一个新问题,随后又问“你想了解什么?”
小当家.1051 天前
llm·json
LLM结构化输出与流式响应:从JSON修复到SSE全链路做 LLM 应用,有两个基础设施级的问题绕不开:一是怎么让 LLM 返回可靠的结构化数据(而不是一段自由文本),二是怎么把 LLM 的逐 token 输出实时推送给用户。前者关系到下游业务逻辑能不能跑通,后者关系到用户体验能不能接受。
JouYY2 天前
架构·llm·agent
大模型底层学习(三)-从零训练一个 BPE 分词器大模型处理的是"文本",但计算机真正理解的是数字。在文本和数字之间,有一座关键的桥梁——Tokenizer(分词器)。本文不空谈理论,而是结合实际代码,从数据清洗到 BPE 训练再到分词验证,完整走一遍分词器的构建流程。
蛋先生DX2 天前
深度学习·算法·llm
大模型参数存储格式揭秘:BF不是男朋友温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索【蛋先生说识】丹尼尔:蛋兄,我前几天刷到一个知识点——现在大模型的参数,训练后保存下来基本都是BF16格式。也就是说,一个数字只用 16 个 bit 来存?16 位是怎么存的?BF 又是什么意思?我脑子里全是问号!
鬼手点金2 天前
爬虫·python·llm·post·request·firecrawl·crawl4ai
与LLM结合的主流智能爬虫框架目前市面上有几个非常有代表性的开源框架:1. Crawl4AI 这是一个强大的开源网页爬取工具,旨在为大模型应用提供高质量的数据5。它的特点包括: LLM驱动提取:可以直接集成各种大语言模型(如 GPT、DeepSeek 等),根据你的指令从网页中提取结构化数据。 AI清洗与格式化:能够自动去除网页中的广告、导航等噪音,提取主内容,并输出为 Markdown、JSON 等对LLM友好的格式。 引用与附件处理:具备处理网页引用和链接的能力,可以将页面中的参考文献或附件链接整理成有序列表,这与你整理附件链接的
AI大佬的小弟2 天前
llm·prompt·提示词·few-shot·zero-shot·提示词工程·大模型名词精讲
大模型名词精讲 03:Prompt不知道小伙伴们有没有过这种经历:同样用 ChatGPT,别人写的 Prompt 一扔进去,出来的结果又专业又好用;我们吭哧吭哧写了半天,出来的东西却总感觉 "差点意思"。
小林ixn2 天前
javascript·llm·gpu
WebGPU + Transformers.js:把 DeepSeek-R1 塞进浏览器,真香!谁说前端只能写页面?当浏览器遇上 GPU 加速,1.5B 参数的大模型也能在你电脑上流畅推理,而且全程数据不出设备。这篇实战笔记带你从零搭建一个纯浏览器端的 DeepSeek-R1 对话应用。
鬼手点金2 天前
llm·github·nvidia·apikey·freellmapi·agnes ai·日日新
FreeLLMAPI 介绍FreeLLMAPI 是一个开源的 OpenAI 兼容 API 代理网关,由开发者 tashfeenahmed 创建并托管在 GitHub 上(github.com/tashfeenahmed/freellmapi),目前已有超过 6000 个 Star。
AINative软件工程2 天前
后端·llm·ai编程
LLM 应用的 Feature Flag 工程实践:Prompt、模型与 AI 行为的生产安全灰度去年某电商平台升级客服助手的 system prompt,把原来的「请严格基于订单数据回答」改成了「请友好地帮助用户解决问题」。改动当天下午,用户开始反馈:AI 告诉他们的退款时效比实际政策快了两天。