llm

小当家.1051 小时前
llm·json
LLM结构化输出与流式响应:从JSON修复到SSE全链路做 LLM 应用,有两个基础设施级的问题绕不开:一是怎么让 LLM 返回可靠的结构化数据(而不是一段自由文本),二是怎么把 LLM 的逐 token 输出实时推送给用户。前者关系到下游业务逻辑能不能跑通,后者关系到用户体验能不能接受。
JouYY12 小时前
架构·llm·agent
大模型底层学习(三)-从零训练一个 BPE 分词器大模型处理的是"文本",但计算机真正理解的是数字。在文本和数字之间,有一座关键的桥梁——Tokenizer(分词器)。本文不空谈理论,而是结合实际代码,从数据清洗到 BPE 训练再到分词验证,完整走一遍分词器的构建流程。
蛋先生DX13 小时前
深度学习·算法·llm
大模型参数存储格式揭秘:BF不是男朋友温馨提示:另有配套视频版,附带图解演示,观感不同,欢迎到各大视频平台搜索【蛋先生说识】丹尼尔:蛋兄,我前几天刷到一个知识点——现在大模型的参数,训练后保存下来基本都是BF16格式。也就是说,一个数字只用 16 个 bit 来存?16 位是怎么存的?BF 又是什么意思?我脑子里全是问号!
鬼手点金19 小时前
爬虫·python·llm·post·request·firecrawl·crawl4ai
与LLM结合的主流智能爬虫框架目前市面上有几个非常有代表性的开源框架:1. Crawl4AI 这是一个强大的开源网页爬取工具,旨在为大模型应用提供高质量的数据5。它的特点包括: LLM驱动提取:可以直接集成各种大语言模型(如 GPT、DeepSeek 等),根据你的指令从网页中提取结构化数据。 AI清洗与格式化:能够自动去除网页中的广告、导航等噪音,提取主内容,并输出为 Markdown、JSON 等对LLM友好的格式。 引用与附件处理:具备处理网页引用和链接的能力,可以将页面中的参考文献或附件链接整理成有序列表,这与你整理附件链接的
AI大佬的小弟21 小时前
llm·prompt·提示词·few-shot·zero-shot·提示词工程·大模型名词精讲
大模型名词精讲 03:Prompt不知道小伙伴们有没有过这种经历:同样用 ChatGPT,别人写的 Prompt 一扔进去,出来的结果又专业又好用;我们吭哧吭哧写了半天,出来的东西却总感觉 "差点意思"。
小林ixn1 天前
javascript·llm·gpu
WebGPU + Transformers.js:把 DeepSeek-R1 塞进浏览器,真香!谁说前端只能写页面?当浏览器遇上 GPU 加速,1.5B 参数的大模型也能在你电脑上流畅推理,而且全程数据不出设备。这篇实战笔记带你从零搭建一个纯浏览器端的 DeepSeek-R1 对话应用。
鬼手点金1 天前
llm·github·nvidia·apikey·freellmapi·agnes ai·日日新
FreeLLMAPI 介绍FreeLLMAPI 是一个开源的 OpenAI 兼容 API 代理网关,由开发者 tashfeenahmed 创建并托管在 GitHub 上(github.com/tashfeenahmed/freellmapi),目前已有超过 6000 个 Star。
AINative软件工程1 天前
后端·llm·ai编程
LLM 应用的 Feature Flag 工程实践:Prompt、模型与 AI 行为的生产安全灰度去年某电商平台升级客服助手的 system prompt,把原来的「请严格基于订单数据回答」改成了「请友好地帮助用户解决问题」。改动当天下午,用户开始反馈:AI 告诉他们的退款时效比实际政策快了两天。
众人皆醒我独醉2 天前
后端·面试·llm
Token:AI 世界的基本粒子——不是"字",是统计上最优的"字符组合"LLM 基础系列 · 第 3 篇你问 AI 问题,账单上写的是"消耗 Token 数"。AI 的参数规模——GPT-4 是"约 1.8 万亿参数,上下文 128K Token"。
DigitalOcean2 天前
llm·agent
AI 应用成本怎么算?从推理费用到完整 TCO 拆解一位技术负责人在评估不同平台之前,问了一个很合理的问题:“哪家推理平台的 Token 单价最低?”但这个问题其实问得不够完整。
liulilittle2 天前
c++·人工智能·算法·机器学习·llm
MOE路由:路由(logits: top-k/8)
AI大佬的小弟2 天前
llm·分词·token·bpe·大模型名词精讲·ai 入门·大模型基础概念
大模型名词精讲 02:Token最近在收到不少小伙伴的留言,说看了很多大模型相关的文章,但每次看到 "Token" 这个词就一头雾水 —— 什么是 Token?为什么大模型都按 Token 收费?一个 Token 到底等于多少字?
tachibana22 天前
数据库·人工智能·大模型·llm
知识库文档上传接口在大语言模型(LLM)与检索增强生成(RAG)系统的生产落地中,知识库文档上传接口是整个数据管道(Data Pipeline)的入口。与传统的文件存储上传接口不同,知识库文档上传具有计算密集型、多阶段重处理、高延迟、高并发与状态变更复杂等特征。一个完备的知识库上传接口,不仅需要处理大文件传输与格式校验,还需要承载文件秒传、解析提取、结构化切片、向量化计算(Embedding)以及向量与标量双写索引的全链路控制。
武子康2 天前
人工智能·llm·agent
Pi Agent Loop 源码解析:Context、Streaming、Tool Calling、Steering 与停止条件Pi 的 Agent Loop 不只是一个 while 循环。它需要处理 AgentMessage 与 LLM Message 转换、流式 AssistantMessage、Tool 参数验证、串并行执行、Steering、Follow-up、Abort、错误结果和生命周期事件。本文基于 v0.82.1 固定源码重建一次用户输入的完整运行链。
阿图灵2 天前
人工智能·架构·llm·rag·ai agent·智能体·agentic ai
Agentic AI 架构入门(三):Agent 的七大组件与 PRAL 循环课程:《Agentic AI Architectures with Patterns, Frameworks and MCP》笔记整理(第 66–172 页)
武子康2 天前
人工智能·llm·agent
全双工语音 Agent 如何评测:从首音延迟到事件级验收图 1:把“快”拆成事件,把“好用”拆成行为、任务与副作用。语音 Agent 很容易把首音延迟当作总成绩。模型在 300ms 内开口,图表很好看,演示也显得流畅。但如果用户只是在句中停顿,它就抢话;用户说“嗯”表示继续听,它却把当前回答取消;用户已经改口,它仍执行旧工具;后台任务结束后,它把过期结果插进新话题——那么更快的首音只是让错误更早发生。
孙启超2 天前
人工智能·macos·开源·llm·agent·ai编程·ai应用开发
Token太贵自己写了一个mac版开源AI编程工具SqcAICode 是一款面向 macOS 的原生桌面 AI 编程助手,集成 DeepSeek API,提供智能对话、代码编辑、终端操作、文件管理等一站式开发体验。采用 VS Code 风格的深色主题 UI,支持 Function Calling 工具链,让 AI 直接读写文件、执行终端命令和搜索网页。
liulilittle3 天前
人工智能·算法·机器学习·llm
归一化:激活函数
smartfish_liu3 天前
llm·agent
apl_LLM_agent_harness架构设计【核心哲学】 彻底抛弃 JSON、Function Call、结构化 API。整个系统只使用一种通用语言: 自然语言(人话)。LLM 是唯一的翻译官,APL 仅充当文本邮差。