llm

AINative软件工程22 分钟前
后端·llm·ai编程
LLM 应用的 Feature Flag 工程实践:Prompt、模型与 AI 行为的生产安全灰度去年某电商平台升级客服助手的 system prompt,把原来的「请严格基于订单数据回答」改成了「请友好地帮助用户解决问题」。改动当天下午,用户开始反馈:AI 告诉他们的退款时效比实际政策快了两天。
众人皆醒我独醉15 小时前
后端·面试·llm
Token:AI 世界的基本粒子——不是"字",是统计上最优的"字符组合"LLM 基础系列 · 第 3 篇你问 AI 问题,账单上写的是"消耗 Token 数"。AI 的参数规模——GPT-4 是"约 1.8 万亿参数,上下文 128K Token"。
DigitalOcean15 小时前
llm·agent
AI 应用成本怎么算?从推理费用到完整 TCO 拆解一位技术负责人在评估不同平台之前,问了一个很合理的问题:“哪家推理平台的 Token 单价最低?”但这个问题其实问得不够完整。
liulilittle16 小时前
c++·人工智能·算法·机器学习·llm
MOE路由:路由(logits: top-k/8)
AI大佬的小弟19 小时前
llm·分词·token·bpe·大模型名词精讲·ai 入门·大模型基础概念
大模型名词精讲 02:Token最近在收到不少小伙伴的留言,说看了很多大模型相关的文章,但每次看到 "Token" 这个词就一头雾水 —— 什么是 Token?为什么大模型都按 Token 收费?一个 Token 到底等于多少字?
tachibana21 天前
数据库·人工智能·大模型·llm
知识库文档上传接口在大语言模型(LLM)与检索增强生成(RAG)系统的生产落地中,知识库文档上传接口是整个数据管道(Data Pipeline)的入口。与传统的文件存储上传接口不同,知识库文档上传具有计算密集型、多阶段重处理、高延迟、高并发与状态变更复杂等特征。一个完备的知识库上传接口,不仅需要处理大文件传输与格式校验,还需要承载文件秒传、解析提取、结构化切片、向量化计算(Embedding)以及向量与标量双写索引的全链路控制。
武子康1 天前
人工智能·llm·agent
Pi Agent Loop 源码解析:Context、Streaming、Tool Calling、Steering 与停止条件Pi 的 Agent Loop 不只是一个 while 循环。它需要处理 AgentMessage 与 LLM Message 转换、流式 AssistantMessage、Tool 参数验证、串并行执行、Steering、Follow-up、Abort、错误结果和生命周期事件。本文基于 v0.82.1 固定源码重建一次用户输入的完整运行链。
阿图灵1 天前
人工智能·架构·llm·rag·ai agent·智能体·agentic ai
Agentic AI 架构入门(三):Agent 的七大组件与 PRAL 循环课程:《Agentic AI Architectures with Patterns, Frameworks and MCP》笔记整理(第 66–172 页)
武子康1 天前
人工智能·llm·agent
全双工语音 Agent 如何评测:从首音延迟到事件级验收图 1:把“快”拆成事件,把“好用”拆成行为、任务与副作用。语音 Agent 很容易把首音延迟当作总成绩。模型在 300ms 内开口,图表很好看,演示也显得流畅。但如果用户只是在句中停顿,它就抢话;用户说“嗯”表示继续听,它却把当前回答取消;用户已经改口,它仍执行旧工具;后台任务结束后,它把过期结果插进新话题——那么更快的首音只是让错误更早发生。
孙启超1 天前
人工智能·macos·开源·llm·agent·ai编程·ai应用开发
Token太贵自己写了一个mac版开源AI编程工具SqcAICode 是一款面向 macOS 的原生桌面 AI 编程助手,集成 DeepSeek API,提供智能对话、代码编辑、终端操作、文件管理等一站式开发体验。采用 VS Code 风格的深色主题 UI,支持 Function Calling 工具链,让 AI 直接读写文件、执行终端命令和搜索网页。
liulilittle2 天前
人工智能·算法·机器学习·llm
归一化:激活函数
smartfish_liu2 天前
llm·agent
apl_LLM_agent_harness架构设计【核心哲学】 彻底抛弃 JSON、Function Call、结构化 API。整个系统只使用一种通用语言: 自然语言(人话)。LLM 是唯一的翻译官,APL 仅充当文本邮差。
only-qi2 天前
人工智能·llm
大模型应用如何保证实时性和多轮对话一致性目录引言核心解析一、实时性优化:从模型到工程的全链路加速二、多轮对话一致性:让AI"记住"并"理解"上下文
武子康2 天前
人工智能·llm·agent
WebRTC 已经双向,语音 Agent 为什么还会抢话?一个语音 Agent 的 WebRTC 指标可以全部正常,仍然像一个不会听人说话的客服。麦克风一直上传,扬声器也一直下载,连接的确是双向的。可用户只是说了声“嗯”,系统立刻把回答掐断;用户说“不是杭州,是青岛”,模型已经停了,播放器却又多播半句;用户没有打断,只是旁边的人说话,后台却创建了一个新回合;更隐蔽的情况是声音停了,但对话历史仍记录了那段未被用户听见的回答,下一轮模型会基于一段不存在的共同上下文继续推理。
liulilittle2 天前
人工智能·算法·机器学习·ai·llm
反量化:反量化Q8零(q8_0)
武子康3 天前
人工智能·llm·agent
从生成一张图到交付一套资产:怎样验收 AI 图片的连续可编辑性事实复核截止:2026 年 8 月 1 日;发布前于 2026 年 8 月 8 日重新核对来源可达性与产品状态边界。
武子康3 天前
人工智能·llm·agent
Code Mode 什么时候更省:别只数工具调用,要数模型往返判断 Code Mode 是否更省,最容易犯的错误,是盯着“工具调用了多少次”。同样读取 10 个文件,可以是模型发起 10 次串行决策,也可以是模型先写一个有界程序,让程序完成 10 次读取、筛选和聚合,再把一份压缩结果交还模型。两种方案的工具调用数都可能是 10,但模型往返、重复上下文和中间输出完全不同。
hust_wangyajun3 天前
ai·llm·agent·mcp
Function-Call / Skill / MCP-Server / ReAct 范式深度辨析现在做Agent开发,几乎一定会碰到四个高频名词:Function-Call、Skill、MCP-Server、ReAct。 很多人会把它们放在同一维度对比,实际上它们分属完全不同层级: