技术栈
llm
DO_Community
2 小时前
人工智能
·
llm
·
aigc
·
agent
·
ai编程
RAG 的 Embedding 模型需要微调吗?什么时候值得自己训练?
大多数构建 RAG 的团队,其实没必要自己训练 Embedding 模型。OpenAI 的 text-embedding-3-large、Cohere 的 embed-v4 这类现成模型价格不高、文档完善,也不需要自己维护推理基础设施。对于大多数通用语料,它们已经足够好用。
武子康
3 小时前
人工智能
·
llm
·
agent
小智的音频队列满了:丢旧帧、拒新包与播放延迟
场景:小智(xiaozhi-esp32)语音设备断续时,是否应该把缓冲调大。结论:缓冲调大只推迟再次装满;首先要分清上行丢旧、下行拒新、播放限流三种不同取舍。产出:4 个队列容量与拥塞策略对照 + 改缓冲前的采集清单。 适用版本:78/xiaozhi-esp32,固定 commit 6240b777aaa2bc0cad43a4ce25b30de23f36ad00(核验日期 2026-09-10);ESP-IDF v6.0 / 6.0.1 主线。
AI技术新视界
3 小时前
llm
·
推理框架
·
engram
哪些推理框架支持 N‑Gram Engram 表offload(卸载)到SSD
截至 2026年9月,随着 DeepSeek 密集发布包含 Engram 架构的新模型(如最新推出的 DeepSeek-V4.1-Flash,其中包含高达 197B 的 N-Gram 记忆表),开源推理框架生态对 Engram 的支持正在迎来爆发期。 [1] 将 Engram 表 offload(卸载)到 SSD 硬盘或 CPU RAM(主机内存),是这一代架构的核心技术红利。因为 Engram 的查表索引仅由输入 Token 决定(与模型中间层的激活值无关),这意味着推理引擎可以在 Attention
武子康
3 小时前
人工智能
·
llm
·
agent
SGLang 回答慢,时间究竟花在了哪里?
场景:SGLang 推理服务上线后用户反馈"答得慢"。结论:两种"慢"是不同阶段的问题,需要分别看 prefill 前 / decode 后 / 链路后端三类观察点。产出:一份可复查的排障记录模板和一张症状-核对项对照表。 适用版本:SGLang v0.5.x(2026 年 9 月前后的稳定版;最新发布 v0.5.19,2026-09-05)。
2601_96229748
3 小时前
机器学习
·
langchain
·
llm
·
恶意域名
·
流量检测
基于LangChain+LLM大模型+机器学习的恶意域名(流量)智能检测系统
无需借由LLM就能生成基础检测报告, 参照实际字符特征以及训练数据的统计来解释风险线索, AI复核给出进度与阶段有文字展现出的提示, 训练输出日志和任务的状态, 这些反映的是执行进程, 并非是在展示大模型内部的思维链。
流浪001
4 小时前
llm
大模型技术全景(八):MCP,大模型的“万能插头“——一次集成处处运行
📚 本文收录于「流浪」的系列专栏🏠 博客主页:流浪 | 📝 原创首发于 CSDN上一篇结尾留了个问题:每接一个新工具就要写一套代码,太麻烦——有没有统一的标准?
AINative软件工程
5 小时前
单元测试
·
llm
·
ai编程
LLM 应用的测试替身工程实践:用 Fake/Stub/Mock 让 AI 代码真正跑起来 CI
你的 LLM 应用有测试吗?大概率有。能在 CI 里跑吗?大概率不能。这不是玩笑。我见过的大多数 AI 应用测试,要么跑一次要花几十秒、调几次真实 API,要么直接跳过所有含 LLM 调用的路径,只测"纯逻辑"部分。结果就是:主干代码的核心分支——所有跟模型打交道的部分——长期没有 CI 覆盖。
武子康
19 小时前
人工智能
·
llm
·
agent
小智的 MQTT 已连接,为什么还不能说话?从音频通道看协议选择
给小智接服务端时,有一种容易误判的状态:设备已连上 MQTT,控制消息也能往来,扬声器却没有声音。此时如果只盯着“设备在线”,很容易跳到 ASR、TTS 或音频芯片上排查,漏掉尚未建立的音频通道。
tachibana2
1 天前
数据库
·
人工智能
·
ai
·
llm
·
agent
什么是 Function Calling ?
在生成式人工智能的发展历程中,大语言模型(LLM)最初仅仅被视作一个极其擅长“续写文本”的概率预测引擎。由于预训练数据存在截止时间(Knowledge Cutoff),且模型内部无法进行精确的浮点数运算、无法直接查询私有数据库、无法感知物理世界的实时状态,LLM 在诞生初期常被戏称为“被困在机房里的硅基大脑”。
武子康
1 天前
人工智能
·
llm
·
agent
让 SGLang 按 JSON 回答,怎样少写一些补救代码
你让模型把客服工单分成“物流、退款、其他”,后端等着读 JSON。它却先回一句“当然可以,分析如下”,再给结果。有时外面包着代码块,有时把约定好的 refund 写成中文“退款”。
Darling噜啦啦
1 天前
llm
·
sql server
Text2SQL 实战:自然语言直连数据库,让 AI 自动写 SQL 完成 CRUD 与多表联查
不懂 SQL 也能查数据库?"工程部门员工的姓名和工资是多少?"——一句人话,AI 自动生成 SELECT name, salary FROM EMPLOYEES WHERE department = '工程'。这就是 Text2SQL:自然语言 → SQL 的自动翻译。本文从零搭建一个完整的 Text2SQL 项目:SQLite 文件数据库建表 → Schema 工程化提取 → DeepSeek 生成 SQL → CRUD 四种操作实战 → 多表 JOIN + GROUP BY 聚合查询。核心只有一个函
Darling噜啦啦
1 天前
langchain
·
llm
LLM 结构化输出进阶:withStructuredOutput 一行封装 Tool Call,从流式输出到 MySQL 落地
上一篇讲了 LLM 结构化输出的四种方案:JsonOutputParser、fromNamesAndDescriptions、fromZodSchema、Tool Call。其中 Tool Call 是最可靠的——但 model.bindTools 的写法有点"讨巧",语义不够清晰。LangChain 提供了一行封装的终极方案:model.withStructuredOutput(schema)。本文从 bindTools 到 withStructuredOutput 的进化讲起,覆盖流式结构化输出、XM
Flynt
2 天前
llm
·
json
"只输出 JSON"根本不够:LLM 结构化输出的坑,我实测了 60 次调用
周一凌晨两点,告警群里弹了一条消息:选品接口成功率掉到 41%。 第一反应是后端挂了,翻了半天日志,服务进程好好的,就是推荐结果不对。后来把一条出错返回完整打出来才看明白——LLM 给的 JSON 是合法的,字段一个不少,但 reason 全是空字符串,confidence 全是 0。解析层没报错,业务层却拿到一堆"推荐了但说不出为什么推荐"的结果,前端渲染出来全是空白。 这玩意儿排查起来特别烦,不是"报错",是"静默出错"。我盯着那条返回看了半天,才意识到问题出在 LLM 输出这一层。 与其继续猜,我干
xn7133
2 天前
人工智能
·
llm
·
ai编程
Funes Agent Memory 实测:Codex 长期记忆召回、旧记忆污染与 no-answer 边界
直接答案:Funes 的价值不是给 Claude Code 或 Codex 再塞一段更长的系统提示词,而是把它们已经产生的 session trace 变成一个可搜索、可追溯、默认本地运行的长期记忆层。一个 Agent 上周为什么放弃某个 parser、哪次迁移踩过什么坑、哪个测试结论后来被推翻,都可以通过 recall 找回原始片段,而不是依赖人重新翻聊天记录。
William一直在路上
2 天前
人工智能
·
gpt
·
llm
·
openai
·
astra
GPT-6 Astra 研究报告——模型能力、API 演进与 Agent/MCP 生态影响分析
研究时间:2026 年 9 月 8 日 研究对象:OpenAI GPT-6 Astra 重点视角:模型能力、API、Agent、Tool Calling、MCP,以及对 Kong AI Gateway 的影响
玉宇夕落
2 天前
llm
从InMemory内存记忆到文件持久化,手把手教你管理AI的“记忆”
全文导读:大模型真的“记忆力”超群吗?No!它只是个金鱼脑。本文将带你从0到1掌握LangChain记忆系统的核心原理,深入剖析内存记忆与文件持久化两种方案的实现细节,并给出生产环境下的避坑指南。读完本文,你将彻底搞懂AI记忆管理的那些事儿。
神秘的猪头
2 天前
langchain
·
llm
·
fastapi
新版 LangChain Agent 核心架构:State、Context、ToolRuntime 与 Middleware
上一篇我们已经知道:底层本质依然是:但如果新版 LangChain 只是帮我们把:隐藏掉,那它其实并没有带来多大价值。
武子康
2 天前
人工智能
·
llm
·
agent
Agent 的工具没变,SGLang 缓存为什么没命中?
一个客服 Agent 每次调用模型,都带着同一套业务规则和工具说明。你期待第二轮能少算一些,可观察请求时发现,输入依然处理了很久。
MomentYY
2 天前
llm
·
agent
·
ai编程
大模型 Memory 管理:它凭什么知道你之前说过什么?
《AI 知识卡片》第 17 期 · 模型自己什么都不记得,是你每次把整段聊天重新递了一遍换个医生看同一个毛病,你得从头把病史再讲一遍。讲久了你会自己想办法:要么只讲最近这两周的症状,要么随身带一页纸的病历摘要,要么把几年前的检查单收进一个文件夹,医生问到哪一段你就翻哪一段。
桃西西呀
2 天前
人工智能
·
llm
·
ai编程
换个会话就失忆?拆开 Agent 记忆的 4 层与 4 个流派,附9个坑的自检清单
上周五下班前,我和 Claude Code 花了两个小时定下一件事:订单服务不走分布式事务,改用本地消息表 + 补偿任务。理由聊透了,权衡也写进了代码注释。