第九篇:降级矩阵与 Token 限流 —— 生产系统的八道防线

生产系统不是在"一切正常"时体现价值的,是在"一切都在崩"的时候。

最坏情况推演

如第一篇决策5所述的最坏情况推演(Qwen API 超时 + Milvus OOM + Redis 断连 + BGE Embedding 挂了 + NebulaGraph 不可用),系统能退化到"Qwen2.5-1.5B-Instruct 本地 GPU 推理,无 RAG 增强直接回答"。不是完美的回答,但不是 500。基于这个推演,我们为此设计了以下八维降级矩阵。


八维降级矩阵

每条链路至少两条退路,独立降级:

功能点 L1 L2 L3
意图识别 规则过滤 FAISS 向量匹配 LLM → RAG 兜底
参数抽取 纯正则 本地 Qwen3-1.7B 云端 LLM
工具选择 规则过滤 FAISS HNSW ---(P0+P1 已覆盖,无需额外层)
Embedding 本地 BGE 切 BM25 空上下文(LLM 通用知识)
速率限制 Redis 滑动窗口 内存 Fallback 仅限请求数
Token 预估 HF tokenizers 字符估算 跳过限流
图查询 NebulaGraph 返回空 不影响主线
内容安全 规则引擎 本地 LLM 云端 LLM

Token 限流:为什么请求次数是最差的指标

A 用户每次只问"在吗",B 用户每次发 5000 字投诉------对 LLM 压力天差地别。

HF tokenizers 方案:100% 精度 + 11MB 依赖 + <200ms 加载。比 tiktoken(85%)准,比 transformers(500MB+)轻。LRU 缓存命中率 >80%,多轮对话只需首次编码。

三阶段限流:Pre-check 预估 → LLM 调用 → Post-report 修正。


降级 UX:什么时候告诉用户?

  • P2→云端 LLM(延迟 80→300ms):不告知
  • LLM→P1 Top-1(准确率 95%→85%):不告知,记录 flag
  • 全部不可用→必须告知

原则:降级是内部韧性,不是用户负担。

相关推荐
peijiping16 分钟前
Agent 工具执行:并行(parallel_tool_calls)和后台(run_in_background)到底有什么区别? (学习笔记)
笔记·学习·ai agent·claude code
晴天161 小时前
Cordis 框架代码核心解析:一个可逆插件系统的实现-Day18
人工智能·ai·架构
新知图书1 小时前
4.2 北京欢迎您:基于Anthropic的京韵导览Agent实战(智能体工程)
人工智能·agent·ai agent·智能体·智能体工程
小新讲网安1 小时前
HTTP请求走私攻击实战:CL.TE与TE.CL绕过前端服务器全解析
服务器·前端·网络·web安全·http·架构·漏洞
鱼日先生12 小时前
Dify 中级实验(17):调试监控与性能优化——响应慢和 Token 超支如何定位?
工作流·dify·ai agent·大模型应用·ai 训练
小田学Python14 小时前
重新定义 Agent:为什么大模型不能直接干活,需要一层“壳”
大模型·api·ai agent
jufeng130715 小时前
【系列:手搓自主 AI Agent:Hermes 架构原理剖析 · 第 7 篇】
python·ai agent·权限系统
啾啾Fun15 小时前
【AI原生组织】6-AI Native团队组建与基础设施搭建
人工智能·chatgpt·ai-native·ai agent·ai原生组织·人机混编
阿图灵15 小时前
Agentic AI 架构入门(九):Agent 通信协议全景——ACP/A2A/AG-UI/MCP
人工智能·ui·架构·ai agent·智能体·mcp·agentic ai
这个DBA有点耶16 小时前
3000万个应用共享一套数据库:多租户“逻辑表”架构是如何做到的?
数据库·架构·dba