ai工程

小白跃升坊13 天前
阿里云·agent·ai agent·ai工程·调研报告
阿里云2026年AI Agent 开发者调研报告解读:企业 Agent 到底卡在哪数据来源:aliyun/ai-agent-handbook 仓库根目录下的 2026-agent-survey-report.md。 在北京、深圳、广州、上海、杭州举办多场线下开发者沙龙,回收有效问卷 1906 份,受访者以企业技术决策者、架构师、一线工程师和产品经理为主。 本文件是《AI Agent Handbook 精读》系列的配套独立报告解读篇,另外三篇精读分别讲 Harness 工程、运行与治理、调优案例与 Agentic OS。
咖啡星人k20 天前
日志分析·ai工程·排障
工具调用排障手册:四层定位法附日志样例AI 接了工具之后,失败是常态。有效率的做法不是换模型,而是先定位失败在哪一层。本文给出四层定位法与可直接抄的日志格式。
咖啡星人k20 天前
人工智能·mcp·ai工程
MCP 协议入门:从 tools/list 到一次真实调用很多人把 MCP 理解成"插件系统",其实它解决的是一件事:让模型发现工具、调用工具、接收结果有统一的约定。本文按一次真实调用的顺序,把这条链路拆开讲清楚。
长谷深风1112 个月前
大数据·人工智能·ai agent·智能体·大模型应用·ai工程·agent终止条件
从 Plan 到 DAG:如何判断依赖、环与并行任务假设你让一个 AI 完成这样一件事:分析一家公司的竞争格局,写出报告,并根据结论生成一份演示文稿。AI 很快给出一个 Plan:搜集资料、整理竞争对手、分析市场、撰写报告、制作 PPT。看起来条理清楚,但真正执行时问题才出现:哪些步骤必须等前一步完成?哪些可以同时进行?如果两个任务互相等待怎么办?AI 生成的执行图,又怎么判断它真的能跑?
孤狼GPT2 个月前
chatgpt·codex·ai工程·多agent·gpt-5.6
GPT-5.6降价之后,ChatGPT与Codex开发成本下降,工程复杂度为什么反而上升?GPT-5.6 Luna价格下降80%,Terra价格下降20%以后,开发者最直观的感受是:使用AI完成编程任务的成本进一步降低了。
漂着的圆木3 个月前
llm·ai工程
生产级大模型集成方案:构建弹性可观测的API适配层随着大型语言模型(LLM)能力的飞速发展,越来越多的企业尝试将其集成到核心业务流程中。然而,将一个LLM应用从实验性原型推向生产级系统,远不止简单地调用几个API接口。我们团队在实际项目里,经常面临如何确保这些集成方案的可靠性、可伸缩性、可维护性和可观测性的挑战。特别是当业务逻辑依赖复杂的工具调用链,或需要频繁切换不同的模型服务时,一个健壮的集成架构变得至关重要。本文将深入探讨我们如何通过构建一个解耦的API适配层,结合LangChain进行工具编排,并利用OpenTelemetry实现端到端的可观测性,
__土块__4 个月前
可观测性·系统稳定性·ai工程·生产实践·终态一致性·管理后台设计·指标归因
AI 系统后台可观测性治理:从请求链路断裂到分层指标归因的闭环设计在 2025 年底上线的一个 AI 客服系统中,业务方反馈“用户提问后偶尔无响应”,但后台日志显示模型已成功返回结果。运维团队检查调用链路,发现 LLM 调用、RAG 检索、工具执行均正常,唯独前端未展示。进一步排查发现,会话状态在“模型响应完成”后未正确流转至“待渲染”状态,导致前端轮询接口始终返回“处理中”。更严重的是,该问题在监控大盘中完全不可见——所有 SLI 指标(如 P99 延迟、成功率)均正常,因为“服务调用成功”被定义为“模型返回非空响应”,而状态流转失败被归类为“前端渲染问题”,未纳入核
__土块__4 个月前
可观测性·rag系统·ai工程·管理后台设计·静默故障·agent系统·链路监控
AI 后台请求链路可观测性治理:从静默状态丢失到分层指标归因的工程实践凌晨三点,值班群里跳出一条告警:用户反馈‘AI 助手没响应’,但后台任务状态显示‘已完成’。运维查了日志,模型调用返回 200,RAG 检索有结果,Agent 编排也走到了终态——可用户端就是没收到答案。这种‘链路通但体验断’的静默故障,在 AI 系统中越来越常见。问题不在单点,而在状态与观测的断层:系统知道‘做了什么’,但不知道‘做得好不好’。
__土块__4 个月前
故障治理·系统稳定性·会话管理·ai工程·生产实践·终态一致性·静默故障
AI 会话记忆模块静默失效治理:从状态丢失到分层终态校验的工程实践我们在 2025 年底上线了一个面向企业客服场景的 AI 会话系统,支持多轮对话、上下文记忆、工具调用和知识库检索。系统设计上采用分层架构:前端会话层、记忆管理模块、RAG 检索引擎、工具调度器和模型路由层。初期测试表现良好,但在灰度放量后,用户反馈“系统好像忘了我说过什么”,尤其在超过 5 轮对话后,AI 回复明显偏离上下文。
__土块__5 个月前
巡检系统·rag系统·ai工程·静默故障·agent系统·链路监控·自动补偿
AI 巡检系统上线后静默漏报治理:从链路状态盲区到分层监控与自动补偿的设计实践我们在 2025 年底上线了一套基于 RAG + Agent 的 AI 巡检系统,用于自动识别服务器异常日志、生成诊断建议并触发告警。初期测试效果良好,但在灰度放量阶段发现一个致命问题:系统日志显示任务全部执行成功,但实际漏报率高达 37%。更严重的是,由于缺乏有效监控,这一问题在两周内未被发现,导致多个关键服务异常未能及时处理。
__土块__5 个月前
系统稳定性·故障排查·任务编排·ai工程·生产实践·状态机设计·静默故障
AI 任务编排系统静默阻塞故障复盘:从状态机设计缺陷到分层调度与补偿机制的工程实践2026 年初,我们上线了一套基于 Agent 的智能工单处理系统,用于自动解析用户提交的工单内容,调用 RAG 检索相关知识,并由多个子 Agent 协同完成分类、优先级判定、执行建议生成等任务。系统初期运行平稳,但在一次知识库大规模更新后,出现大量工单“卡在中间状态”的现象:前端显示“处理中”,但实际任务已停止推进,无错误日志,也无超时告警。
__土块__5 个月前
系统稳定性·健康检查·rag系统·ai工程·模型路由·静默故障·降级策略
多模型路由上线后静默降级故障复盘:从健康检查失效到动态权重补偿2026年4月,我们上线了一套多模型路由系统,用于在RAG问答链路中根据查询复杂度、成本预算和SLA要求动态选择底层模型(如通义千问、DeepSeek、GLM等)。初期灰度阶段表现稳定,但在全量发布后第3天,监控大盘出现异常:
XD7429716365 个月前
开发语言·科技·rust·科技新闻·开发者工具·ai工程
科技早报晚报|2026年5月18日:Agent 原生语言、代码语义图谱与 Rust 数据层,今天更值得跟进的 3 个技术机会一句话导读:今天这轮科技新闻里,最值得看的不是再来一个更会聊天的 Agent,而是三类更接近工程底座的能力开始升温: 给 Agent 写工具的原生语言、把代码仓库压缩成低 token 成本的语义图谱,以及更适合高并发服务的类型安全数据层。它们共同说明,2026 年真正接近预算入口的机会,正在从“模型调用层”继续下沉到“可执行、可维护、可审计的基础设施层”。
__土块__5 个月前
可观测性·信息架构·mcp协议·rag系统·ai工程·管理后台设计·agent系统
AI 管理后台首页信息过载:从用户决策失效到摘要视图重构我们的 AI 管理后台在 2026 年 Q1 上线后,运营团队频繁反馈“首页密密麻麻,点进去不知道该看什么”。尽管接入了 RAG 检索日志、Agent 执行记录、MCP 工具调用统计等 12 类数据源,但关键决策点仍依赖人工翻查。在一次线上故障中,值班工程师因首页信息混乱未能及时发现 RAG 检索退化,导致推荐服务连续 3 小时返回低相关性结果。本文将复盘该问题,从用户可感知的决策失效出发,逐层拆解后台信息架构缺陷,最终输出一套可落地的首页摘要视图设计方法。
__土块__5 个月前
可观测性·系统稳定性·ai工程·管理后台设计·静默故障·链路背压·异步探活
AI 管理后台稳定性治理:从静默超时到链路背压的监控体系设计2026 年 Q1,某 AI 内容生成平台上线后,运维团队连续三天收到用户反馈:“任务提交后无响应,页面始终显示‘处理中’”。前端无报错,任务状态未更新,但后台日志显示任务已触发。进一步排查发现,部分 Agent 工具调用因外部服务响应缓慢,导致线程池阻塞,后续任务排队积压,最终触发全局超时。更严重的是,该问题在管理后台的监控面板中几乎不可见——成功率仍为 99.8%,平均延迟正常,仅个别长尾请求超时。
__土块__5 个月前
状态机·可观测性·任务调度·系统稳定性·ai工程·静默故障·背压控制
AI 后台任务调度中的静默跳过治理:从链路背压到状态补偿的稳定性实践在 AI 后台任务调度系统中,一个典型的故障现象是:任务被成功触发,日志显示“已入队”,但最终无产出、无错误日志、无告警。用户侧表现为“任务消失了”。这类静默跳过问题在 RAG 文档处理、Agent 工具调用、定时模型推理等场景高频出现,排查成本极高。本文基于一次真实线上故障,还原从现象定位到根因分析,再到治理落地的完整过程,重点聚焦任务调度链路的稳定性治理。
__土块__5 个月前
状态机·任务调度·系统稳定性·异步执行·ai工程·静默故障·超时治理
定时任务触发后无产出的静默故障排查与治理实践在一个基于 RAG 的自动化内容生成系统中,用户配置了每日定时触发的文章生成任务。任务配置成功,调度日志显示“已触发”,但连续多日未产出最终文章。前端无报错,后台无异常日志,任务状态停留在“执行中”,形成典型的静默故障。
__土块__5 个月前
链路追踪·系统稳定性·故障排查·mcp协议·ai工程·生产实践·终态一致性
AI 后台 MCP 工具调用静默跳过:从链路断层到分层校验的治理实践在 AI 后台任务执行过程中,用户侧观察到部分本应由 MCP 协议调用的外部工具未被实际执行,但任务状态仍被标记为“成功”。前端无报错提示,日志中无异常堆栈,仅能在部分链路追踪片段中发现工具调用请求未发出。该问题在长链任务(>3 步)中复现率更高,短链任务相对稳定。
__土块__5 个月前
可观测性·系统稳定性·事件驱动·缓存一致性·ai工程·生产实践·额度治理
AI 后台模型调用额度突降为零的治理复盘:从额度同步延迟到动态感知的稳定性实践2026年4月中旬,某内部 AI 平台的后台管理界面中,多个租户的模型调用额度突然显示为 0,导致前端自动触发降级策略,大量请求被静默丢弃。用户侧表现为“无模型响应”,但服务本身未报错。该问题持续约 15 分钟后恢复,期间影响数百个活跃会话。