多 Agent 系统生产化:状态机、分布式追踪、错误降级、成本控制四件套上一篇我从零手写了一个 200 行的 Orchestrator-Worker 框架,也老实交代了它有四个窟窿:不能并行、没有状态、没有容错、不控成本。有人会问:既然 LangGraph 都把这些做掉了,我干嘛还自己造?答案是——你只有亲手把窟窿堵一遍,才真正理解"多 Agent 为什么难",以后不管用哪个框架,一眼就能看出它哪里会坑你。这篇就接着上篇的代码,把这四个窟窿一个个堵上。补完的这套,已经算得上一个能扛住生产环境毒打的迷你编排层了。