近日,Agent 观测与优化 · Close the Loop 三城巡演第二站深圳站圆满落幕。本场活动联合 AgentScope 举办,吸引了近百名技术从业者参与,围绕"Evaluate / 评估与实验"这一主题,深度分享了 Agent 评估范式、AgentScope 2.0 企业级智能体底座、以及基于 AgentLoop 的电商客服助手评估实践,并设置了如何进行智能体评估的动手实操。大家最关注的是:企业如何建立评估基建、组织内如何分工是最优解。
北京站回顾:《Agent 评估与优化三城巡演丨北京站精彩回顾 & PPT 下载》
关注「阿里云云原生」公众号,后台回复:0831
免费获得深圳站讲师 PPT 合辑
议题一:Agent 的评估和实验,如何证明我的 Agent 更好?丨谢精杰(南珈),阿里云 AgentLoop 产品经理

Agent 进入生产后,最大的难题不是让它跑起来,而是证明它确实比上一版更好。谢精杰从"感觉变好"与"可度量变好"的鸿沟切入,提出基于 Trajectory 的评估范式:把单次对话扩展为完整推理轨迹,用 Agent-as-a-Judge 在生产 Trace 上自动打分,并与人工专家保持 90% 以上一致性。评估不是一次性动作,而是嵌入在"运行---评估---实验---门禁"闭环中的基础设施:通过任务完成度、Groundedness、工具选择合理性等内置评估器量化 A/B 差异,用变更门禁拦截负向迭代,让每次上线都有据可依。
议题二:基于 AgentScope,构建智能体底座的实战丨刘军(陆龟),AgentScope Maintainer

企业级 Agent 不同于单次调用的 LLM 应用,它需要长任务运行、状态持久化和多智能体协作。刘军介绍了 AgentScope 2.0 的核心升级:Harness 作为智能体运行内核,以 Workspace 为事实来源,通过抽象文件系统、四层上下文压缩和双层长期记忆,让 Agent 在长对话中不丢上下文、不忘事实;同时支持子智能体编排、委派、并行与异步通知,并接入 E2B Sandbox 实现文件与 Shell 隔离及快照恢复。
在控制面,AgentScope Service 不替代现有框架,而是为 LangChain、ADK 等不同技术栈提供统一管控,通过 Goal Pipeline 的执行---验证---反馈闭环、可运营 RAG Service 和 AgentTeams 多智能体协作状态机,把开发、运行、治理拉进同一个生命周期。
议题三:基于 AgentLoop 的 AgentScope Java 电商客服助手应用评估实践丨饶子昊(铖朴),阿里云 AgentLoop 研发工程师

本议题以一个 AgentScope Java 电商客服助手为例,完整演示了如何把评估从概念落到实验。Demo 围绕 6 个固定客服 Case,对 A/B 两版 Prompt 各跑 6 次,生成 12 条 Trace;通过 AliyunJavaAgent 5.1.2 自动上报到 AgentLoop,再用任务完成度、Groundedness(回答证据支持度)和工具选择合理性三个内置评估器做批量评估。
实验结论清晰可解释:B 版 Prompt 在保持任务完成度和工具选择合理性的前提下,Groundedness 明显优于 A 版,在售后工具失败的 Case 05 中不编造平台、电话和退款时效,在官方政策与论坛内容冲突的 Case 06 中以官方来源为准。该流程可直接作为 Agent 上线前的评估门禁:只有关键指标不下降、高风险 Case 不新增严重错误,才允许进入下一版。
动手实操:给你的 AgentScope Java 应用接上 AgentLoop 评估
此外,现场设置了动手实操环节,讲师带领大家基于电商客服 Demo 跑通"接入 AgentScope Java 应用 → 生成 A/B Trace → 在 AgentLoop 创建批量评估 → 解读评估结论"的完整链路,现场把从直觉到证据的评估方法跑了一遍。
现场精彩瞬间




下站预告:
Agent 观测与优化最后一站上海站,9月4日14:00-17:00,联合 LangChain 分享"Optimize / 进化",报名审核制,审核通过,将收到短信通知。我们上海见。
直达报名(点击链接,选择你想参加的城市场次,锁定席位。名额有限,先到先得):survey.aliyun.com/apps/zhilia...
钉钉搜索群号: 164165047469,前往「AgentLoop 开发者交流群」进行交流!
