[基于OpenEvals的自动化评估-15]以LLM-as-a-Judge方式评估Agent生成的代码基于OpenEvals的自动化评估-14:以静态代码分析方式评估Coding Agent生成的代码着重介绍了基于MyPy和Pyright这两种广受欢迎的基于Python的静态代码分析引擎器来评估Agent生成的代码,其实提取出来的代码还可以直接交给LLM进行评估。相关的评估器可以利用create_code_llm_as_judge这个工厂函数来创建,本篇文章就来介绍如何利用这种方式实施针对代码的评估。