llm-as-judge

thesky12345615 天前
智能体·回归测试·llm-as-judge·评测门禁·eval-as-ci·golden set·上线守护
智能体面试准备(五十六)智能体评测与回归门禁工程实战——从 Eval-as-CI 到上线守护B31 讲过「智能体评测体系深化」——轨迹指标、部分分、LLM-as-Judge。B54 讲过「线上实验与效果归因」——A/B、影子、因果归因、上线门禁。两篇解决「怎么衡量 Agent 好不好」。本篇把衡量变成「工程动作」:Eval-as-CI,让每次代码提交、每次发布都自动过评测门禁,防止悄悄退化。
thesky1234561 个月前
大模型·benchmark·模型评测·llm-as-judge·数据污染·elo·mmlu
27届大模型面试准备(二十):评测体系全攻略——Benchmark、数据污染、LLM-as-Judge 与 Arena 对战上一篇《模型量化全攻略》结尾留了个问题:量化之后"到底掉了多少点",靠什么来回答?答案就是评测体系。这一篇是本系列第二十篇,也是把前面所有技术串起来的一篇——无论是 RAG、长上下文、后训练还是量化,最终都要面对同一个拷问:"你怎么证明它变好了?"评测看起来是最"没技术含量"的环节,实际上是大厂面试里区分度最高的题目之一,因为它直接暴露一个人有没有真正把模型送上过线。本文按"评测的三层结构 → 静态 Benchmark 与它的崩塌 → 数据污染 → LLM-as-Judge → Arena 与 Elo →
llwszx2 个月前
java·后端·golang·状态机·pydantic·agnet·llm-as-judge
【Java/Go后端手撸原生Agent(第五篇):多工具并行调用 + BashTool执行引擎 + Judge证据链升级】“我”:Java/Go后端开发者、有点时间想自己琢磨,想入门Agent但不想堆砌框架、希望理解底层原理的研发 上一篇链接:Java/Go后端手撸原生Agent(第四篇)
minhuan2 个月前
人工智能·大模型应用·llm-as-judge·ai agent量化评估·智能体多维评测
AI Agent量化评估:LLM-as-Judge、人工标注、A/B测试全解,智能体多维评测实践21.0做过AI Agent开发的朋友应该都有同感,现在搭一个能用的Agent真的太简单了。不管是调用开源模型、拼接Prompt,还是接入各类工具插件,半天就能跑出一个能对话、能执行简单任务的智能体Demo。但真正落地做项目、上线迭代后,大家都会遇到同一个棘手问题:Agent到底算做得好不好?该往哪个方向优化?改完Prompt、调整完逻辑后,是真的变强了,只是运气波动,甚至越改越差?
大鹅同志2 个月前
ai·langchain·agent·rag·langgraph·vibecoding·llm-as-judge
Agent Runtime Evaluation Platform — AI Agent 运行时全维度质量评估平台📦 GitHub: https://github.com/daetz-coder/Agent-Runtime-Evaluation-Platform
我是有底线的