llm-as-judge

thesky1234569 天前
大模型·benchmark·模型评测·llm-as-judge·数据污染·elo·mmlu
27届大模型面试准备(二十):评测体系全攻略——Benchmark、数据污染、LLM-as-Judge 与 Arena 对战上一篇《模型量化全攻略》结尾留了个问题:量化之后"到底掉了多少点",靠什么来回答?答案就是评测体系。这一篇是本系列第二十篇,也是把前面所有技术串起来的一篇——无论是 RAG、长上下文、后训练还是量化,最终都要面对同一个拷问:"你怎么证明它变好了?"评测看起来是最"没技术含量"的环节,实际上是大厂面试里区分度最高的题目之一,因为它直接暴露一个人有没有真正把模型送上过线。本文按"评测的三层结构 → 静态 Benchmark 与它的崩塌 → 数据污染 → LLM-as-Judge → Arena 与 Elo →
llwszx25 天前
java·后端·golang·状态机·pydantic·agnet·llm-as-judge
【Java/Go后端手撸原生Agent(第五篇):多工具并行调用 + BashTool执行引擎 + Judge证据链升级】“我”:Java/Go后端开发者、有点时间想自己琢磨,想入门Agent但不想堆砌框架、希望理解底层原理的研发 上一篇链接:Java/Go后端手撸原生Agent(第四篇)
minhuan1 个月前
人工智能·大模型应用·llm-as-judge·ai agent量化评估·智能体多维评测
AI Agent量化评估:LLM-as-Judge、人工标注、A/B测试全解,智能体多维评测实践21.0做过AI Agent开发的朋友应该都有同感,现在搭一个能用的Agent真的太简单了。不管是调用开源模型、拼接Prompt,还是接入各类工具插件,半天就能跑出一个能对话、能执行简单任务的智能体Demo。但真正落地做项目、上线迭代后,大家都会遇到同一个棘手问题:Agent到底算做得好不好?该往哪个方向优化?改完Prompt、调整完逻辑后,是真的变强了,只是运气波动,甚至越改越差?
大鹅同志1 个月前
ai·langchain·agent·rag·langgraph·vibecoding·llm-as-judge
Agent Runtime Evaluation Platform — AI Agent 运行时全维度质量评估平台📦 GitHub: https://github.com/daetz-coder/Agent-Runtime-Evaluation-Platform
我是有底线的