技术栈

llm-as-judge

llwszx
5 天前
java·后端·golang·状态机·pydantic·agnet·llm-as-judge
【Java/Go后端手撸原生Agent(第五篇):多工具并行调用 + BashTool执行引擎 + Judge证据链升级】“我”:Java/Go后端开发者、有点时间想自己琢磨,想入门Agent但不想堆砌框架、希望理解底层原理的研发 上一篇链接:Java/Go后端手撸原生Agent(第四篇)
minhuan
13 天前
人工智能·大模型应用·llm-as-judge·ai agent量化评估·智能体多维评测
AI Agent量化评估:LLM-as-Judge、人工标注、A/B测试全解,智能体多维评测实践21.0做过AI Agent开发的朋友应该都有同感,现在搭一个能用的Agent真的太简单了。不管是调用开源模型、拼接Prompt,还是接入各类工具插件,半天就能跑出一个能对话、能执行简单任务的智能体Demo。但真正落地做项目、上线迭代后,大家都会遇到同一个棘手问题:Agent到底算做得好不好?该往哪个方向优化?改完Prompt、调整完逻辑后,是真的变强了,只是运气波动,甚至越改越差?
大鹅同志
21 天前
ai·langchain·agent·rag·langgraph·vibecoding·llm-as-judge
Agent Runtime Evaluation Platform — AI Agent 运行时全维度质量评估平台📦 GitHub: https://github.com/daetz-coder/Agent-Runtime-Evaluation-Platform
我是有底线的