技术栈
llm-as-judge
llwszx
5 天前
java
·
后端
·
golang
·
状态机
·
pydantic
·
agnet
·
llm-as-judge
【Java/Go后端手撸原生Agent(第五篇):多工具并行调用 + BashTool执行引擎 + Judge证据链升级】
“我”:Java/Go后端开发者、有点时间想自己琢磨,想入门Agent但不想堆砌框架、希望理解底层原理的研发 上一篇链接:Java/Go后端手撸原生Agent(第四篇)
minhuan
13 天前
人工智能
·
大模型应用
·
llm-as-judge
·
ai agent量化评估
·
智能体多维评测
AI Agent量化评估:LLM-as-Judge、人工标注、A/B测试全解,智能体多维评测实践21.0
做过AI Agent开发的朋友应该都有同感,现在搭一个能用的Agent真的太简单了。不管是调用开源模型、拼接Prompt,还是接入各类工具插件,半天就能跑出一个能对话、能执行简单任务的智能体Demo。但真正落地做项目、上线迭代后,大家都会遇到同一个棘手问题:Agent到底算做得好不好?该往哪个方向优化?改完Prompt、调整完逻辑后,是真的变强了,只是运气波动,甚至越改越差?
大鹅同志
21 天前
ai
·
langchain
·
agent
·
rag
·
langgraph
·
vibecoding
·
llm-as-judge
Agent Runtime Evaluation Platform — AI Agent 运行时全维度质量评估平台
📦 GitHub: https://github.com/daetz-coder/Agent-Runtime-Evaluation-Platform
我是有底线的