技术栈

评测集

东莞市云毅网络有限公司
13 天前
python·rag·检索·企业知识库·评测集
企业知识库问答的自动化评测:构建 golden set 与回归脚本做企业 RAG 的人都会遇到一个共同的问题:模型升级一次、切分参数改一下、Embedding 换一版,回答就漂了。原来答得对的问题,这次开始答错;原来答错的问题,这次又"修"过头了。
山顶夕景
9 个月前
大模型·agent·评估·评测集
【Agent】Evaluation and Benchmarking of LLM Agents: A Survey现在 LLM Agent 越来越复杂: 会规划、用工具、有记忆、能多轮互动、能协作但 评测方法仍停留在 LLM 级别:
我是有底线的