金融领域LLM开源测试集

BizFinBench

中文

金融业务场景基准数据集

结合迭代校准评估框架IteraJudge,对25个先进LLM进行全面评估,发现在金融AI领域与人类期望存在显著性能差距。

https://arxiv.org/pdf/2505.19457

https://github.com/HiThink-Research/BizFinBench/tree/main

Finance-Instruct-500k

英文

涉及50万个金融实体,涵盖问答、推理、情感新粉、主题分类、NER和对话,

https://huggingface.co/datasets/Josephgflowers/Finance-Instruct-500k

LiveBench

https://github.com/LiveBench/LiveBench.git

reference


相关推荐
蓝鲨硬科技几秒前
任利锋的“造物”野心,让AI 3D进入“可制造”时代
人工智能·3d·制造
暗黑小白几秒前
Agent 运行时与 Harness:从教科书循环到生产级运行时
人工智能
烂蜻蜓4 分钟前
AI入门教程(十七):AI安全进阶——越狱、注入、对抗与防护
人工智能·ai
小K讲AI营销12 分钟前
存储定价权重构:用“产能分配“框架重估 DRAM+46%、NAND+65%
人工智能
小雨青年12 分钟前
【HarmonyOS 7开发者前瞻】10 HarmonyOS 7 真实项目适配路线图:API 26、AI / Agent 与多端改造优先级
人工智能·华为·harmonyos
半兽先生17 分钟前
大模型技术开发与应用——5.大模型Agent开发(CrewAI)
大数据·人工智能·python·机器学习·ai
aqi0019 分钟前
鸿蒙版本的小小机器人APP开放源码啦
人工智能·华为·harmonyos·鸿蒙·harmony
眼泪划过的星空20 分钟前
快速了解LangGraph:构建智能Agent工作流的核心框架
人工智能·python·langchain
极客先躯26 分钟前
高级java每日一道面试题-2026年05月11日-实战篇[Docker]-如何容器化金融产品推荐系统?
java·运维·docker·容器·金融·高级面试·金融产品推荐系统