金融领域LLM开源测试集

BizFinBench

中文

金融业务场景基准数据集

结合迭代校准评估框架IteraJudge,对25个先进LLM进行全面评估,发现在金融AI领域与人类期望存在显著性能差距。

https://arxiv.org/pdf/2505.19457

https://github.com/HiThink-Research/BizFinBench/tree/main

Finance-Instruct-500k

英文

涉及50万个金融实体,涵盖问答、推理、情感新粉、主题分类、NER和对话,

https://huggingface.co/datasets/Josephgflowers/Finance-Instruct-500k

LiveBench

https://github.com/LiveBench/LiveBench.git

reference


相关推荐
前沿在线6 分钟前
2026 WRC世界机器人大会| 黑芝麻智能展台亮点
人工智能·ai·大模型
QYRdata12 分钟前
28.7%年复合增速锚定AI模型安全赛道,2026-2032年行业步入高速扩容新阶段
人工智能·安全
皮卡丘不断更13 分钟前
Vibe Coding 做完原型后:给网页项目加上任务、验证和人工确认
人工智能·软件工程
Leo.yuan20 分钟前
FineDataLink 5.0 vs Great Expectations:数据质量治理工具深度横评,国产低代码方案能否替代开源标杆?
大数据·人工智能
薛定e的猫咪20 分钟前
(arXiv 2026)GLiBRL :可学习基函数的深度贝叶斯元强化学习 ----待补充
人工智能·深度学习·学习·算法·机器学习
喜欢吃豆22 分钟前
GEO 到底怎么做?从 Prompt 研究到 AI Citation 的完整落地方法
人工智能·prompt
yingyuecom23 分钟前
映悦AI × Joverse全球发布:四大重磅更新,AI创作进入工业化时代
人工智能·gpt·chatgpt·prompt·aigc
会周易的程序员29 分钟前
软件接入大模型实现 Agent —— 从原理到 C++ 落地完全指南
c++·人工智能·物联网·架构·agent·工业协议·mcp
躺柒31 分钟前
读数据可视化13空间标量场(上)
人工智能·深度学习·信息可视化·数据可视化·空间·大数据分析
小王20434 分钟前
Day 28:目标检测入门 — 两阶段 vs 单阶段
人工智能·目标检测·计算机视觉