今晚 20:00,直播《LawBench:评测大语言模型的司法知识》

大语言模型在各个方面都展现出了其强大的能力。然而,当将它们应用于高度专业化、安全关键的司法领域时,它们究竟掌握了多少法律知识以及它们是否能可靠地执行法律相关任务我们却不得而知。

今晚 20:00点,OpenMMlab 视频号《社区开放麦》,我们邀请到宁波东方理工大学(暂名)信息学部助理教授、博士生导师,德国马克斯普朗克计算机研究所博士沈晓宇老师为大家介绍司法知识的综合评估基准 LawBench 。LawBench 包含三个关键维度,涵盖 20 个子测评项,横跨单选、多选、回归、抽取和生成等五大类司法任务。与目前一些数据集仅测试模型在数据集上的选择能力不同,这一评测数据集更全面地反映了大型语言模型在真实法律任务中的表现能力

快去 B 站预约吧 OpenMMLab的动态 - 哔哩哔哩 (bilibili.com)

为了方便大家交流沟通,我们建立了语言大模型相关的交流群,大佬也在群里哦,提供与大佬 1v1 的机会,扫码即可入群~

相关推荐
今天AI了吗1 分钟前
AI辅助数据库工具链对比:从SQL优化到架构设计的主流方案评估
数据库·人工智能·sql
3A Cloud4 分钟前
使用 iThinkAir 将“摄影级人像生图”Skill 开发成应用
图像处理·人工智能
AI英德西牛仔6 分钟前
手机文心怎么导出文档?AI 导出鸭一键解决格式崩塌与批量归档难题
人工智能·智能手机·excel·deepseek·ai导出鸭
invicinble6 分钟前
设计b端系统实际思路
人工智能
p***76987 分钟前
Open Minis – 免费开源本地运行 AI Agent 智能助手|实现手机电脑运行的开源 AI Agent 平台
人工智能·智能手机·开源
品牌测评7 分钟前
AI算力平台推荐分享:2026年算力消费透明化观察
人工智能
鬼手点金10 分钟前
FreeLLMAPI 介绍
llm·github·nvidia·apikey·freellmapi·agnes ai·日日新
lifallen12 分钟前
edit-article:AI 味来自跳级
人工智能·学习·ai·ai编程·ai写作
陈童学哦14 分钟前
AI编码大战升级:Meta Muse Code入局,Trae、Claude Code压力拉满
人工智能
Seven9715 分钟前
AI杂谈:面试AI Coding,我只看你是不是驾驶员
人工智能