中国大模型语料数据联盟迎来9家新成员,开源第二批语料数据

为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,9月8日,由中国大模型语料数据联盟(以下简称"语料数据联盟")主办的数说新语·开放日首场活动在上海人工智能实验室举行。

中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入"中国大模型语料数据联盟",联盟成员将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。

上海市经信委人工智能发展处、信息化推进处(大数据发展处)相关负责人出席指导开放日活动。

上海人工智能实验室主任助理王延峰代表主要发起单位,分享了语料数据联盟当前的发展现状与未来展望,同时介绍了OpenDataLab浦数人工智能开放数据平台及联盟发布的首批多模态预训练语料------书生·万卷1.0

上海人工智能实验室主任助理王延峰

新成员单位加入"中国大模型语料数据联盟"

继8月14日发布书生·万卷以来,语料数据联盟推出了第二批开源语料数据集------蜜巢·花粉1.0。据悉,另有多个联盟成员单位也已形成语料数据开源方案,将陆续进入发布队列。

据蜜度信息首席技术官刘益东介绍,蜜巢·花粉1.0以互联网媒体数据为主,截止目前,总量已超1亿条。该数据集目前已被应用于蜜度系列大模型训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。

活动中,上海数据交易所市场发展部副总经理章健及澎湃新闻网CTO孙挥分别做主题演讲,分享各自在强化大模型语料数据高质量供给方面的创新实践。

未来,语料数据联盟将持续发挥好"朋友圈"作用,凝聚各方资源,发挥成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为大模型发展做好数据支撑。

中国大模型语料数据联盟

**由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。**为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

下载语料数据及获取大模型语料数据联盟更多信息,请登录:https://opendatalab.com/

相关推荐
笙囧同学18 分钟前
基于大数据技术的疾病预警系统:从数据预处理到机器学习的完整实践(后附下载链接)
大数据·网络·机器学习
白熊1881 小时前
【大模型LLM】梯度累积(Gradient Accumulation)原理详解
人工智能·大模型·llm
愚戏师1 小时前
机器学习(重学版)基础篇(算法与模型一)
人工智能·算法·机器学习
F_D_Z2 小时前
【PyTorch】图像多分类项目部署
人工智能·pytorch·python·深度学习·分类
音视频牛哥4 小时前
打通视频到AI的第一公里:轻量RTSP服务如何重塑边缘感知入口?
人工智能·计算机视觉·音视频·大牛直播sdk·机器视觉·轻量级rtsp服务·ai人工智能
Wendy14415 小时前
【灰度实验】——图像预处理(OpenCV)
人工智能·opencv·计算机视觉
中杯可乐多加冰5 小时前
五大低代码平台横向深度测评:smardaten 2.0领衔AI原型设计
人工智能
无线图像传输研究探索5 小时前
单兵图传终端:移动场景中的 “实时感知神经”
网络·人工智能·5g·无线图传·5g单兵图传
zzywxc7876 小时前
AI在编程、测试、数据分析等领域的前沿应用(技术报告)
人工智能·深度学习·机器学习·数据挖掘·数据分析·自动化·ai编程
铭keny7 小时前
YOLOv8 基于RTSP流目标检测
人工智能·yolo·目标检测