中国大模型语料数据联盟迎来9家新成员,开源第二批语料数据

为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,9月8日,由中国大模型语料数据联盟(以下简称"语料数据联盟")主办的数说新语·开放日首场活动在上海人工智能实验室举行。

中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入"中国大模型语料数据联盟",联盟成员将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。

上海市经信委人工智能发展处、信息化推进处(大数据发展处)相关负责人出席指导开放日活动。

上海人工智能实验室主任助理王延峰代表主要发起单位,分享了语料数据联盟当前的发展现状与未来展望,同时介绍了OpenDataLab浦数人工智能开放数据平台及联盟发布的首批多模态预训练语料------书生·万卷1.0

上海人工智能实验室主任助理王延峰

新成员单位加入"中国大模型语料数据联盟"

继8月14日发布书生·万卷以来,语料数据联盟推出了第二批开源语料数据集------蜜巢·花粉1.0。据悉,另有多个联盟成员单位也已形成语料数据开源方案,将陆续进入发布队列。

据蜜度信息首席技术官刘益东介绍,蜜巢·花粉1.0以互联网媒体数据为主,截止目前,总量已超1亿条。该数据集目前已被应用于蜜度系列大模型训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。

活动中,上海数据交易所市场发展部副总经理章健及澎湃新闻网CTO孙挥分别做主题演讲,分享各自在强化大模型语料数据高质量供给方面的创新实践。

未来,语料数据联盟将持续发挥好"朋友圈"作用,凝聚各方资源,发挥成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为大模型发展做好数据支撑。

中国大模型语料数据联盟

**由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。**为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

下载语料数据及获取大模型语料数据联盟更多信息,请登录:https://opendatalab.com/

相关推荐
量子-Alex12 分钟前
【目标检测】【PANet】Path Aggregation Network for Instance Segmentation
人工智能·目标检测·计算机视觉
lihuayong15 分钟前
计算机视觉:经典数据格式(VOC、YOLO、COCO)解析与转换(附代码)
人工智能·yolo·目标检测·计算机视觉·目标跟踪·coco·数据标注
thinkMoreAndDoMore20 分钟前
深度学习(3)-TensorFlow入门(常数张量和变量)
开发语言·人工智能·python
神舟之光21 分钟前
动手学深度学习2025.2.23-预备知识之-线性代数
人工智能·深度学习·线性代数
wapicn9933 分钟前
‌挖数据平台对接DeepSeek推出一键云端部署功能:API接口驱动金融、汽车等行业智能化升级
java·人工智能·python·金融·汽车·php
不爱学习的YY酱41 分钟前
MusicGPT的本地化部署与远程调用:让你的Windows电脑成为AI音乐工作站
人工智能·windows
kakaZhui43 分钟前
【多模态大模型】端侧语音大模型minicpm-o:手机上的 GPT-4o 级多模态大模型
人工智能·chatgpt·aigc·llama
艾思科蓝 AiScholar1 小时前
【SPIE出版,见刊快速,EI检索稳定,浙江水利水电学院主办】2025年物理学与量子计算国际学术会议(ICPQC 2025)
图像处理·人工智能·信息可视化·自然语言处理·数据分析·力扣·量子计算
liruiqiang051 小时前
机器学习 - 衡量模型的特性
人工智能·机器学习
日记成书1 小时前
详细介绍嵌入式硬件设计
嵌入式硬件·深度学习·学习