中国大模型语料数据联盟迎来9家新成员,开源第二批语料数据

为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,9月8日,由中国大模型语料数据联盟(以下简称"语料数据联盟")主办的数说新语·开放日首场活动在上海人工智能实验室举行。

中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入"中国大模型语料数据联盟",联盟成员将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。

上海市经信委人工智能发展处、信息化推进处(大数据发展处)相关负责人出席指导开放日活动。

上海人工智能实验室主任助理王延峰代表主要发起单位,分享了语料数据联盟当前的发展现状与未来展望,同时介绍了OpenDataLab浦数人工智能开放数据平台及联盟发布的首批多模态预训练语料------书生·万卷1.0

上海人工智能实验室主任助理王延峰

新成员单位加入"中国大模型语料数据联盟"

继8月14日发布书生·万卷以来,语料数据联盟推出了第二批开源语料数据集------蜜巢·花粉1.0。据悉,另有多个联盟成员单位也已形成语料数据开源方案,将陆续进入发布队列。

据蜜度信息首席技术官刘益东介绍,蜜巢·花粉1.0以互联网媒体数据为主,截止目前,总量已超1亿条。该数据集目前已被应用于蜜度系列大模型训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。

活动中,上海数据交易所市场发展部副总经理章健及澎湃新闻网CTO孙挥分别做主题演讲,分享各自在强化大模型语料数据高质量供给方面的创新实践。

未来,语料数据联盟将持续发挥好"朋友圈"作用,凝聚各方资源,发挥成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为大模型发展做好数据支撑。

中国大模型语料数据联盟

**由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。**为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

下载语料数据及获取大模型语料数据联盟更多信息,请登录:https://opendatalab.com/

相关推荐
新加坡内哥谈技术14 分钟前
口哨声、歌声、boing声和biotwang声:用AI识别鲸鱼叫声
人工智能·自然语言处理
wx74085132625 分钟前
小琳AI课堂:机器学习
人工智能·机器学习
FL162386312933 分钟前
[数据集][目标检测]车油口挡板开关闭合检测数据集VOC+YOLO格式138张2类别
人工智能·yolo·目标检测
YesPMP平台官方35 分钟前
AI+教育|拥抱AI智能科技,让课堂更生动高效
人工智能·科技·ai·数据分析·软件开发·教育
鸽芷咕1 小时前
【Python报错已解决】ModuleNotFoundError: No module named ‘paddle‘
开发语言·python·机器学习·bug·paddle
FL16238631291 小时前
AI健身体能测试之基于paddlehub实现引体向上计数个数统计
人工智能
黑客-雨1 小时前
构建你的AI职业生涯:从基础知识到专业实践的路线图
人工智能·产品经理·ai大模型·ai产品经理·大模型学习·大模型入门·大模型教程
子午1 小时前
动物识别系统Python+卷积神经网络算法+TensorFlow+人工智能+图像识别+计算机毕业设计项目
人工智能·python·cnn
大耳朵爱学习1 小时前
掌握Transformer之注意力为什么有效
人工智能·深度学习·自然语言处理·大模型·llm·transformer·大语言模型
TAICHIFEI1 小时前
目标检测-数据集
人工智能·目标检测·目标跟踪