中国大模型语料数据联盟迎来9家新成员,开源第二批语料数据

为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,9月8日,由中国大模型语料数据联盟(以下简称"语料数据联盟")主办的数说新语·开放日首场活动在上海人工智能实验室举行。

中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入"中国大模型语料数据联盟",联盟成员将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。

上海市经信委人工智能发展处、信息化推进处(大数据发展处)相关负责人出席指导开放日活动。

上海人工智能实验室主任助理王延峰代表主要发起单位,分享了语料数据联盟当前的发展现状与未来展望,同时介绍了OpenDataLab浦数人工智能开放数据平台及联盟发布的首批多模态预训练语料------书生·万卷1.0

上海人工智能实验室主任助理王延峰

新成员单位加入"中国大模型语料数据联盟"

继8月14日发布书生·万卷以来,语料数据联盟推出了第二批开源语料数据集------蜜巢·花粉1.0。据悉,另有多个联盟成员单位也已形成语料数据开源方案,将陆续进入发布队列。

据蜜度信息首席技术官刘益东介绍,蜜巢·花粉1.0以互联网媒体数据为主,截止目前,总量已超1亿条。该数据集目前已被应用于蜜度系列大模型训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。

活动中,上海数据交易所市场发展部副总经理章健及澎湃新闻网CTO孙挥分别做主题演讲,分享各自在强化大模型语料数据高质量供给方面的创新实践。

未来,语料数据联盟将持续发挥好"朋友圈"作用,凝聚各方资源,发挥成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为大模型发展做好数据支撑。

中国大模型语料数据联盟

**由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。**为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

下载语料数据及获取大模型语料数据联盟更多信息,请登录:https://opendatalab.com/

相关推荐
断眉的派大星3 分钟前
均值为0,方差为1:数据的“标准校服”
人工智能·机器学习·均值算法
A尘埃12 分钟前
电子厂PCB板焊点缺陷检测(卷积神经网络CNN)
人工智能·神经网络·cnn
Tadas-Gao13 分钟前
缸中之脑:大模型架构的智能幻象与演进困局
人工智能·深度学习·机器学习·架构·大模型·llm
中金快讯15 分钟前
新视野混合净值波动有几何?贝莱德基金回撤控制策略是否命中关键?
人工智能
楚兴18 分钟前
MacBook M1 安装 OpenClaw 完整指南
人工智能·后端
23遇见23 分钟前
探索CANN:开源AI计算底座的关键组件与技术思想
人工智能
jl486382129 分钟前
变比测试仪显示屏的“标杆“配置!如何兼顾30000小时寿命与六角矢量图精准显示?
人工智能·经验分享·嵌入式硬件·物联网·人机交互
2301_8187305639 分钟前
transformer(上)
人工智能·深度学习·transformer
木枷1 小时前
Online Process Reward Learning for Agentic Reinforcement Learning
人工智能·深度学习·机器学习
m0_563745111 小时前
误差卡尔曼滤波在VINS-mono中的应用
人工智能·机器学习