中国大模型语料数据联盟迎来9家新成员,开源第二批语料数据

为提升语料数据供给水平,推动大模型产业高质量发展加速应用创新与行业落地,9月8日,由中国大模型语料数据联盟(以下简称"语料数据联盟")主办的数说新语·开放日首场活动在上海人工智能实验室举行。

中国专利技术开发公司、上海仲裁委员会、上海图书馆(上海科学技术情报研究所)、上海数据交易所、上海市社会信用促进中心、上海蜜度信息技术有限公司、上海钛米机器人股份有限公司、华东师范大学出版社有限公司、上海城建城市运营(集团)有限公司9家新成员单位加入"中国大模型语料数据联盟",联盟成员将共同为大模型技术深度发展与高水平应用提供更多元的数据要素保障。

上海市经信委人工智能发展处、信息化推进处(大数据发展处)相关负责人出席指导开放日活动。

上海人工智能实验室主任助理王延峰代表主要发起单位,分享了语料数据联盟当前的发展现状与未来展望,同时介绍了OpenDataLab浦数人工智能开放数据平台及联盟发布的首批多模态预训练语料------书生·万卷1.0

上海人工智能实验室主任助理王延峰

新成员单位加入"中国大模型语料数据联盟"

继8月14日发布书生·万卷以来,语料数据联盟推出了第二批开源语料数据集------蜜巢·花粉1.0。据悉,另有多个联盟成员单位也已形成语料数据开源方案,将陆续进入发布队列。

据蜜度信息首席技术官刘益东介绍,蜜巢·花粉1.0以互联网媒体数据为主,截止目前,总量已超1亿条。该数据集目前已被应用于蜜度系列大模型训练,在政务及媒体等垂直领域提供知识问答与内容生成、分析报告自动生成、文稿内容审校与润色改写等各类智能生成式服务。

活动中,上海数据交易所市场发展部副总经理章健及澎湃新闻网CTO孙挥分别做主题演讲,分享各自在强化大模型语料数据高质量供给方面的创新实践。

未来,语料数据联盟将持续发挥好"朋友圈"作用,凝聚各方资源,发挥成员单位优势,群策群力,共同推动大模型语料数据高水平供给,为大模型发展做好数据支撑。

中国大模型语料数据联盟

**由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。**为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

下载语料数据及获取大模型语料数据联盟更多信息,请登录:https://opendatalab.com/

相关推荐
GOSIM 全球开源创新汇1 天前
科班出身+跨界双轨:陈郑豪用 AI 压缩技术,让 4K 游戏走进普通设备|Open AGI Forum
人工智能·游戏·agi
sinat_286945191 天前
AI Coding LSP
人工智能·算法·prompt·transformer
IT_陈寒1 天前
Java并发编程实战:从入门到精通的5个关键技巧,让我薪资涨了40%
前端·人工智能·后端
码上宝藏1 天前
ComfyUI新插件上线!多模态多视角生成,中文场景适配拉满——手把手教你玩转ComfyUI-qwenmultiangle
人工智能·comfyui
故乡de云1 天前
Google Cloud与AWS大数据AI服务对比:2026年企业选型指南
大数据·人工智能·aws
●VON1 天前
可信 AI 认证:从技术承诺到制度信任
人工智能·学习·安全·制造·von
AI架构师易筋1 天前
AIOps 告警归因中的提示工程:从能用到可上生产(4 阶梯)
开发语言·人工智能·llm·aiops·rag
数说星榆1811 天前
在线高清泳道图制作工具 无水印 PC
大数据·人工智能·架构·机器人·流程图
说私域1 天前
B站内容生态下的私域流量运营创新:基于AI智能名片链动2+1模式与S2B2C商城小程序的融合实践
人工智能·小程序·流量运营
特立独行的猫a1 天前
告别写作焦虑:用 n8n + AI 打造“输入即发布”的自驱动写作工作流
人工智能·工作流·n8n