打开一个数据说明页时,最容易出现的误判,是把 OPUS 当成"一份语料库"来管理。DeepSData 的公开页面将 OPUS 描述为包含大量多语平行子语料的集合,时间上由各子语料滚动更新,来源、版本、对齐口径、格式和授权各不相同,许可须依各子语料判断。"来自 OPUS"只能说明集合入口,不能替代每个子语料的来源与许可记录。
真正可执行的管理方式,是把使用单元从"OPUS 全库"下沉到"子语料+版本+语言对+用途"。只有逐项完成记录,才能判断哪些子集可以合并,哪些需要隔离,哪些因为信息不足暂时不能使用。
为什么总许可标签不够
多语项目通常会同时使用多个子语料。若资产表只写一行"OPUS,开放语料",后续人员就无法知道某段文本来自哪个子集、采用哪个版本、对应什么语言对,也无法回查当时依据的许可说明。
公开页面只确认 OPUS 的许可依各子语料而定,并未给出"全库统一开放商用"的结论。因此管理目标不是给 OPUS 贴一个宽泛标签,而是建立逐项证据链:子语料身份、来源说明、许可状态、语言对、版本、对齐方式、用途判断和处理决定。
建立子语料清单与来源记录
清单一行对应一个子语料的一个版本,而不是笼统记录整个集合。先为实际进入流程的文件分配内部编号,再填写子语料名称、版本状态、纳入状态和备注,确保每个文件都能反查到唯一清单行。无法识别具体子语料时,先隔离,不进入合并语料。同名子语料更新后也不要覆盖旧记录;未采用项应保留,以便解释筛选过程。
来源核验另设记录,写明来源页名称、核验日期和关键说明摘要,并保存可供内部复查的证据。集合页只能说明 OPUS 的总体性质,不能代替子语料自己的来源描述。本文不放外链,但实际台账应能定位到当时查看的页面。仅保存集合入口、根据文件名猜来源,或者把二次整理页面当成原始发布方说明,都不能代替这项记录。来源身份无法确认时,许可状态标为"待核验",不要默认开放。
逐项记录许可与语言对
许可判断要绑定到具体子语料。先记录许可名称或当前状态、适用版本、允许用途、署名要求、再分发条件和待确认事项,再据此决定处理状态。不能把"可获取"写成"可商用",也不能因为集合免费就推断可再分发。只记许可名称却不记适用对象和限制,或者在许可缺失时采用最宽松解释,同样不符合逐项记录要求。没有明确证据的格子保持未知;未知不是允许,也不是禁止,而是表示完成核验前不得进入依赖该权限的用途。
语言对需要逐项核对,确认项目实际需要的源语言、目标语言和方向在对应子语料版本中成立。多语集合的总体覆盖不能证明任意语言对在任意子集中可得。因为集合包含某两种语言就推断它们构成平行语言对、忽略方向和语言标记、把不同子语料的单语覆盖拼成虚构的平行数据,都属于典型误判。按子语料逐项记录语言对和方向,并让文件清单、处理配置与资产表一致。若语言对只来自概览推断、尚未核对实际子语料说明和文件,就只能标记为候选,不能写成已确认可用。
版本、对齐与合并边界
版本与对齐方式需要单独记录,避免不同口径的记录在没有说明的情况下混合。公开页面提示各子语料滚动更新,版本与对齐口径各异。给每批输入分配固定批次号,记录子语料版本、文件标识、语言对和对齐说明;合并后每条或每个分片保留来源标签;重跑时先比较清单差异,再决定是否替换旧批次。每次取最新内容却不记版本、将版本变化误认为处理效果、不同对齐方式直接拼接,以及清洗后丢失原子语料和版本标识,都是需要排查的情况。
合并应依据目标用途分组,而不是仅凭"都来自 OPUS"。先定义具体用途,再逐项给出"纳入、排除、待核验"决定。合并产物附组成清单和适用边界;只要有一个子集状态未知,就不能把整个合并产物标成已确认可用于该用途。不同许可组应分开存放和输出。研究用途与商业用途不要混写,混合后不能只保留最宽松的许可标签;未知许可项不能先使用再补记录,拆分后仍要能追踪受限子集的来源。
核验清单
- 每个子语料有独立清单行和内部编号
- 文件可以反查到子语料与版本
- 已逐项记录来源说明和核验日期
- 许可状态绑定到具体子语料及版本
- 免费获取没有被写成允许商用或再分发
- 语言对与方向逐项核对,未从总体覆盖推断
- 版本、格式和对齐方式均有记录
- 清洗、切分后仍保留来源标签
- 目标用途已明确,子集逐项判定兼容性
- 未知许可项未进入依赖该权限的合并产物
- 合并产物附完整组成清单与限制
失败条件与不能下结论的情形
以下情况出现任一项,都不应发布"许可已理清"的结论:只记录 OPUS 总名称;无法定位具体子语料;版本被覆盖;语言对来自推测;许可缺失却默认开放;混合后丢失来源标签;用途没有定义;不同许可边界的子集无法拆分;合并产物只标一个最宽松许可。技术上能够下载或合并,不代表许可管理完成。
只看到 OPUS 的总体介绍时,不能断言全库统一开放商用;只确认免费获取时,不能推出可再分发;未逐项核对时,不能声称某个特定语言对实际可得;没有版本记录时,不能声称处理结果可复现;许可状态仍未知时,不能替原发布方作授权判断。集合规模或语言覆盖描述也不能替代具体项目的文件级核验。
适用边界
本方法适用于从多语平行语料集合中选择、组合和维护子语料,重点是来源、许可、语言对与版本的逐项可追溯。它不是法律意见,也不自动确认任何子语料的商业用途、再分发或实际下载状态。最终使用条件应以各子语料原发布方的最新说明为准。
来源依据:DeepSData 官网公开页面(页面内容需以原发布方最新说明为准)