注:本文为 "中文信息处理" 相关合辑。
图片清晰度受引文原图所限。
略作重排,如有内容异常,请看原文。
字形的"号制""点制"与"米制"
张小衡
(香港理工大学中文及双语学系,香港九龙)
E-mail: ctxzhang@polyu.edu.hk
摘要
号制和点制是计算机文字处理中表示字形尺寸的最常用标准。论文简单叙述这两种标准的历史和现状,给出一个含 Word 2003 所有字号的"号 - 点 - 毫米"对照表,并介绍对照表数据的实验获取方法和多种用途。最后,在深入分析讨论号制和点制的种种缺陷的基础上提出字形度量全球统一使用米制的构想。
关键词 字形尺寸;号制;点制;米制
文章编号 1002 - 8331 - (2006)10 - 0175 - 03
文献标识码 A
中图分类号 TP311
The Number, Point and Metric Systems of Font Size
Zhang Xiaoheng
(Dept. of Chinese and Bilingual Studies, Hong Kong Polytechnic University, Hong Kong)
Abstract
The point system and number system are the most commonly-used standards for font size measurement in China and the world. In this paper a brief introduction to the history and technical contents of both systems is given. Then a font size "number - point - millimeter" cross reference table with first-hand data from experiment is presented, followed by a description of some important applications of the table. Finally a unified metric system for font measurement is proposed, based on an in-depth discussion on the deficiencies of the point and number systems.
Keywords
font size; number system; point system; metric system
1 前言
在计算机上,英文字形的尺寸大小(font size)常常以"点"(point)为度量单位来表示,而中文字形大小则常用"号"来说明。有时我们也用"号"来说明英文字形,用"点"来说明中文字形。因此,了解和研究号制和点制这两套字形度量标准及其相互关系对于语言文字的应用和计算机信息处理都具有重要的意义。这方面的知识有时甚至是必不可少的。例如,笔者前不久收到某论文集的入编通知,其中对于文章的排版格式做出这样的要求:"论文用 Word 编排,正文为中文宋体,字号 5 号⋯⋯。文章内的图表、参考文献、作者简介要用 6 号宋体⋯⋯。题目必须居中,用小 2 号宋体加粗,作者名字写在题目下面且居中,用 4 号楷体,⋯⋯。"虽然我使用的英文版 Windows XP 和 Word 2003 提供所需的各种中文字体,但在字形大小方面只有点制可用,没有字号的选项。要在这种"点"的计算机环境中满足"号"的版面要求,就必须弄清字号和字点之间的对应关系。
关于字形号制和点制的讨论,我们在"中国期刊全文数据库"上仅检索到两篇学术论文1,2。由于写作时间较早,文章中有关 Word 97 等软件的内容现在看来显得过于陈旧,另一个美中不足的地方是许多重要数据的来源没有明确交待。本文以在"Windows XP + Word 2003"语言信息处理环境中获取的第一手实验数据为依据,较为全面深入地讨论字形号制和点制的关系、应用和发展等问题。
2 字号和字点简介
国际上,字形大小一般用"点"来度量;在中国内地,字形大小常用字"号"来表示。中文简体字版 Windows XP 和 Word 2003 既提供点制服务又提供号制服务。
2.1 字形的点制度量标准
"点制"是英文"point system"的译文,这里的"point"(简称 pt 或 p)在汉语中除了意译为"点"之外,还有音译为"磅"的。在西方印刷工业发展的初期,社会上使用的英尺英寸度量体制未能提供足够精确的度量单位来满足字形排版的需要,因此,1737 年法国巴黎的印刷字模铸造家 Pierre Fournier 发明了点制度量法,他的一个单位点相当于现在的 0.349 mm(毫米)。大约 40 年以后,巴黎的另一个字模铸造家 Francois Ambroise Didot 向社会推介他的改良版点制度量法,Didot 的一个点单位长度是 0.3759 mm。美国和英国则分别于 1886 和 1898 年决定以单位长度相当于 0.3515 mm(约 1 / 72 英寸)的点作为国内统一的字形度量标准3。这个标准一直延用至今,而且由于英美在世界政治经济和科技上的影响,尤其是其科技产品(如 MS Windows 和 MS Word 等)的作用,已经成为国际上最为通用的字形尺寸标准。下文所说的点制,如无特别说明,则是指英美点制。
字形大小为多少点,指的是该字形的满格字符高度有多长。在 MS Word 2003 上可用的字形点值是 1 ~ 1638 之间可以被 0.5 整除的所有数字,即集合 { 1 , 1.5 , 2 , 2.5 , ⋯ , 1637 , 1637.5 , 1638 } \{1, 1.5, 2, 2.5, \cdots, 1637, 1637.5, 1638\} {1,1.5,2,2.5,⋯,1637,1637.5,1638} 中的任一元素(这些规定可以直接在 Word 2003 上得到验证)。可见点制度量范围之广,取值之密。
2.2 字形的号制度量标准
根据中国国家标准 GB/T12200.2 - 944第 4.1.2.9 节,字号就是"印刷体依据字体大小所编的号"。从历史上看,字号是印刷行业为统一字模规格而人为规定的尺寸标准。活字排版印刷技术发明以后,汉字大小的度量方法长期没有统一,直到 1858 年,美国人 William Gamble 根据当时美国铅字的尺寸为汉字制定了七种尺寸规格,即 1 至 7 号。后来人们又根据需要增加了一些新号,逐步发展成现在的字号体系5。
中文简体字版 Windows XP 和 Word 2003 提供的字号选项由小到大是:八号、七号、小六号、六号、小五号、五号、小四号、四号、小三号、三号、小二号、二号、小一号、一号、小初号、初号。其中最小的八号字形高度约 1.76 mm,最大的初号字形高度约 14.76 mm(将在第三节说明)。方正电子排版系统还设有比初号更大的小特号(14.794 mm)、特号(16.917 mm)和特大号(19.726 mm)6。
顺便说明,"点制"和"号制"有人称之为"点数制"和"号数制",本文不采用后种说法是出于以下几方面的考虑:
(1) 字号系统中的"特号"、"初号"、"小一号"、"小二号"等都不是严格的数量表达式;
(2) 就是严格按数量计算的"米制"、"尺制"等人们也很少称之为"米数制"、"尺数制"等;
(3) 点制的英语原文"The point system(of measurement)"并没有"数"的含义;
(4) 在语言表达上,"点制"和"号制"比"点数制"和"号数制"简练些。
3 号 - 点对照表及其制作方法
字形号 - 点对应关系的主要内容在于说明每种字号相当于多少点的尺寸。由于号制和点制之间不存在换算公式(这一点将在第 5 节说明),所以我们只好采用对照表的方法。
3.1 号 - 点对照表
表 1 是笔者用一手实验数据建立起来的"号 - 点 - 毫米"对照表。
表1 字形大小"号 - 点 - 毫米"对照表
| 字号 | 点数 / pt | 毫米 / mm |
|---|---|---|
| 八号 | 5 | 1.76 |
| 七号 | 5.5 | 1.93 |
| 小六号 | 6.5 | 2.28 |
| 六号 | 7.5 | 2.64 |
| 小五号 | 9 | 3.16 |
| 五号 | 10.5 | 3.69 |
| 小四号 | 12 | 4.22 |
| 四号 | 14 | 4.92 |
| 小三号 | 15 | 5.27 |
| 三号 | 16 | 5.62 |
| 小二号 | 18 | 6.33 |
| 二号 | 22 | 7.73 |
| 小一号 | 24 | 8.44 |
| 一号 | 26 | 9.14 |
| 小初 | 36 | 12.65 |
| 初号 | 42 | 14.76 |
表中涵括了中文简体字版 Windows XP 和 Word 2003 上的所有字号,每种字号都附有相应的点(pt)数和毫米(mm)数,而且三项数据都以该尺寸排版。例如,从表中我们可以看到五号字的尺寸相当于 10.5 pt 或 3.69 mm。而且"五号"、"10.5"和"3.69"这组数据就是用它们自身所表示的字形尺寸排版的。有了这个号 - 点转换表,要在各种非中文简体字版 Windows 上的点制字形环境中实现用字号说明的版面要求就显得轻而易举了。
3.2 号 - 点对照表的制作方法
上述"号 - 点 - 毫米"对照表的基本数据不是从其它文献抄拼而成的二手材料,而是笔者亲自在 Windows XP 和 Word 2003 上通过简单可靠的实验直接获取的,步骤如下:
(1) 在支持字号的中文简体字版"Window XP + Word 2003"环境中列出"八号、七号、小六号、六号、小五号、五号、⋯"等 Word 提供的所有字号名称,而且每个名称都用它自身所表示的尺寸规格设定字形大小,由此得出对照表中的第一列内容。然后将结果存为一个 Word 文件。
(2) 将步骤(1)所产生的文件拿到不支持字号的英文版 Window XP + Word 2003 环境中打开。用鼠标点击每一个字号名称,Word 工具列上的"Font Size"文字框中就会显示它们各自的字形点数。将这些数据写入对照表中的第二列,并用相应的尺寸设定字形大小。
(3) 按 1 pt = 0.3514598 mm 1\ \text{pt} = 0.3514598\ \text{mm} 1 pt=0.3514598 mm 的精确转换公式(见下文第 5 节中的说明)计算出第三列的数据,并设定相应的字形大小。
最后再回到中文简体字版"Window XP + Word 2003"环境中核对数据。
4 号 - 点对照表的用途
号 - 点对照表的作用是多方面的。首先,该表提供较全面的"号 - 点 - 毫米"字形大小对应数据,并显示各种规格的印刷效果,有助于人们了解字形大小的不同描述体系以及它们之间的关系,有利于国际信息交流和学术合作。
在无字号选项的计算机环境中,号 - 点对照表可帮助用户实现用字号说明的排版格式。例如,由于采用 Unicode,MS Word 2003 的英文版、简体字中文版(内地)和繁体字中文版(台湾)都能处理包括中英文在内的多语字符集,此外,它们也都提供点制的字形度量服务,然而,字号选项却只有简体字中文版的 Word 提供。因此,如果要在 Word 2003 的英文版或繁体字中文版上从事涉及"字号"的格式排版,就可通过对照表将字号转换为点数来处理。
在有字号表示的排版环境中,号 - 点对照表可用于在相邻字号间"微调"字形大小。假如我们需要比小四号大,比四号小的字形。这在纯字号的环境中是无法满足的。但由于支持字号的计算机排版环境一般都同时支持点制,我们可以利用号点对照表来实现这种"微调"。从表中查得小四号相当于 12 pt,四号相当于 14 pt。在 Word 上,12 pt 和 14 pt 之间还有 12.5 pt、13 pt 和 13.5 pt 三个数值可供选用。
为了进一步方便在无字号服务的环境中处理字号排版要求,可考虑给 Windows XP 和 Office 2003 附加安装多语用户接口(Multilingual User Interface)软件,这样可提供简体中文用户界面,并在字形大小选项中加入各种字号,结果就可以像使用简体字版 Word 一样来处理字号排版问题。但是这种方法也有缺点,就是多语用户界面软件需要额外购买,另外安装。如果电脑不是自己的,就是买了软件,恐怕也不能随便安装。另一种方法不需额外装软件,而是在 Word 上根据对照表提供的数据为每种字号建立以该字号命名的新"样式(Style)"。假设要在英文版 Word 2003 的环境中建立宋体五号的样式,先在对照表中查得五号字形相当于 10.5 pt,然后选择工具菜单 Format → Style and Formatting → New Style,就可以在"新样式"对话框里建立名称为"宋体五号",字体为"宋体",大小为"10.5 pt"的字形样式供日后直接选用。如需要另一种字体的五号尺寸,可为其另建一个字样,也可先用已有的宋体五号处理后再将字形改为所需字体(大小不变)。
除 Word 之外,号 - 点对照表对于 PowerPoint、Excel 和 WWW 等其它计算机环境也照样有用。这里就不赘述了。
5 关于号制和点制的思考
号制和点制都有不尽如人意的地方。号制只限于表示字形大小,应用面比较窄。而且,从八号到初号总共只有 16 个选项可用,对于当今的科技信息时代来说实在是太少了。这个问题不是单靠增加新字号就可以解决的,原因在于号制的另一个缺陷:字号之间除了粗略的大小关系之外,并无规律可循。例如,我们知道五号字形比四号小,但是五号所表示的尺寸长度却难以从四号或其他号码的尺寸计算出来(注:尽管字号可以分为五个系列,但无整体规律6)。这种情况可以从表 2 得到证实。
表2 相邻字号的长度差和长度比
| 字号 | 尺寸 / mm | 长度差 / mm | 长度比 |
|---|---|---|---|
| 八号 | 1.76 | 0.17 | 1.10 |
| 七号 | 1.93 | 0.35 | 1.18 |
| 小六号 | 2.28 | 0.36 | 1.16 |
| 六号 | 2.64 | 0.52 | 1.20 |
| 小五号 | 3.16 | 0.53 | 1.17 |
| 五号 | 3.69 | 0.53 | 1.14 |
| 小四号 | 4.22 | 0.70 | 1.17 |
| 四号 | 4.92 | 0.35 | 1.07 |
| 小三号 | 5.27 | 0.35 | 1.07 |
| 三号 | 5.62 | 0.71 | 1.13 |
| 小二号 | 6.33 | 1.40 | 1.22 |
| 二号 | 7.73 | 0.71 | 1.09 |
| 小一号 | 8.44 | 0.70 | 1.08 |
| 一号 | 9.14 | 3.51 | 1.38 |
| 小初号 | 12.65 | 2.11 | 1.17 |
| 初号 | 14.76 | --- | --- |
表中的第一、二列分别给出各种字号名称和相应的毫米尺寸。第三列表示相邻两号的长度差(mm)。对应于某一个字号的长度差表示该字号与下一字号的尺寸差值。例如对应于八号字的长度差 0.17 mm,表示该字号的尺寸长度与下一字号(七号)相差 1.93 mm − 1.76 mm = 0.17 mm 1.93\ \text{mm} - 1.76\ \text{mm} = 0.17\ \text{mm} 1.93 mm−1.76 mm=0.17 mm。第四列给出相邻字号的长度比。对应于某一个字号的长度比表示下面一行的字号与该字号的长度之比,例如第一行数据中的长度比 1.10 是七号的毫米数除八号的毫米数之商,即 1.93 / 1.76 = 1.10 1.93 / 1.76 = 1.10 1.93/1.76=1.10。
表中第三列的数据显示,号制中各相邻两个字号之间的尺寸距离不恒等,而且变化也无规律。例如,小五号和五号相差 0.53 mm,五号和小四号也相差 0.53 mm,但小四号和四号的差值上升到 0.70 mm,而四号和小三号的差值又下降到 0.35 mm。第四列长度比数值的变化也是无规则可循的。

图 1 以折线的形式描述字号之间的尺寸关系,显然这是一条无规则变化的曲线。因此,在字号和毫米之间不存在一个转换函数。字号内部及号 - 点之间也没有统一的转换公式。
令问题更加复杂的是,除了微软的号制外,社会上还使用着与其不一致的其他号制版本。例如,北大方正的一号字就定为 9.657 mm6,不同于微软 Word 一号字的 9.14 mm。号制的种种缺陷使得有些学者甚至建议电子排版采用点制而不用号制1。
然而点制也并不完美。同"字号"一样,点也是为满足印刷排版的需要而建立起来的新度量体系。对于人们的认知活动来说,多一套体系意味着多一份负担。由于点是排版专用的度量单位,一点所代表的长度必须换算为人们所熟悉的一般度量单位才易于被理解。令人遗憾的是,较精确的转换因数相当冗长。一般教科书常将作为字形度量单位的一个点解释为"大约相当于 1 / 72 英寸的高度"7。较为精确的数据是" 1 pt = 0.35146 mm 1\ \text{pt} = 0.35146\ \text{mm} 1 pt=0.35146 mm"。更准确的换算公式有 1 pt = 0.3514598 mm 1\ \text{pt} = 0.3514598\ \text{mm} 1 pt=0.3514598 mm,约等于 1 / 72.272 1 / 72.272 1/72.272 英寸8和 1 pt = 0.996264 / 72 1\ \text{pt} = 0.996264 / 72 1 pt=0.996264/72 英寸9等等。如此种种,显然是不便掌握的。
点制的另一个缺点是,尽管上面介绍的英美点制影响最大,但它不是唯一的点制标准,欧洲还使用着法国的 Didot 点: 1 pt = 0.3759 mm 1\ \text{pt} = 0.3759\ \text{mm} 1 pt=0.3759 mm。此外,还有 TeX 标准的 1 pt = 0.3514598035 mm 1\ \text{pt} = 0.3514598035\ \text{mm} 1 pt=0.3514598035 mm、Postscript 的 1 pt = 0.3527777778 mm 1\ \text{pt} = 0.3527777778\ \text{mm} 1 pt=0.3527777778 mm 和 L'Imprimerie nationale 的 1 pt = 0.4 mm 1\ \text{pt} = 0.4\ \text{mm} 1 pt=0.4 mm3。这种多点制并存的现象也是不利于应用的。
号制和点制的种种缺点不能归咎于他们的设计者,如果考虑到早期铅字印刷时代的科技水平和社会需要,就应该说这两类字形度量标准在当时还是很完善的。例如,在使用传统字模的时代,最小的印刷体汉字是 7 号,因为再小就没法刻制字模了,就是能刻出来,也难以把字印清楚。而且,增加字号意味着需要更多铸字材料和更复杂的印刷设备。然而,现在是科技高度发达的计算机信息时代,我们完全有条件而且有必要考虑字形度量体制的进一步改善,以便更好地服务于社会。
笔者建议以毫米(mm)为基本单位来统一字形度量标准。技术实现上,精确度一般可定为 0.1 mm,并将常用 mm 字形规格列为选项,其余的由用户根据需要来填写,类似目前 Word 点制的处理方法。这样,既能克服点制和号制的种种缺陷,又能保留他们原来的好处,大大简化字形处理。我们还可以进一步将排版印刷中使用的英制等其他各种尺寸说明都统一到米制上来。例如,把排版说明"论文中的中文摘要用宋体五号,英文摘要用 Times New Roman 9 点,版心尺寸 6.5 * 9.5 英寸,文章内的图表宽度不超过 12 cm。"统一用米制表达成"论文中的中文摘要用 3.7 mm 宋体字形,英文摘要用 3.2 mm Times New Roman 字形,版心尺寸 165 mm * 240 mm,文章内的图表宽度不超过 120 mm。"这样显然简便多了。米制是全球通用的国际标准,是中国的法定计量体制,在欧洲和日本已经有人在排版中用米制代替点制8。看来米制统一点制和号制乃至所有长度度量标准将成为大势所趋。
6 结论
号制和点制是中文和英文字形尺寸的最常用度量方法。本文介绍了这两种方法的历史和现状,给出了一个由一手实验数据建立起来的"号 - 点 - 毫米"对照表,并介绍了对照表的用途。为了方便读者和有关专家检查数据的可靠性,文章还交待了实验的方法。最后,我们分析讨论了号制和点制的种种缺陷,并提出文字排版全球统一使用米制度量标准的初步设想,为语言文字现代化建设提供参考。
(收稿日期:2005 年 9 月)
参考文献
- 朱永和. 排字的点数制与号数制探讨J. 编辑学报,1999;11(2):69 ~ 71
- 刘岱伟,潘宝骏,阙少聪. 科技书刊中英文字体字号的编辑处理J. 编辑学报,2001;13(1):23 ~ 24
- McLean R. The Thames and Hudson Manual of TypographyM. London: Thames and Hudson Ltd, 1980
- 国家技术监督局. GB/T12200.2 - 94 汉语信息处理词汇 02 部分:汉语和汉字M. 北京:中国标准出版社,1994
- 翟铭,杨新岚. 当代排版技术概论M. 北京:印刷工业出版社,1994
- 楠天健. 电子排版技术M. 北京:清华大学出版社,1995
- Shelly G B, Cashman T J, Vermaat M E. Discovering Computers 2004: A Gateway to InformationM. Boston: Course Technology, 2003
- Vakulenko A. Difference between point systemsEB/OL. http://www.oberonplace.com/dtp/fonts/point.htm, 2000
- Clair K. A Typographic Workbook: A Premier to History, Techniques, and ArtistryM. New York: John Wiley & Sons, Inc, 1999
汉字三码演进脉络与现存问题探析
王 迈
【提要】
内码、外码与形码是计算机表达汉字的三个接口。汉字是词符词素文字,具有字形复杂、区别度高、语义相关等特征。汉字的信息熵达到 9.65 bit 9.65\ \text{bit} 9.65 bit,较印欧系音素文字的 4 bit 4\ \text{bit} 4 bit 高出约 32 32 32 倍,两者可以类比为不同数制的信息熵差异。依据香农信道编码定理,高熵值大集合的汉字需要双字节以上的编码空间。UCS 将多语种文字归入单一字符集,但未能在编码地图中反映字形、字义及历史文化的跨语种关联,而国际汉字单位的构想有助于实现体系化的编码布局。
【关键词】
汉字 信息熵 语素文字 字符编码
DOI:10.14014/j.cnki.cn11-2597/g2.2025.09.039
字符是文字和符号的总称,由一组字符组成的集合称为字符集,如汉字字符集、拉丁字符集、数学字符集等。诺依曼计算机是二进制的机器,字符须改写成二进制码的形式,才能为计算机记忆和处理,这是字符编码的实质。
为了表达一个字符,计算机应该提供三方面的信息:其一是能够唯一鉴别字符身份的内码,也称机器码,它是计算机和字符的底层接口;其二是人们向计算机查询或选取字符所需的外码,也称录入码,它是字符与使用者的接口;其三是计算机表达字符视觉信息的形码,也称字形码,它是人眼与计算机显示设备的接口。
汉字是迄今世界上唯一仍在使用且没有断层的语素文字,它所对应的语言单位达到了概念级别,具有字形复杂、高信息熵、语义直接相关等特点,这使得汉字实现计算机存储、录入和输出相较于音素文字走过了更加曲折的历程。我们将结合汉字与计算机原理回顾这一历程,分析汉字三码的演进规律,并探讨当下仍未解决的一些问题。本文涉及的是汉字内码部分,外码与形码将另文探讨。
一、字符内码编码原则及基本编码方案
字符编码需要遵循两个原则:
- 香农信道编码定理。即每个字符获得的二进制码长不能小于该字符的信息熵。
- 唯一性原则。即在一个确定的编码空间内,每一个二进制码字获得的字符解释必须唯一。
这两个原则保证了一个字符能够获得计算机充足并且专一的支持。
此外,好的编码方案还应具备如下特点:
- 系统性。编码地图能够反映文字系统的构成,其布局有规可循,具有模块化特征。
- 前向兼容性。保证历史文档的可持续利用。
- 后向可扩展性。为字符集的扩充预留空间。
- 灵活性。在同一编码方案下,可以实现灵活多样的转换格式,以适应不同场景的需求(详见后文 Unicode 下的 UTF8、UTF16 等)。
- 稳健性。也称鲁棒性,当传输错误、数据损坏等极端情况发生时,字符集能够把影响限制在较小的范围,减少对系统整体的破坏。
由于人类语言文字的复杂多样,加之早期计算机存储能力相对薄弱,以及各国机构的各自为政,文字编码的发展并非一帆风顺。
1967 1967 1967 年,美国国家标准学会(ANSI)发布了信息互换标准代码(ASCII),后被国际标准化组织(ISO)定为国际标准 ISO. 646 646 646。ASCII 是针对英语国家的单字节编码方案,也是后续各类文字编码方案的源头,它使用 7 7 7 位二进制数表示一个字符,包括字母、数字、标点、图形、控制符共计 128 128 128 个,字节最高位保留为奇偶校验位。例如,单词 Cat 的 ASCII 码为 0x43 0x61 0x74 \text{0x43}\ \text{0x61}\ \text{0x74} 0x43 0x61 0x74。
ASCII 可以满足英语国家的需要,但是其他使用拉丁字母的语言多包含一些变音符号,如德语的 ä、ö、ü,法语的 à、é、ï 等,另有西里尔、希腊、阿拉伯,希伯来等差异更大的音素文字,ASCII 都未包含在内。由此 ISO 与国际电工协会(IEC)联合制定了 ISO /IEC. 8859 8859 8859 系列标准,利用 ASCII 高位预留的 128 128 128 个字符空间作为补充,组织了共计 15 15 15 个语种的音素文字地图,这是 ASCII 的一次重要扩容,却并未涉及汉字等大字符集的解决方案。
二、汉字的信息熵与双字节编码
汉字在信息处理领域的独特性需要引入熵的概念才能准确界定。熵(Entropy)原是热力学术语,用以度量系统微观粒子的无序程度,自香农(Shannon, 1951 1951 1951)将其引入信息论以来,熵逐渐成为信息量大小的量度。假设一个 32 32 32 人的班级选举班长,在每个人当选概率相同的前提下,可以认为选举结果消除了 32 32 32 种存在的可能性,那么选举结果的信息量便是 log 2 32 = 5 bit \log_{2} 32 = 5\ \text{bit} log232=5 bit。同样,如果在 8 8 8 人小组中选举组长,选举结果只能消除 8 8 8 种可能性,这时的信息量就只有 log 2 8 = 3 bit \log_{2} 8 = 3\ \text{bit} log28=3 bit。我们使用语言文字表达思想,每一个语言文字单位的出现,都会降低表述内容的不确定性,就如同选举结果一样具有信息量价值。借助信息熵工具,我们可以对语言文字单位的信息量进行精确测量。
表 1 汉字与音素文字的信息熵
| 语种 | 汉语 | 俄语 | 德语 | 英语 | 西班牙语 | 意大利语 | 法语 |
|---|---|---|---|---|---|---|---|
| 文字的熵( bit \text{bit} bit) | 9.65 9.65 9.65 | 4.35 4.35 4.35 | 4.10 4.10 4.10 | 4.03 4.03 4.03 | 4.01 4.01 4.01 | 4.00 4.00 4.00 | 3.98 3.98 3.98 |
汉字是高信息熵的文字,单个字符包含的语义信息量达到了概念层级。冯志伟( 1994 1994 1994)使用容量极限法测得汉字熵值约为 9.65 bit 9.65\ \text{bit} 9.65 bit,而印欧系诸文字的熵值只有 4 bit 4\ \text{bit} 4 bit 左右,两者的信息差达到了惊人的 2 5 ≈ 32 2^{5} \approx 32 25≈32 倍。从文字类型学的角度分析,汉字属于语素文字,其表达的语言单位是音义结合的语素(中古及上古时期表达的则是词符),其指称的对象达到了概念级别,如"山""水""躬""耕";而印欧系诸文字属于音素文字,其对应的语言单位是音素,音素只表示一个发音动作(元辅音等),不与语义直接相关。因而,我们的直观感受是,一个汉字足以表达一个概念,而拉丁字符集通常需要多个字母的组合才能达到概念层级。
以概念"火"为例,汉语需要一个汉字表达,英语则需要"fire"四个字母组合起来加以表达。我们可以将其类比为十进制与二进制的差异:数量" 9 9 9"用十进制表达只需要一位,而用二进制表达却需要" 1001 1001 1001"四位。概括地说,十进制相对于二进制的特点是:每一位的区别度高、信息量大(有 0 0 0-- 9 9 9 十种变化);总体占用的位数少。这同样是汉字之于拉丁母的特点,也即语素文字之于音素文字的特点。
根据香农信道编码定理(Shannon's Channel Coding Theorem),一个汉字的码长不应小于它的信息熵 9.65 bit 9.65\ \text{bit} 9.65 bit,但这是未计算冗余信息的理想状态,实际应用需要更大的空间。计算机通常以 8 8 8 个二进制位(Octet)作为存储单位,采用 2 2 2 个 Octet( 16 bit 16\ \text{bit} 16 bit)表示一个汉字,可以编码 2 16 = 65536 2^{16} = 65536 216=65536 个字符,这就基本满足了汉字编码需求。 1980 1980 1980 年,中国国家标准总局发布了《信息交换用汉字编码字符集------基本集》,简称 GB2312 或国标码。它采用双字节编码一个字符,为了区别 ASCII,每个字节的最高位一律置" 1 1 1",这很大程度上避免了中英混排文档的乱码现象。GB2312 共收录了 7445 7445 7445 个字符,其中汉字 6763 6763 6763 个(全部为简体),包括最基本的一、二级字库,是迄今几乎所有简体中文系统都支持的字符集。
三、多语种通用字符集与 UCS
与 GB2312 同时,各语言地区(特别是大字符集地区)也都先后研制了适合自己的字符编码标准,如通行于台、港、澳地区的繁体汉字 Big5 码,韩国语的 Wansung 码,日本语的 JIS-X- 0208 0208 0208 码等。随着编码标准的增加,当采用不同字符编码的文档相互传递时,计算机经常因判断错误而不能正确切换解码标准,引起乱码现象;同时,计算机为了识别编码种类,必须在存储器中额外预存多种代码表,从而增加了系统复杂度。如果存在一种涵盖世界上所有文字系统的通用字符集,就可以在一个系统甚至文档中处理多种语言,这无疑是一种理想的解决方案。
1993 1993 1993 年发布的 ISO. 10646 10646 10646 定义了这种通用字符集(Universal Multiple-Octet Coded Character Set,UCS 或 Unicode),它是世界上所有已知字符集的超集,并为将来可能出现的字符预留了足够的空间。UCS 规定了一个 4 4 4 字节( 31 31 31 位)的编码空间,并按字节由高至低分别定义为 Group、Plane、Row 和 Cell 四个级别,理论上可以存储 2 31 2^{31} 231 个字符,如此庞大的空间几乎是不可能被填满的,迄今被使用的也只有 0x0000 ∼ 0xFFFD \text{0x0000} \sim \text{0xFFFD} 0x0000∼0xFFFD 共 65534 65534 65534 个码位,相当于第一个 Plane,称为基本多文种平面(Basic Multilingual Plane,BMP)。BMP 是 UCS 的一个子集,Unicode 通常就是指对这个子集的实现,但仅仅是这一个子集,就几乎涵盖了世界上所有文字的主要字符。其中,大部分拼音文字(包括 ISO. 8859 8859 8859 中的大部分字符和日语假名等)位于 A-Zone 区;大部分汉字(包括日、韩、越等国使用的)位于 CJK 区;增补的扩展汉字集位于 CJK ExtensionA 和 0xFFFF \text{0xFFFF} 0xFFFF 后的部分空间;韩语文字位于 Hangul 区;YI 区包含彝、八思巴、爪哇等一些使用人口不多的文字;S-Zone 为 UTF16 转换方案专用区;EUDC 为保留私用区,用户可根据需要增加自创文字;R-Zone 为限制使用区,包含一些特殊字符和兼容字符等。
UCS 给每个字符分配了唯一的代码,使得现存各类字符集中的任何字符都可以在 UCS 中找到映射。例如,汉语"上外"的 Unicode 是 U+4E0A U+5916 \text{U+4E0A}\ \text{U+5916} U+4E0A U+5916;日语"はな"是 U+306F U+306A \text{U+306F}\ \text{U+306A} U+306F U+306A;韩语对应字符是 U+D559 U+AD50 \text{U+D559}\ \text{U+AD50} U+D559 U+AD50;其他文字类同。这样,UCS 就实现了世界文字符号的大一统,可以在同一个文档的同一个字符集中处理多国语言。
UCS 为我们提供了字符编码方案,但并未规定具体的实施细则。在英语国家,传输纯粹的英语字符只需要 8 8 8 位,如果仍旧用 2 2 2 个字节编码,高字节就得全部置 0 0 0,造成空间浪费,由此在 UCS 基础上制订了 UTF- 8 8 8(UCS Transformation Format 8 8 8),这是一种传输标准,是对 UCS 编码的具体实现。同样,我们可以根据实际需要制定多种实施标准,除了 UTF- 8 8 8,常见的还有 UTF- 7 7 7 /UTF- 16 16 16 /UTF- 32 32 32 等。以 UTF- 8 8 8 为例,它采用变长技术,用 1 1 1 个字节传输 UCS 中的 ASCII 字符;用 3 3 3 个字节传输 UCS 的 2 2 2 字节字符(例如汉字)。仍以"上外"为例, U+4E0A U+5916 \text{U+4E0A}\ \text{U+5916} U+4E0A U+5916 的二进制串分别嵌入 UTF- 8 8 8 掩码,得到的二进制串用十六进制表示,即为 UTF- 8 8 8 的编码 % E4 % B8 % 8A \% \text{E4}\% \text{B8}\% \text{8A} %E4%B8%8A 和 % E5 % A4 % 96 \% \text{E5}\% \text{A4}\% \text{96} %E5%A4%96。同理,如果是拉丁字母,只需嵌入模板第一行,采用一个字节就可以完成传输。
Windows 系统的内核已经使用 Unicode 编码,这就做到了从底层支持世界上所有语言共用一个平台。但是,现存的大量文档和软件仍是传统字符集下编写的,为了向前保持兼容,Windows 提供了代码页(Code Page)机制,这是一种折中方案,用户根据所处地区设定系统的缺省代码页,系统则根据代码页将软件或文档中的 ANSI 字符自动映射为 Unicode 字符。仍以"上外"为例,其在地方软件中的内码为 0xC9CF 0xCDE2 \text{0xC9CF}\ \text{0xCDE2} 0xC9CF 0xCDE2,Unicode 编码为 U+4E0A U+5916 \text{U+4E0A}\ \text{U+5916} U+4E0A U+5916,代码页其实就是这两种编码的映射关系表。常见的代码页有:CP 936 936 936 对应 GBK;CP 950 950 950 对应 Big5;CP 932 932 932 对应日语 Shift-JIS;等等。随着 Unicode 的普及,代码页的使用场景将越来越少。
四、UCS 的优化空间与未来展望
UCS 将各语种文字归入单一字符集,这是了不起的成就,但它并非完美无缺。我们从两个方面探讨 UCS 尚待优化的问题。
首先,UCS 不兼容简体汉字基本集 GB2312,既有软件和文档必须依赖代码页映射,对执行效率和稳定性存在潜在影响;同时,随着考古事业的发展以及文献古籍的解读,陆续有一些生僻字形纳入到汉字库中,这些字形没有得到 UCS 的很好支持。
为此,中国信息技术标准化委员会发布了 GBK(国际标准扩展码),它向前兼容 GB2312,收录字符达到 21886 21886 21886 个。GBK 基本涵盖了 Unicode 中的汉字集,除与 GB2312 保持兼容的 6763 6763 6763 个汉字,其余排列基本是 Unicode 编码的平移,从而保证了两个字符集间的映射关系。GBK 在古籍数字化处理中发挥了重要作用,但同时必须承认,受 Unicode 的影响,GBK 还是在收字和编码方案上做出了很大妥协。
2000 2000 2000 年和 2005 2005 2005 年,又有两个大字符集标准 GB18030- 2000 2000 2000 和 GB18030- 2005 2005 2005 发布。与 GBK 不同,GB18030 采用多字节编码,可以用 1 1 1、 2 2 2 或 4 4 4 个字节表示一个字符:其单字节部分与 Unicode 兼容;双字节部分与 GBK 兼容,并适当调整了一些与 Unicode 的映射;四字节部分映射了单双字节没有映射到的 39420 39420 39420 个 Unicode 的 BMP 码位,以及 16 16 16 个辅助平面(Plane)共计 2 16 × 16 2^{16} \times 16 216×16 个码位。如此庞大的字符空间几乎就是另一个版本的 UCS,或者可以看成与 GBK 兼容的 Unicode 本地化版本。
另一方面,我们应该看到,随着计算机硬件和通信技术的发展,存储空间早已不再是字符编码的掣肘因素,然而,如何更好地在编码地图中科学反映语言文字特点和民族文化内涵,仍是需要进一步探究的课题,尤其是站在汉字文化圈整体视角加以考量。
① 发 U-53D1 \text{U-53D1} U-53D1
② 發 U-767C \text{U-767C} U-767C
③ 髮 U-9AEE \text{U-9AEE} U-9AEE
④ 発 U-767A \text{U-767A} U-767A
⑤ 髪 U-9AEA \text{U-9AEA} U-9AEA
上述五例汉字在字源、字义、字形、字音、使用时代和使用区域等方面有着错综复杂的联系。其中 ②③ 为繁体中文汉字,② 为"發展"之"發",③ 为"頭髮"之"髮";① 为 ②③ 的简化汉字,简化后不再区分;④⑤ 为 ②③ 对应的日本汉字(须注意 ③ 和 ⑤ 不同,⑤ 比 ③ 少了一点);字后附上了相应的 Unicode 编码。如果按照字源和字义,应分为 ①②③ 和 ①③⑤ 两组;如果按照字形,应该分为 ①、②④ 和 ③⑤ 三组;如果按照语言或使用地区,应该分为 ①、②③ 和 ④⑤ 三组;如果按照使用频度,则可以安排在一组。观察它们的编码,可以知道 Unicode 是按照字形归类的,即 ①、②④ 和 ③⑤ 分组法,这是一种简单易行的方案,但是未能体现汉字间的联系。
朱一星( 2012 2012 2012)、王迈( 2014 2014 2014)提出了国际汉字单位(ICCG)的构想,它建立在自顶向下的汉字系统观之上,将跨语种同位汉字的多维联系体现在体系化的汉字编码布局中,可以逐步解决汉字同位异码问题,促进汉字跨语种的整理和规范化。概括地说,有历史渊源关系且字形相近、字义相关的汉字,可以归并为同位汉字,这就如同氢的同位素包含氕、氘、氚一般,可以提供分类相同又互有区别的体系化信息。
参考文献
冯志伟 1994 1994 1994 《汉字的信息量大不利于中文信息处理》,《语文建设》第 3 3 3 期。
冯志伟 2024 2024 2024 《汉字熵值计算及其科学意义》,《北华大学学报》第 1 1 1 期。
王 迈 2014 2014 2014 《同位汉字的编码问题》,《数字化汉语教学》,清华大学出版社。
朱一星 2012 2012 2012 《如何界定汉字的理论单位》,《研究论丛(日)》第 1 1 1 期。
Shannon,C.E. 1951 1951 1951 Prediction and Entropy of Printed English.The BELL System Technical Journal.
(通信地址:200083 上海外国语大学国际文化交流学院)
董琨:汉字的起源
作者:董琨 来源:今日语言学 时间: 2018-08-21
汉字的起源
长期以来,人们把"语言"一词,界定为"人类所特有的用来表达意思、交流思想的工具",或是"人类特有的一种符号系统",认为语言是人类区别于其他动物的根本特征之一。可是,经过科学家的研究,现在已经发现许多动物,例如海豚、鲸、黑猩猩、金丝雀、蜜蜂等,也有广义的语言,包括人类听得见的或是听不见的,有的还相当复杂。于是,语言似乎不能视作人类的专利了,尽管在许多方面,动物的语言与人类的语言无法相提并论。
不过,人类在其发展的相当高级的阶段,发明了文字------一种书面的语言,借以使各种信息,既能送到远方,又能传给后代。这可是任何其他动物所望尘莫及的事,真正足以成为人类的自豪。人类则由于文字的发明,结束了漫长的野蛮、混沌的境况,开始踏上文明的道路。
现代社会的人们,无不知晓"文明"这一概念的含义。文明的表现形式各种各样。诸如国家、城市、商业、文字、宗教、冶炼金属、种植农作物等,都是人类开始具有文明的标志。其中,文字是最为重要的一种标志。人类社会的真正历史,可以说是从有了文字之后才开始的。因此,文字是人类的文明之光。
汉字,则是中华民族的文明之光。
那么,汉字是如何起源的呢?
(一)仓颉的传说及其他
在中国,流传着一个古老的传说------
有个老人端正地坐在地上。他的脸部很是奇异:眉骨隆起,周围竟镶嵌了四只眼睛!每只眼睛里还直发出炯炯的光,射在跟前一堆横七竖八的图形符号上面。此时,正是夜深人静,万籁俱寂;忽然,撕天裂地"哗啦"一声响,接着扑扑簌簌,仿佛下起了大雨。可是仔细一瞧,下的竟是谷子小米!或远或近的地方,又不时传来"啾啾"的啼哭之声,原来是神祇鬼怪正在伤心不止......
这就是中国古代关于仓颉〔jié洁〕造字时"天雨粟,鬼夜哭"(《淮南子•本经训》)的故事。仓颉造字的说法,被中国的许多古书所记载。直至公元 11 世纪的宋代,有一位学者叶梦得(公元 1077---1148 年),写了一部笔记叫《石林燕语》,其中还谈到当时京都官府中许多管理文书的小官吏,到了秋季就集体祭祀仓颉,把他尊为文字之神(图 1)。

图 1 仓颉画像
可见仓颉造字的说法在中国是源远流长的。有不少人相信仓颉是黄帝的史官,甚至干脆把他认作古代的帝王。据说他姓侯冈,名颉;因为是陈仓(今陕西宝鸡一带)地方的人,故而叫"仓颉"。
在编于北宋、号称"法帖之祖"的《淳化阁帖》中,曾经收有一篇"仓颉书"(图 2)。当然,这只能是托名之作,不过有人居然还能据此做出释文来。也有人认为这个书迹与早期彝族的文字比较相像。据调查,在中国的具有文字的某些少数民族中,也不乏仓颉造字的传说,比如彝族。这也证明了中华民族的大部分,具有共同的祖先,都可以说是炎黄子孙。

图 2 仓颉书
根据这种传说,文字是由特殊人物创造的,而且具有神奇的力量,能使天地鬼神为之惧怕。所以早先中国的民间,由此而普遍敬畏文字乃至写有文字的纸张。在旧时的通都大邑到穷乡僻壤,随处可以见到"敬惜字纸"的劝诫招贴。老百姓对于读书识字的人,因而也特别地敬重。
随着科学的昌明,现在我们知道,汉字这样的文字系统,绝对不是一人一时所能创造的,它是广大群众在长期的生产与生活当中,逐渐地发明、积累,达到彼此承认、共同使用(这就叫作"约定俗成"),才得以正式形成的。当然,我们也不否认个别的人在这个过程中有意识地付出了较多的劳动,对汉字的体系形成起了较大的作用。中国历史上许多事物的发明创造,都有类似过程。先民们往往把这些发明权归之于某个传说中的人物。汉字为仓颉所发明,如同说种庄稼始于后稷〔jì计〕一样。战国时代的思想家荀卿在《荀子•解蔽篇》中说:"故好书者众矣,而仓颉独传者,一也。"又说:"好稼者众矣,而后稷独传者,一也。"他认为仓颉之于文字、后稷之于农稼,只是致力较为专一,做出较大成绩,所以声名得以流传而已。这种看法,可以说是比较客观而高明,也符合事物产生与发展的一般规律。
关于汉字的起源,在中国还有两种影响也比较大的说法:一是伏羲(庖羲)造八卦,二是神农"结绳为治"(《说文解字•叙》)。和黄帝一样,伏羲、神农都是中国古代神话中的帝王。

图 3 八卦及其含义
八卦是古人用以占卜的八种基本图形,由符号"------"和"--- ---"组成。这些图形的名称及所代表的事物,见图 3 所示。用这些图形进行排列组合,可以表达更复杂的意义。中国最古老的经典之一------《易经》,对八卦有着系统的论述。据说,著名的德国科学家、发明计算机的先驱莱布尼兹(Leibniz.G.W.,公元 1646---1716 年)就曾经从《易经》的八卦图像中欣喜地印证了从 0 到 63 的二进位数字。
结绳记事可以说是许多民族在文字产生以前都经历过的一个阶段。南美洲的秘鲁印第安人,有所谓"绳结语言",方式相当讲究,使用时间很长(图 4)。中国云南的哈尼族人,数十年前依然使用结绳,如买卖土地的双方各持一根麻绳,田价多少元即打多少结,日后用为凭证。古代汉字中的一些数字的字形如(十)、(卄,即二十)、(卅,即三十),似乎也可视为结绳记事的遗迹。

图 4 南美州印第安人的结绳记事
八卦和结绳之类,虽然可以用来表达某种信息,但它们不能用来记录语言,所以都不能认为具有文字的功能。
关于汉字的起源,我们必须从汉字的自源性质说起。
(二)汉字是一种自源文字
什么叫"自源文字"呢?
从文字发生学的角度来说,文字分为自源的和借源的两大类。所谓自源文字,是指从文字产生开始,就独立发展的文字,在文字的形状和体系上是自己独创的,历史也比较悠久,如:汉字,亚洲西部的苏美尔楔形文字,中美洲的玛雅文字。这些自源文字中,只有汉字福寿绵长,至今健在,其余的都已死亡,或者只是后裔留存。借源文字是指借用或参照其他文字形体或系统而建立的文字,如曰文是借源于汉字,英文、法文等都借源于拉丁字母和希腊字母,而希腊字母又借源于古埃及文。
何以见得汉字是自源文字呢?
早先,在国际考古学界有一种说法,认为中国文明的发源地在西方。有些汉学家将汉字和楔形文字进行比较,认为中国文明和巴比伦文明有亲缘关系。甚至有人认为诺亚的子孙东行,来到了中国。这些看法,当然是非常无知而可笑的。根据近百年来,特别是近 30 多年以来在中国大陆的考古发掘,完全可以推翻这一类说法。所以荷兰著名的考古学家法兰克福(H.Frankfori)在 20 世纪 50 年代初便已指出:全世界范围内独立起源和发展的文明可能只有三个------近东(埃及、两河流域),中国和中南美(墨西哥、秘鲁)。
既然中国的文明是独立起源和发展的,那么,汉字作为自源文字是绝无问题的。至于它和楔形文字有所相似(下文将要叙及),与其说是亲缘关系,毋宁说是体现了人类文字起源的共同特征。
(三)陶器、龟甲上的
图形、刻画符号
关于仓颉造字的说法,如果抛开神话色彩,它在积极的方面可以对我们有两种暗示:其一,表明了汉字的自源性质;其二,提供了汉字起源的最早年代的信息。据中国的古史记载,黄帝是纪元前约 2500 年的人物。这相当于中国考古学所指原始社会晚期的龙山文化(发现于山东章丘龙山镇,距今约 4300---4800 年)时代。这一时期甚至更早的仰韶文化(发现于河南渑池仰韶村,距今约 5000---7000 年)时期的考古发掘中发现,在部分陶器上刻画或者绘写有某些图形符号(图 5、6),不少古文字学家认为这已经是具有文字性质的符号了。上文所引所谓"仓颉书",也是一些不成字的刻画符号性质的图像,应该说并不是偶然的。

图 5 仰韶陶器上的符号

图 6 龙山陶器上的符号
对于汉字起源问题的认识,当然首先要依靠地下考古材料的印证。近年来我国考古发掘取得了不少与汉字起源问题有关的材料,有些是令人振奋的。例如,1983---1987 年在对河南省中部舞阳县城北的贾湖新石器时代遗址的发掘中,在若干墓葬里随葬的龟甲、骨器和石器上,也发现有契刻符号。其中个别契刻符号的形体,与我们即将在下文介绍的河南安阳殷墟甲骨文的某些字形有着惊人的相似之处,图 7 所示的
形和
形,便是如此。运用现代的碳一 14 等年代测定技术,测出贾湖遗址的年代,大约是距今 7000---8000 年,比仰韶文化的年代还要早 1000 年以上,也比迄今世界上其他地方发现的古代文字的源头如南美索不达米亚复杂刻画(约 5400 年前)、埃及象形文字(约 5000 年前)等都要早。尽管贾湖遗址的契刻符号为数甚少,不足以认定已经成为一种文字,但是认为这些符号也具有某种原始文字的性质,并且与殷墟甲骨文具有某种程度的渊源关系,应该是没有太大问题的。因为,它们与殷墟甲骨文一样,都是刻于龟甲兽骨之上;甚至在图 7 那块刻有符号的完整龟甲上方距中线的右侧有一个小圆孔,这在安阳出土的有字龟甲上也能常常见到,说明了二者具有一定程度的相同文化表现形式。起码,它应该被视为驳斥那种所谓"汉字源于西方"的谬论的有力证据。

图 7 舞阳贾湖龟甲契刻符号(左)与殷墟甲骨文拓片(右)的比较
举世闻名的河南安阳殷墟甲骨文,是从第 20 个商王盘庚(约公元前 1324---前 1297 年在位)之后开始出现的,距今已有 3000 多年了。它已经是一种相当成熟的文字,不可能是突如其来的。如果认为贾湖遗址的契刻符号、龙山文化的图形符号等是汉字的雏形,那么它们与殷墟甲骨文之间,势必还有某些过渡性的环节。
可以提供一个证明的是:从 20 世纪 70 年代末开始,中国社会科学院考古研究所曾对隶属于山西省临汾市的襄汾陶寺遗址进行了长期的考古发掘与研究,初步揭示出陶寺遗址是中国史前功能区划最完备的都城,在距今 4000 年至 4500 年间兴建并使用。目前,考古学界倾向于认为陶寺遗址"很有可能就是尧的都城"。在陶寺遗址出土的一个陶器上发现了一个用红色颜料书写的符号(图 8),形体与甲骨文的"文"字完全相同。许多学者据此认为陶寺遗址可以作为当时已经产生国家及都城的佐证,同时也可以认为汉字在当时已经产生,起码可以作为诸如贾湖遗址的契刻符号、龙山文化的图形符号等的汉字雏形与殷墟甲骨文之间的过渡性质的环节吧。

图 8 陶寺遗址陶器符号
在探讨汉字起源的问题时,我们认为有必要建立一个理念,就是汉字的产生,应该是多元的,就是说,具有不同的来源。据不完全统计,几十年来在我国境内发现的早于甲骨文的书写符号有 40 余处,不但在中原地区的河南贾湖和山东大汶口,而且在西北的陕西西安、宝鸡、临潼,甘肃的秦安、半山,青海的乐都,西南的四川广汉,中南的湖北宜昌,乃至东南的浙江良渚(图 9),江西清江、新干等地的古代文化遗址中,都有这类书写、刻画符号的发 现。这些符号的图像形体,有的相同、相似,也有的"风马牛不相及",但是,它们为汉字的产生是否都起了或多或少的作用呢?正如《荀子•解薮篇》所云"好书者众矣",可能都成为汉字起源的催化剂。

图 9 良渚文化玉器上的刻画符号
1992 年,在绝对年代定为公元前 2200 年的山东邹平丁公村遗址的发掘材料中,有一个陶盆底部残片上刻着 11 个类似文字的符号(图 10),这引起了学术界的轰动和极大的重视。如果它的真实性没有问题,那么,正如有的学者所说,它是"一种走向歧途的古代文字",也可以说是没有被诸如仓颉这样的"汉字统一者"所吸收的"前汉字"。这个例子,应该可以用来证明汉字起源的多元性质吧。

图 10 丁公陶文
遗憾的是,目前在这方面所发现的材料及其研究都很有限。在已经发现的有关材料中,由于对文字起源的认识在理论上并不一致,所以对那些材料在汉字形成过程中的性质的认定,还存在若干分歧(限于篇幅,这里不能展开介绍并分析)。因此,汉字的起源,还是一个有待考古材料的丰富和理论认识的深化才能最终解决的神秘之谜。
我国最早的古书之------《尚书•多士》中有句话:"惟殷先人有册有典。"这里指的册和典,都是有关历史的文字记载。殷人祖先已有典册,说明在商朝建立之前,汉字已经形成体系并且进入实用阶段。据此做一较为保守的推测:汉字形成于前此的夏代中期,即大约距今 4000 年,应该是可以成立的吧。
本文原载《中国汉字源流》(董琨著,商务印书馆国际有限公司 2017 年 1 月)
Reference
-
张小衡 | 字形的"号制""点制"与"米制" - 2006
https://ira.lib.polyu.edu.hk/bitstream/10397/68518/1/r26221.pdf
-
王迈 | 汉字三码演进脉络与现存问题探析 - 2025
https://library.ttcdw.com/dev/upload/webUploader/202505/17483356346cf74686b3aab330.pdf
-
董琨:汉字的起源_语文漫谈-中国社会科学院语言研究所
http://ling.cass.cn/ziyuan/ywtd/ywmt/202111/t20211129_5377766.html