第六章中文信息处理概述课件.ppt
《第六章中文信息处理概述课件.ppt》由会员分享,可在线阅读,更多相关《第六章中文信息处理概述课件.ppt(31页珍藏版)》请在三一办公上搜索。
1、第六章 中文信息处理,概 述,1,谢谢观赏,2019-8-17,一、中文信息处理,计算机科学技术百科全书(清华大学出版社,1998)中文信息处理是用计算机对汉语的音、形、义等语言文字信息进行的加工和操作,包括对字、词、短语、句、篇章的输入、输出、识别、转换、压缩、存储、检索、分析、理解和生成等各方面的处理技术。中文信息处理分为汉字信息处理与汉语信息处理两部分中文信息处理是自然语言信息处理的一个分支,是一门与计算机科学、语言学、数学、信息学、声学等多种学科相关联的综合性学科。,2,谢谢观赏,2019-8-17,3,谢谢观赏,2019-8-17,中文信息处理,中文信息处理分为汉字信息处理与汉语信息
2、处理两部分信息的两个层次:符号层 中文 / 汉语 / 汉字内容层 符号所承载的意义中文信息处理的两个层次:字符处理(输入、存储、输出等)内容处理(词语切分,词性标注,结构分析,意义理解,推理,翻译等等),4,谢谢观赏,2019-8-17,符号层的信息处理,拼音文字:小字符集 比较容易非拼音文字:大字符集 难度很大,汉字是一个大字符集说文解字(东汉):9353字玉篇(南朝)收录16,917字广韵(宋代)收字26,194字字汇(明朝)收录33,197字康熙字典(清朝)收录47,043字汉语大字典(1992年)5.6万中华字海( 1994年) 8.6万,拉丁字母只有26个符号 斯拉夫字母只有33个符
3、号 阿尔明尼亚字母只有38个符号 泰米尔字母只有36个符号 缅甸字母只有52个符号 泰文字母只有44个符号 老挝字母只有27个符号 藏文字母只有35个符号 韩文字母只有24个符号 日文假名只有48个符号,5,谢谢观赏,2019-8-17,符号层的信息处理,汉字输入,自动输入,键盘输入,字形识别,声音识别,手写体识别,印刷体识别,在线手写,脱机手写,整字键盘,通用键盘,主辅式,感应式,形码,音码,形音结合码,1,2,3,4,5,6,7,8,9,6,谢谢观赏,2019-8-17,内容层的信息处理,机器翻译全过程,7,谢谢观赏,2019-8-17,中文信息处理的现状和发展趋势,现状符号层的处理成果已
4、经得到广泛应用;中文输入/字库/字处理软件/排版/内容层的处理目前在词语识别和词性标注方面已经取得重要进展,句子结构分析和语义分析方面仍有待探索,8,谢谢观赏,2019-8-17,二、文字信息处理的基本问题,文字信息的计算机处理过程要用计算机来处理文字,必须解决如何把文字输入计算机并在计算机中存储起来,进行适当处理之后再输出文字等问题。,文字信息的输入 文字信息的处理 文字信息的输出,9,谢谢观赏,2019-8-17,二、文字信息处理的基本问题,文字信息处理的实质,是先把文字信息数字化,即用一个固定的数码代表一个字母或文字。在英文信息中,以26个字母作为文字信息处理的单位,因此要对26个字母逐
5、个地确定代替它的数码。汉字一般是以一个整字作为文字信息处理的单位,因此要对每一个整字惟一地确定代表它的数码。这一数码统称为代码(code)在计算机内部处理文字信息时,就像处理数据一样对待。处理完毕后,再把替代的数码还原成相应的字母或文字。利用计算机能够调整处理数据的性能,使文字信息处理也能够分享计算机技术的这一独特优点,从而实现文字信息处理的高效化。,10,谢谢观赏,2019-8-17,二、文字信息处理的基本问题,英文字符的编码标准是ASCII码,即美国信息交换标准代码。这是七位的二进制代码,它是美国国家标准学会(ANSI)为计算机的信息交换提出的标准,后来由国际标准组织(ISO)确定为国际标
6、准字符编码。为了和国际标准兼容,我国根据它制定了英文字符编码国家标准,即GB1988。其中除了将货币符号置换为人民币符号外,其他都与ASCII码相同。,11,谢谢观赏,2019-8-17,计算机的键盘原本就是为英文输入设计的,只要按照字母击键,就可以输入英文。键盘的译码电路按照所击的键产生英文字符的ASCII码,输入到计算机的内存中。经过编辑的文本仍然以ASCII码表示。输出时,这些代码必须转换成字符字形的点阵,以便显示或打印。因此,计算机必须存储每个英文字符、数码以及标点符号的点阵信息。这些点阵信息构成了所谓“字模库”。字模库的点阵以有点或无点来表示文字和符号。汉字信息的计算机处理过程与英文
7、信息处理过程是类似的。不过,由于汉字信息的特点,以及要考虑与英文信息处理系统兼容等问题,处理的难度更大。我国经过多年的研究,汉字处理的基本问题已经解决。,汉字信息处理的基本问题,12,谢谢观赏,2019-8-17,三、中文信息处理主要研究对象,基础研究:汉字字频统计、词频统计、汉语自动分词、句法属性研究、汉字编码字符集、通用汉字样本库、汉字属性字典、语料库等 输入技术:中文输入法、中文手写输入、中文语音输入、光学字符识别等。 输出技术:汉字字模技术(字体库)、汉字激光照排、汉语语音合成、动态组字等。 外字处理:动态组字、造字、电子书等。 存储技术:汉字库标准中文、字符编码等。 转换技术:繁简转
8、换等,13,谢谢观赏,2019-8-17,三、中文信息处理主要研究对象,信息处理:中文情报检索、中文文本校对、机器翻译、自然语言理解、中文人机界面、语义网、电子字典、电脑辅助翻译等 中文化:软件的国际化(internationalization)和本土化(localization)。 中文编程:目前有两种发展,一种是英文coding直接翻译,以降低开发人员的语言学习成本;一种是根据中文特点,发展出融合中国人思维模式的新的计算机语言。,14,谢谢观赏,2019-8-17,为了用0、1代码串表示汉字,在汉字系统或通信系统之间交换信息,必须给每个汉字规定一个统一的代码。这就是汉字的交换码。1981年
9、5月,我国国家标准总局颁布信息交换用汉字编码字符集(GB 2312-80),作为汉字交换码编码的国家标准,简称国家标准汉字编码,或国标码。收进该标准的字符共有7 445个。其中一级汉字3 755个,二级汉字3 008个,共计6 763个。一、二级汉字约占近代文献汉字累计使用频度的99.99%。为便于查找,一级汉字按汉语拼音顺序排列;二级汉字一般不易熟记它们的发音,故按部首和笔画排列。另外还包括常用符号、序号、GB 1988图形字符集、日文假名、希腊字母、俄文字母、汉语拼音、注音字符、制表符号等。,四、汉字编码标准,15,谢谢观赏,2019-8-17,累计使用频度不足0.001%的汉字数量接近1
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 第六 中文信息处理 概述 课件
链接地址:https://www.31ppt.com/p-1475601.html