网络信息资源检索.ppt
《网络信息资源检索.ppt》由会员分享,可在线阅读,更多相关《网络信息资源检索.ppt(142页珍藏版)》请在三一办公上搜索。
1、1,网络信息资源检索及其利用,李宏伟办公地点:教4-418,2,课程性质,专业基础课,3,教材和参考资料,教 材:无参考书:1 R霍克.Internet 通用搜索引擎检索指南.辽宁:辽宁科学技术出版社,2003 2 王曰芬等.网络信息资源检索与利用.南京:东南大学出版社,20033符绍宏等.因特网信息资源检索与利用.北京:清华大学出版社,2004,4,信息获取和教材选择,我们所处的信息环境是在不断变化的信息技术条件对信息环境的变化是革命性的。信息环境影响、催化或在一定程度上决定了人们的信息需求。教材永远跟不上信息环境和人们信息需求的变化。,5,网络社会,在现在的网络信息环境下,网络信息资源是我
2、们学习、工作、生活中利用率最高的信息资源之一。对网络信息资源的利用是终身学习的需要,也是个人信息素养中的重要内容。相对与图书馆纸质文献信息资源和数字资源的检索利用,其对人的影响更为深远。所以本课程不仅仅介绍网络信息资源及其利用,还穿插介绍网络学习与网络交流方面的内容。,6,教学安排,上课16学时上机16学时答疑:教4-418 Email:,7,考核方式,笔试闭卷平时成绩 40%(出勤,上机作业,课堂表现)期末考试 60%,希望大家都能得到好成绩,8,“闲话”开篇,请先考虑以下问题:你为什么上网(或上网干什么)?你认为网络上有什么?你希望在这门课可以学到什么?,9,网络上的信息资源,网络全能论网
3、络无用论,10,网络基础,认识IP地址认识网络地址和域名域名与网络信息资源有什么关系?,11,认识IP地址,人们为了通信的方便给每一台计算机都事先分配一个类似我们日常生活中的电话号码一样的标识地址,称作网络协议地址,是分配给主机的一个32位地址,由4个字节组成。分为动态IP地址和静态IP地址两种。动态IP地址指的是每次连线所取得的地址不同,而静态IP地址是指每次连线均为同样固定的地址。如目前教室的无线上网就是动态IP地址,每次所取得的地址不同。,12,IP地址的分类,A类IP地址 B类IP地址 C类IP地址 D类IP地址 E类IP地址,13,IP地址的分类,14,A类地址,(1)A类地址第1字
4、节为网络地址,其它3个字节为主机地址。网络地址的最高位必须是“0”(2)A类地址范围:(3)私有地址和保留地址:是私有地址(所谓的私有地址就是在互联网上不使用,而被用在局域网络中的地址)。范围()是保留地址,用做循环测试用的。,15,B类地址,(1)B类地址第1字节和第2字节为网络地址,其它2个字节为主机地址。网络地址的最高位必须是“10”(2)B类地址范围:。(3)B类地址的私有地址和保留地址 是私有地址 是保留地址。如果你的IP地址是自动获取IP地址,而你在网络上又没有找到可用的DHCP服务器。就会得到其中一个IP。,16,C类地址,(1)C类地址第1字节、第2字节和第3个字节为网络地址,
5、第4个个字节为主机地址。另外第1个字节的前三位固定为110。(2)C类地址范围:。(3)C类地址中的私有地址:是私有地址。(192.168.0.0-192.168.255.255),17,D类地址,(1)D类地址不分网络地址和主机地址,它的第1个字节的前四位固定为1110。(2)D类地址范围:224.0.0.1239.255.255.254,18,E类地址,(1)E类地址也不分网络地址和主机地址,它的第1个字节的前五位固定为11110。(2)E类地址范围:240.0.0.1255.255.255.254,19,20,小问题,是 类ip地址?是 类ip地址?是 类ip地址?是 类IP地址?,21
6、,网络地址和域名,虽然可以通过IP地址来访问每一台主机,但是要记住那么多枯燥的数字串显然是非常困难的,为此,Internet提供了域名(Domain Name)。域名也由若干部分组成,各部分之间用小数点分开,例如我校主机的域名是:“”。域名前加上传输协议信息及主机类型信息就构成了网址(URL),例如我校www主机的URL就是:“http:/”。通常,进行网络访问时,域名的www可以省略。如http:/,可以直接输入。不能省略的与域名服务器(dns)的配置有关。域名一般不会变动。,22,23,24,25,26,网络地址-网址-URL,URL-(UniformResourceLocator)URL
7、由三部分组成:协议类型,主机名和路径及文件名。1.服务器标识符(协议类型)通过选择服务器标识符能够确定将要访问的服务器的类型,URL中的服务器标识符可以有HTTP:/、FTP:/、GOPHER:/、TELNET:/、NEWS:/等等类型,分别指定为采用超文本传输协议连接、采用文件传输协议连接、与GOPHER服务器连接、与TELNET会话连接、与USENET新闻组相连接。,27,网络地址-网址-URL,2.信息资源地址信息资源地址是由两部分构成的,一是机器名称,如是用来指示资源所存在的机器,另一个是通信端口号,如HTTP的标准端口号为80,TELNET的标准端口号为23,FTP的标准端口号为21
8、等等。3.路径名路径名是给出资源在所在机器上的完整文件名.如:http:/,28,域名与网络信息资源的关系,由于Internet最初是在美国发源的,因此最早的域名并无国家标识,人们按用途把它们分为几个大类,它们分别以不同的后缀结尾:随着Internet向全世界的发展,除了edu、gov、mil、一般只在美国专用外,另外三个大类com、org、net则成为全世界通用,因此这三大类域名通常称为国际域名。ac 代表科研机构由于国际域名资源有限,各个国家、地区在域名最后加上了国家标识段,由此形成了各个国家、地区自己的国内域名,如:中国的商业.org.hk 香港的组织.net.jp 日本的网络,对网络信
9、息资源的获取与评价有参考作用,.com 商业公司.org 组织、协会等.net 网络服务,.edu 教育机构.gov 政府部门.mil 军事领域,29,30,全世界为美国打工,目前,全世界共有13台根服务器,其中10台在美国,而且2台由美军使用,1台由美国国家航空航天局使用。也就是说,每天世界各地的电子邮件有很多要先由美国人“过目”之后才能去它该去的地方。此外,美国私营公司掌握着全世界互联网域名的分配大权。假如美国与日本的关系急剧恶化,只要美国通过技术手段删去日本的域名“.jp”,日本马上就会成为“网上孤岛”,无法通过网络与外界联系。全世界的网络用户都要向美国支付费用,“全世界都在为美国打工”
10、。中国已经建成了世界第一个同时也是规模最大的纯IPv6网,31,我国域名注册管理机构中国互联网络信息中心(CNNIC)日前在京宣布,已代表中国正式向国际互联网名称与数字地 址分配机构(ICANN)递交了“.中国”域名国际申请。这意味着“.中国”域名已进入全球启用倒计时。CNNIC相关负责人表示,“.中国”域名如果顺利完成国际申请实现全球访问,将有助于缩小东西部、城乡间的数字鸿沟。此外,“.中国”域名还将促使纯中文邮件地址在内的众多互联网创新服务的诞生。,32,更多,www指的是什么?即是万维网(WWW-World Wide Web):是基于超文本的、方便用户在因特网上搜索和浏览信息的信息服务系
11、统。它将位于全世界因特网上不同地点的相关数据信息有机地纺织在一起。媒体形式可以是文本、图片、动画、声音等,可以跳转,“网上冲浪”。浏览web信息的网络浏览器有哪些?微软IE(Internet Explorer)火狐(Mozilla Firefox);Chrome Opera;safari;Netscape 遨游(maxthon);世界之窗腾讯TT浏览器,33,网络信息资源概念、类型、特点,网络信息资源是指信息资源以电子数据的形式存放在非印刷型的介质中,并通过网络通信手段,在计算机等终端上再现的信息的总和。,34,网上有什么?,政府信息科研信息教育信息文化信息休闲娱乐信息,35,网上不会有什么?
12、,商业秘密军事机密版权作品,36,36,37,John Coster-Mullen曾经是一名卡车司机,他没有接受过大学教育,但通过自学他掌握了原子弹的建造方法。他说,原子弹的秘密在于它十分容易制造。他将自己的发现写成一本书Atom Bombs:The Top Secret Inside Story of Little Boy and Fat Man,并持续更新内容。美国国家资源保护委员会对该书的评价是“没有其它曼哈顿工程文学作品能达到他对原子弹零件的精确剖析”。Coster-Mullen花了大约十年时间研究原子弹的技术细节。,37,38,网络信息资源的类型,按信息内容的表现形式和内容划分可分为
13、全文型信息:它指直接在网上发行的电子期刊,网上报纸,印刷型期刊的电子版,网络学院的各类教材,政府出版物,标准全文等;事实型信息:天气预报,节目预告,火车车次,飞机航班,城市或景点介绍,工程实况、IP地址等;数值型信息:主要是指各种统计数据;数据库类信息:如DIALOG,万方等,是传统数据库的网络化;微信息(web2.0特征):如博客、播客,BBS,聊天,邮件讨论组,网络新闻组等。其它类型:投资行情和分析,图形图象,影视广告等。,39,按所采用的网络传输协议分为:,WWW网络资源:因特网信息资源的主流,它使用http协议,使用简单,功能强大,能方便迅速的浏览和传递分布于网络各处的文字、图象、声音
14、和多媒体超文本信息。FTP信息资源:它使用ftp协议,该协议主要用于联网计算机之间传输文件。FTP相当于在网络上两个主机之间复制文件。目前仍是发布、传递软件和长文件的主要方法。,40,按所采用的网络传输协议分为:,TELNET信息资源:telnet是远程登陆协议。telnet信息资源包括硬件资源和软件资源。许多机构都提供远程登陆的信息系统,如图书馆的公共目录系统,信息服务机构的综合信息系统等。用户服务组资源:包括新闻组,电子邮件组等。这些电子通信组形式所传递和交流的信息资源是网络上最自由、最具有开放性的资源。News,41,按所采用的网络传输协议分为:,Gopher:一种基于菜单的网络服务,它
15、为用户提供了丰富的信息,并允许用户以一种简单的、一致的方法快速找到并访问所需的网络资源。全部操作是在一级级菜单的指引下,用户只需在菜单中选择项目和浏览相关内容,就可完成对Internet上远程联机信息系统的访问,无需知道信息的存放位置和掌握有关的操作命令。RSS信息资源:RSS是一种起源于网景的技术,将用户订阅的内容传送给他们的通讯协同格式(Protocol)。RSS可以是以下三个解释的其中一个:Really Simple Syndication RDF(Resource Description Framework)Site Summary Rich Site Summary,42,42,按所
16、采用的网络传输协议分为:,P2P应用允许主机之间通过互联网直接进行相互通信,众多Peer之间形成一个P2P覆盖网络(Overlay Network),从而使各种数据(如文本文件、视频文件等)能方便地在普通主机之间共享。目前人们认为其在全球的即时通信(如Skype)、文件共享(如BT)、分布计算(如SETIhome)、协同工作(如Groove)等方面大有前途。常用的P2P应用有Gnutella、BitTorrent、Kazaa、eDonkey、eMule、Skype、Shareaza、Morpheus等,国内开发的主要有:QQ、POCO、PPLive、VNN、PP点点通、北大Maze等。,43,
17、网络信息资源的特点,复杂性:网络信息资源具有大数量、多类型、多媒体、非规范、跨时间、跨地域、跨行业、多语种等特点。在很大程度上网络的增长和信息资源的动态快速增加是由用户驱动的,但缺乏有效的统一管理机制,信息安全和信息质量的不均衡性。信息分布和构成缺乏结构和组织,信息源不仅分散无序,而且其更迭和消亡也往往无法预测,因此增大了信息资源管理和利用的难度。信息发布具有很大的自由性和任意性,隐私型信息进入了公共信息传播渠道;由于缺乏必要的过滤、质量控制和管理机制,不仅学术信息、商业信息,政府信息、个人信息、不合适(反动、黄色)的信息混为一体,质量良莠不齐。增加了信息识别和利用的难度。,44,续,正式出版
18、物和非正式信息交流交织在一起,使传统的人类信息交流链的格局被打破,各方在网络上既可以是信息的生产者、发布者,也可以是传播者和使用者,对学术交流环境和信息利用产生了深刻的影响。网络营造了“地球村”,既 极大地促进了人类信息资源的共享,又带来了一些意想不到的问题,如文化冲突、信息侵略、信息威慑等。使用成本低 共享程度高 是信息资源的宝库,45,网络信息资源的优点,1价廉 它是一种比印刷品便宜的信息提供方式。不仅提供信息线索引和著录信息,还提供有关信息的全文和原稿。2新颖、深入 网上大量的灰色文献或边缘文献(grey of fringe literature),即在主流出版物渠道之外的文献,包括:研
19、究报告、调查采访、研讨会发言、笔记、项目计划报告、政策方针等。它们反映了许多研究成果背后的原始数据或第一手资料,或是因为其内容太新或太专而未被纳入正式文献交流渠道。,46,网络信息资源的优点,3广泛、直接交流 因特网扩大了人际交流的范围,提供了更多的直接交流机会。如参加Usenet的新闻组(news group)、讨论组(discussion group)、邮件列表(mailing list)的讨论。4非正式和自由发表园地,47,评价网络信息资源的必要性,第一,网络上信息资源量的爆炸式增长,使得人们从中淘取有用信息的难度越来越大。第二,因特网的松散、开放性等特点,决定了网络信息空间秩序混乱,网
20、上信息良莠不齐、真伪混杂、整体质量水平下降,人们选择信息更加困难。另外,在互联网上,信息不仅很容易被出版、传播,而且也极容易被篡改。,48,网络信息资源的评价与选择,相同内容的信息资源的载体形态或利用、获取的方式不同,可以根据需要选择。网络信息资源的评价与选择主要是针对信息源。内容因素。内容是评价与选择的核心和重点,从中可以反映网络信息资源的本质。评价网络信息资源的内容因素主要有:权威性、完备性、可靠性、原创性、新颖性、稳定性等。形式因素。形式指标反映了外部特征以及操作使用等方面,是为提示内容服务的,主要包括:美观性、条理性、查检性、帮助性、快捷性、低耗性等。定量的评价:Google的page
21、rank,星数评价等级。,49,权威性,在本学科领域具有一定的影响、具有较高的学术水平、具有较高的知名度;Google网页级别评价作为重要的指标,非独特性资源网页级别需4/10以上。主要关注如下问题:所采集的网站(页)的主办者是否为有声誉的大学、学会/协会、实验室?网站是否通过权威评价机构评价过?所选的站点是否被多个internet站点链接?网站是由某公司、机构还是某领域的著名的权威或专家赞助?信息提供者的教育背景和职业背景及其研究方向?责任者有知名的出版物吗?信息是否经过过滤?信息是否经同行评议过?资源是否由相关的权威推荐?是否有与权威机构的页面的共同链接?出版社是否知名和有声望?出版社是否
22、是公认的出版界的权威?出版社是否是大学的出版社?是否有任何原创作品?选择的资源与其它作品有相关性吗?,50,准确性,信息资源需严肃正规、准确无误、完整规范。一方面是内容的准确性,另一方面是格式和链接的准确性。对资源的导航需能正常访问。主要考虑所选网站(页)提供的信息是否准确?是否提供了信息的来源和出处以备用户进一步核查;网页引证的书目或提供的参考能否证实信息的准确性?页面的句法和拼写是否准确?有否排印错误?提供的信息是否完整规范?,51,稳定性,信息资源需有较长的稳定期或有稳定运行的保障机制。主要看所选网站(页)提供信息的时间、更新频率、最近的修改日期,链接速度,断线率等。是否能持续提供给用户
23、使用?,52,可获得性,信息资源揭示信息的层次中,至少一个能无障碍地获得。主要要考虑的是题名信息还是文摘信息或全文信息?是否有对信息结论的阐述标准?是否给出了表明信息内容的关键词或主题词?希望在该网页上找到何种信息?主题的涵盖面是否全?索引或目次页是否隐含了综合性的内容?是否免费?是否注册?是否国际流量?是否符合标准?是否有其它格式或镜像?某种类型的信息有使用期限制吗?访问资源的方式是否依赖用户使用的设备?是否需要专门软件(如浏览器)?是否有方便的导航?是否容易链接所需的信息?是否有清晰的链接标签?是否能分别打印页面和文献的某一部分?是否能发送到电子邮箱?是否提供多种检索方式?检索信息的效率如
24、何?,53,网络信息资源检索的特点,检索范围大检索效率高工具强大信息冗余大,54,网络信息检索工具,当已经知道地址时直接通过地址访问。当不知道地址的时候,需要借助检索工具,进行关键字检索搜索引擎网络资源指南(门户)专门数据库,55,网络信息检索工具一般是由自动索引程序、数据库和检索代理软件组成的。有些检索工具还拥有自己的维护管理软件。不同的检索工具在具体的实现机理上又各有所不同。从而决定了不同的检索工具的特色。,56,57,自动索引程序,现在大多数网络检索工具都是采用一种称为Robot(又称为:Spider,Crawler,Worms,Wanders等)的网络自动跟踪索引程序。它实际上是一个在
25、网络上检索文件且自动跟踪该文件的超文本结构并循环检索被参照的所有文件的软件。不同的自动索引软件所采用的标引、搜索策略不同,自动索引软件搜寻、标引网页的方式对信息检索的质量有直接影响。,58,搜索数据库的来源,“机器人”工作机理起始URL-分析页面-URL-新页面,59,数据库,自动索引程序将采集和标引的信息汇集成数据库,作为该网络检索工具提供检索服务的基础。不同网络检索工具的数据库收录范围不一样,有的收录Web及图像、有的收录WEB、FTP、Flash、新闻组等资源类型。不同网络检索工具的标引方式也不同,有的索引软件标引主页全文,有些则只标引主页的地址、标题、责任者、特定的段落和关键词。,60
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 网络 信息资源 检索
链接地址:https://www.31ppt.com/p-6016757.html