生物信息学第三章生物信息数据库.ppt
《生物信息学第三章生物信息数据库.ppt》由会员分享,可在线阅读,更多相关《生物信息学第三章生物信息数据库.ppt(7页珍藏版)》请在三一办公上搜索。
1、第三章,生物信息数据库与查询,近年来大量生物学实验的数据积累,形成了当前数以百计的生物信息数据库。它们各自按一定的目标收集和整理生物学实验数据,并提供相关的数据查询、数据处理的服务。随着因特网的普及,这些数据库大多可以通过网络来访问,或者通过网络下载。一般而言,这些生物信息数据库可以分为一级数据库和二级数据库。一级数据库的数据都直接来源于实验获得的原始数据,只经过简单的归类整理和注释;二级数据库是在一级数据库、实验数据和理论分析的基础上针对特定目标衍生而来,是对生物学知识和信息的进一步整理。国际上著名的一级核酸数据库有Genbank 数据库、EMBL 核酸库和 DDBJ 库等;蛋白质序列数据库
2、有 SWISS-PROT、PIR 等;蛋白质结构库有 PDB 等。国际上二级生物学数据库非常多,它们因针对不同的研究内容和需要而各具特色,如人类基因组图谱库 GDB、转录因子和结合位点库 TRANSFAC、蛋白质结构家族分类库 SCOP 等等。下面将顺序简要介绍一些著名和有特色的生物信息数据库。3.1 基因和基因组数据库1.GenbankGenbank 库包含了所有已知的核酸序列和蛋白质序列,以及与它们相关的文献著作和生物学注释。它是由美国国立生物技术信息中心(NCBI)建立和维护的。它的数据直接来源于测序工作者提交的序列;由测序中心提交的大量 EST 序列和其它测序数据;以及与其它数据机构协
3、作交换数据而来。Genbank 每天都会与欧洲分子生物学实验室(EMBL)的数据库,和日本的 DNA 数据库(DDBJ)交换数据,使这三个数据库的数据同步。到 1999 年 8 月,Genbank 中收集的序列数量达到 460 万条,34 亿个碱基,而且数据增长的速度还在不断加快。Genbank 的数据可以从 NCBI 的 FTP 服务器上免费下载完整的库,或下载积累的新数据。NCBI 还提供广泛的数据查询、序列相似性搜索以及其它分析服务,用户可以从 NCBI 的主页上找到这些服务。Genbank 库里的数据按来源于约 55,000 个物种,其中 56%是人类的基因组序列(所有序列中的 34%
4、是人类的EST 序列)。每条 Genbank 数据记录包含了对序列的简要描述,它的科学命名,物种分类名称,参考文献,序列特征表,以及序列本身。序列特征表里包含对序列生物学特征注释如:编码区、转录单元、重复区域、突变位点或修饰位点等。所有数据记录被划分在若干个文件里,如细菌类、病毒类、灵长类、啮齿类,以及 EST 数据、基因组测序数据、大规模基因组序列数据等 16 类,其中 EST 数据等又被各自分成若干个文件。(1)Genbank 数据检索NCBI 的数据库检索查询系统是 Entrez。Entrez 是基于 Web 界面的综合生物信息数据库检索系统。利用Entrez 系统,用户不仅可以方便地检
5、索 Genbank 的核酸数据,还可以检索来自 Genbank 和其它数据库的蛋白质序列数据、基因组图谱数据、来自分子模型数据库(MMDB)的蛋白质三维结构数据、种群序列数据集、以及由 PubMed 获得 Medline 的文献数据。Entrez 提供了方便实用的检索服务,所有操作都可以在网络浏览器上完成。用户可以利用 Entrez 界面上提供的限制条件(Limits)、索引(Index)、检索历史(History)和剪贴板(Clipboard)等功能来实现复杂的检,索查询工作。对于检索获得的记录,用户可以选择需要显示的数据,保存查询结果,甚至以图形方式观看检索获得的序列。更详细的 Entre
6、z 使用说明可以在该主页上获得。,(2)向 Genbank 提交序列数据,测序工作者可以把自己工作中获得的新序列提交给 NCBI,添加到 Genbank 数据库。这个任务可以由基于 Web界面的 BankIt 或独立程序 Sequin 来完成。,BankIt 是一系列表单,包括联络信息、发布要求、引用参考信息、序列来源信息、以及序列本身的信息等。用户提交序列后,会从电子邮件收到自动生成的数据条目,Genbank 的新序列编号,以及完成注释后的完整的数据记录。用户还可以在 BankIt 页面下修改已经发布序列的信息。BankIt 适合于独立测序工作者提交少量序列,而不适合大量序列的提交,也不适合
7、提交很长的序列,EST 序列和 GSS 序列也不应用 BankIt提交。BankIt 使用说明和对序列的要求可详见其主页面。,大量的序列提交可以由 Sequin 程序完成。Sequin 程序能方便的编辑和处理复杂注释,并包含一系列内建的检查函数来提高序列的质量保证。它还被设计用于提交来自系统进化、种群和突变研究的序列,可以加入比对的数据。Sequin 除了用于编辑和修改序列数据记录,还可以用于序列的分析,任何以 FASTA 或 ASN.1格式序列为输入数据的序列分析程序都可以整合到 Sequin 程序下。在不同操作系统下运行的 Sequin 程序都可以在 下找到,Sequin 的使用说明可详见
8、其网页。,NCBI的网址是:。,Entrez的网址是:。,BankIt的网址是:。,Sequin的相关网址是:。,2.EMBL 核酸序列数据库,EMBL 核酸序列数据库由欧洲生物信息学研究所(EBI)维护的核酸序列数据构成,由于与 Genbank 和 DDBJ 的数据合作交换,它也是一个全面的核酸序列数据库。该数据库由 Oracal 数据库系统管理维护,查询检索可以通过通过因特网上的序列提取系统(SRS)服务完成。向 EMBL 核酸序列数据库提交序列可以通过基于 Web的 WEBIN 工具,也可以用 Sequin 软件来完成。,数据库网址是:。,SRS的网址是:。,WEBIN 的网址是:。,3
9、.DDBJ 数据库,日本 DNA 数据仓库(DDBJ)也是一个全面的核酸序列数据库,与 Genbank 和 EMBL 核酸库合作交换数据。可以使用其主页上提供的 SRS 工具进行数据检索和序列分析。可以用 Sequin 软件向该数据库提交序列。,DDBJ的网址是:。,4.GDB,基因组数据库(GDB)为人类基因组计划(HGP)保存和处理基因组图谱数据。GDB 的目标是构建关于人类基因组的百科全书,除了构建基因组图谱之外,还开发了描述序列水平的基因组内容的方法,包括序列变异和其它对功能和表型的描述。目前 GDB 中有:人类基因组区域(包括基因、克隆、amplimers PCR 标记、断点brea
10、kpoints、细胞遗传标记 cytogenetic markers、易碎位点 fragile sites、EST 序列、综合区域 syndromicregions、contigs 和重复序列);人类基因组图谱(包括细胞遗传图谱、连接图谱、放射性杂交图谱、contentcontig 图谱和综合图谱等);人类基因组内的变异(包括突变和多态性,加上等位基因频率数据)。GDB 数据库以对象模型来保存数据,提供基于 Web 的数据对象检索服务,用户可以搜索各种类型的对象,并以图形方式观看基因组图谱。,GDB的网址是:。,GDB的国内镜像是:。,3.2 蛋白质数据库,1.PIR 和 PSD,PIR 国际
11、蛋白质序列数据库(PSD)是由蛋白质信息资源(PIR)、慕尼黑蛋白质序列信息中心(MIPS)和日本国际蛋白质序列数据库(JIPID)共同维护的国际上最大的公共蛋白质序列数据库。这是一个全面的、经过注释的、非冗余的蛋白质序列数据库,包含超过 142,000 条蛋白质序列(至 99 年 9 月),其中包括来自几十个完整基因组的蛋白质序列。所有序列数据都经过整理,超过 99%的序列已按蛋白质家族分类,一半以上还按蛋白质超家族进行了分类。PSD 的注释中还包括对许多序列、结构、基因组和文献数据库的交叉索引,以及数据库内部条目之间的索引,这些内部索引帮助用户在包括复合物、酶底物相互作用、活化和调控级联和
12、具有共同特征的条目之间方便的检索。每季度都发行一次完整的数据库,每周可以得到更新部分。,PSD 数据库有几个辅助数据库,如基于超家族的非冗余库等。PIR 提供三类序列搜索服务:基于文本的交互式检索;标准的序列相似性搜索,包括 BLAST、FASTA 等;结合序列相似性、注释信息和蛋白质家族信息的高级搜索,包括按注释分类的相似性搜索、结构域搜索 GeneFIND 等。,PIR和PSD的网址是:。,数据库下载地址是:。,2.SWISS-PROT,SWISS-PROT 是经过注释的蛋白质序列数据库,由欧洲生物信息学研究所(EBI)维护。数据库由蛋白质序列条目构成,每个条目包含蛋白质序列、引用文献信息
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 生物 信息学 第三 信息 数据库
链接地址:https://www.31ppt.com/p-6001804.html