NNavLab返回工作流返回首页
TOOL TUTORIAL

NCBI Protein 使用教程

目标:从一个蛋白 / 酶名称出发,找到可信的天然蛋白条目,理解 NCBI Protein 页面上的主要字段,并拿到可用于下一步同源搜索的 reference accession 与 amino-acid FASTA。

02 · RESULTS PAGE

搜索结果页每一项怎么看

一个结果通常由蛋白名称、来源物种、蛋白长度、accession 和一组快捷链接组成。优先看“名称 + 物种 + 长度 + accession”是否与已知信息一致。

页面字段是什么意思 / 怎么用
Protein title
例如 AetD [organism]
该记录的蛋白名称与来源物种。名称可能来自提交者、RefSeq、UniProt 或结构数据库,因此名称相同不等于一定是同一来源记录。
239 aa protein蛋白长度(氨基酸数)。判断是否是完整天然蛋白、片段或结构构建体时很有用。
Accession该蛋白记录的唯一数据库编号。后续用于重新定位这条记录和追踪 genome / contig。
Nucleotide跳到对应的核酸 / CDS 记录。后续追踪基因组上下文时会用到。
PubMed查看与该记录关联的论文,用于确认是否有原始功能实验。
Taxonomy查看该蛋白来源物种的分类信息。
GenPept打开该蛋白的详细 GenPept 文本记录,查看 accession、来源、参考文献、features 等完整注释。
Identical Proteins查看序列完全相同的蛋白记录 / 对应关系。用于理解同一条序列为什么可能有多个 accession 或多个 genome placement。
FASTA直接显示该条目的氨基酸 FASTA,是后续 BLAST、比对、建树真正需要的序列格式。
Graphics以图形方式查看蛋白特征 / 注释区域;对确认结构域、注释位置等有帮助。
03 · RECORD PAGE

点进一个蛋白条目后看什么

进入 GenPept / Protein 详细记录后,先看下面这些字段。对建立 reference 来说,不需要逐字阅读全部内容。

字段含义
LOCUS记录名、蛋白长度、分子类型以及记录更新时间等概要信息。
DEFINITION当前数据库给这条蛋白的名称 / 功能描述。
ACCESSION / VERSIONaccession 是条目的稳定编号;VERSION 带版本号,序列更新后版本可能变化。记录 reference 时建议保存带版本号的 accession。
DBSOURCE该蛋白记录来自哪个上游核酸记录或数据库来源。
SOURCE / ORGANISM来源物种、菌株及分类信息。这里要与已知研究对象核对。
REFERENCE与该蛋白记录关联的论文或提交信息,可用于确认功能证据。
FEATURES数据库记录的蛋白特征、区域、注释和 cross-reference。
04 · MULTIPLE RECORDS

为什么同一个蛋白会出现多个不同条目

NCBI Protein 是一个聚合入口,会显示来自不同来源数据库的蛋白记录。常见来源包括 GenBank / GenPept、RefSeq、UniProt / Swiss-Prot 以及 PDB 结构链。因此,同一个天然蛋白可能出现多个 accession;PDB 里还可能因为不同 chain 或实验构建体出现额外记录。

  • GenBank / GenPept:通常对应作者或数据库提交的 CDS 翻译记录。
  • RefSeq:NCBI 维护的参考 / 非冗余蛋白记录,细菌中常见 WP_... accession。
  • UniProt / Swiss-Prot:来自 UniProt 的蛋白条目,可能具有更系统的功能整理与 cross-reference。
  • PDB chain:结构数据库中的实验蛋白链,可能带工程残基或使用结构构建体,不一定等同于天然蛋白全长。
选择 reference 时,不需要执着于“只能保留一个数据库编号”。建议选定一个主要 accession,同时保存完整 native FASTA 和必要的 cross-reference。若多个条目物种、长度和序列完全一致,它们可以代表同一个天然蛋白的不同数据库身份。
05 · FASTA

如何查看和下载 amino-acid FASTA

方法 A:单条记录,最简单

  1. 在搜索结果中找到目标蛋白。
  2. 点击该条目下面的 FASTA。
  3. 页面会显示以 > 开头的 FASTA header 和下面的氨基酸序列。
  4. 要保存文件,可使用页面右上角 Send to → File,选择 FASTA 格式后生成文件;也可以复制完整 FASTA 文本保存为 .fasta 或 .faa。

方法 B:一次下载多条结果

  1. 在搜索结果页勾选需要的蛋白记录。
  2. 点击页面上方 Send to。
  3. 选择 File。
  4. 在格式中选择 FASTA,然后创建 / 下载文件。
>accession protein_name [organism]
MXXXXXX...完整氨基酸序列...
后续 homolog search 真正需要的是这一条完整的 native amino-acid sequence。不要误用 PDB chain 的工程构建体序列,也不要只保存网页标题或蛋白名称。
06 · FINISH

完成这一步时,你应该保存什么

  • 一个主要 reference accession(最好带版本号)
  • 对应的完整 amino-acid FASTA
  • organism / strain 和蛋白长度
  • 如果存在:GenBank / RefSeq / UniProt 等 cross-reference
  • 支持该功能的原始论文或可靠数据库注释