TOOL TUTORIAL
NCBI Protein 使用教程
目标:从一个蛋白 / 酶名称出发,找到可信的天然蛋白条目,理解 NCBI Protein 页面上的主要字段,并拿到可用于下一步同源搜索的 reference accession 与 amino-acid FASTA。
01 · SEARCH
搜索蛋白 / 酶名称
打开 NCBI Protein,在顶部搜索框直接输入已知的蛋白或酶名称。第一轮可以直接搜名字;如果结果太多或混入大量无关记录,再加入物种、菌株或通路信息缩小范围。
NCBI→Protein→输入名称→Search
示例:AetD
第一步的目标不是“把搜索结果全部当作这个蛋白家族”,而只是找到一个可信的 reference protein。真正的家族搜索在下一步用序列做 BLAST / profile search。
02 · RESULTS PAGE
搜索结果页每一项怎么看
一个结果通常由蛋白名称、来源物种、蛋白长度、accession 和一组快捷链接组成。优先看“名称 + 物种 + 长度 + accession”是否与已知信息一致。
| 页面字段 | 是什么意思 / 怎么用 |
|---|---|
| Protein title 例如 AetD [organism] | 该记录的蛋白名称与来源物种。名称可能来自提交者、RefSeq、UniProt 或结构数据库,因此名称相同不等于一定是同一来源记录。 |
| 239 aa protein | 蛋白长度(氨基酸数)。判断是否是完整天然蛋白、片段或结构构建体时很有用。 |
| Accession | 该蛋白记录的唯一数据库编号。后续用于重新定位这条记录和追踪 genome / contig。 |
| Nucleotide | 跳到对应的核酸 / CDS 记录。后续追踪基因组上下文时会用到。 |
| PubMed | 查看与该记录关联的论文,用于确认是否有原始功能实验。 |
| Taxonomy | 查看该蛋白来源物种的分类信息。 |
| GenPept | 打开该蛋白的详细 GenPept 文本记录,查看 accession、来源、参考文献、features 等完整注释。 |
| Identical Proteins | 查看序列完全相同的蛋白记录 / 对应关系。用于理解同一条序列为什么可能有多个 accession 或多个 genome placement。 |
| FASTA | 直接显示该条目的氨基酸 FASTA,是后续 BLAST、比对、建树真正需要的序列格式。 |
| Graphics | 以图形方式查看蛋白特征 / 注释区域;对确认结构域、注释位置等有帮助。 |
03 · RECORD PAGE
点进一个蛋白条目后看什么
进入 GenPept / Protein 详细记录后,先看下面这些字段。对建立 reference 来说,不需要逐字阅读全部内容。
| 字段 | 含义 |
|---|---|
| LOCUS | 记录名、蛋白长度、分子类型以及记录更新时间等概要信息。 |
| DEFINITION | 当前数据库给这条蛋白的名称 / 功能描述。 |
| ACCESSION / VERSION | accession 是条目的稳定编号;VERSION 带版本号,序列更新后版本可能变化。记录 reference 时建议保存带版本号的 accession。 |
| DBSOURCE | 该蛋白记录来自哪个上游核酸记录或数据库来源。 |
| SOURCE / ORGANISM | 来源物种、菌株及分类信息。这里要与已知研究对象核对。 |
| REFERENCE | 与该蛋白记录关联的论文或提交信息,可用于确认功能证据。 |
| FEATURES | 数据库记录的蛋白特征、区域、注释和 cross-reference。 |
04 · MULTIPLE RECORDS
为什么同一个蛋白会出现多个不同条目
NCBI Protein 是一个聚合入口,会显示来自不同来源数据库的蛋白记录。常见来源包括 GenBank / GenPept、RefSeq、UniProt / Swiss-Prot 以及 PDB 结构链。因此,同一个天然蛋白可能出现多个 accession;PDB 里还可能因为不同 chain 或实验构建体出现额外记录。
- GenBank / GenPept:通常对应作者或数据库提交的 CDS 翻译记录。
- RefSeq:NCBI 维护的参考 / 非冗余蛋白记录,细菌中常见
WP_...accession。 - UniProt / Swiss-Prot:来自 UniProt 的蛋白条目,可能具有更系统的功能整理与 cross-reference。
- PDB chain:结构数据库中的实验蛋白链,可能带工程残基或使用结构构建体,不一定等同于天然蛋白全长。
选择 reference 时,不需要执着于“只能保留一个数据库编号”。建议选定一个主要 accession,同时保存完整 native FASTA 和必要的 cross-reference。若多个条目物种、长度和序列完全一致,它们可以代表同一个天然蛋白的不同数据库身份。
05 · FASTA
如何查看和下载 amino-acid FASTA
方法 A:单条记录,最简单
- 在搜索结果中找到目标蛋白。
- 点击该条目下面的 FASTA。
- 页面会显示以
>开头的 FASTA header 和下面的氨基酸序列。 - 要保存文件,可使用页面右上角 Send to → File,选择 FASTA 格式后生成文件;也可以复制完整 FASTA 文本保存为
.fasta或.faa。
方法 B:一次下载多条结果
- 在搜索结果页勾选需要的蛋白记录。
- 点击页面上方 Send to。
- 选择 File。
- 在格式中选择 FASTA,然后创建 / 下载文件。
>accession protein_name [organism]
MXXXXXX...完整氨基酸序列...
MXXXXXX...完整氨基酸序列...
后续 homolog search 真正需要的是这一条完整的 native amino-acid sequence。不要误用 PDB chain 的工程构建体序列,也不要只保存网页标题或蛋白名称。
06 · FINISH
完成这一步时,你应该保存什么
- 一个主要 reference accession(最好带版本号)
- 对应的完整 amino-acid FASTA
- organism / strain 和蛋白长度
- 如果存在:GenBank / RefSeq / UniProt 等 cross-reference
- 支持该功能的原始论文或可靠数据库注释