NNavLab返回 Step 02返回首页
TOOL TUTORIAL

NCBI Protein BLAST:搜索、判断与导出

目标:完成 Step 02A–02B。先用 reference amino-acid FASTA 建立足够宽的 homolog candidate pool,再判断哪些区域属于有价值的 distant homolog space、哪些命中应只保留在 raw archive,最后从 BLAST 同时导出完整 FASTA 与结果表。

01 · QUERY

输入 reference protein FASTA

打开 Protein BLAST,把 Step 01 保存的完整 native amino-acid FASTA 粘贴到 Enter Query Sequence。也可以直接输入 NCBI accession,但为了让 workflow 的输入保持明确,推荐保留并使用 FASTA。

>reference_accession protein_name [organism]
MXXXXXX...完整氨基酸序列...
不要使用 PDB chain 的工程构建体序列作为默认 query;优先使用天然蛋白完整序列。
02 · DATABASE

数据库怎么选

数据库 / 模式什么时候用
nr第一轮广泛发现时优先。覆盖范围大,适合尽量不漏掉不同来源的 homolog,但结果也更冗余。
ClusteredNR想快速看更广的序列空间时可用。它把 nr 中高度相近的序列先做聚类,减少重复命中,更适合作为快速概览。
RefSeq proteins后续很重视 genome / contig 可追溯性时可补一轮。数据相对规整,但不能替代更广的 nr 搜索。
推荐流程:先用较广数据库建立候选池,再根据后续任务决定是否补做 RefSeq 或特定类群搜索。不要因为一个数据库更“干净”就假设它包含所有相关序列。
03 · TAXONOMY FILTER

第一轮要不要限制物种

如果目标是了解一个蛋白家族的整体序列空间,第一轮建议先不限制 organism。过早限定物种可能让远缘序列或意外分支直接消失。

  • 不限制物种:用于建立尽可能宽的 homolog pool。
  • 限制到某个类群:用于第二轮聚焦,例如只研究 Cyanobacteria 时再增加 taxonomy filter。
  • 排除某些来源:只有在明确知道为什么要排除时再使用,不要为了让结果“看起来干净”而随意过滤。
04 · PROGRAM

算法怎么选

算法用途
blastp默认选择。直接把 protein query 与 protein database 比较,是本 workflow 的标准起点。
QuickBLASTP更快,适合主要寻找较高相似度序列时使用;如果目标包括较远同源,不作为唯一搜索。
PSI-BLAST利用首轮结果迭代建立 position-specific profile,可在后续用于扩展更远同源。
DELTA-BLAST利用保守结构域信息构建 profile,再做数据库搜索;可作为远缘同源探索的补充。
这个 workflow 的 Step 02 先用普通 blastp。如果后面发现 30% 左右的远缘序列明显找不全,再进入 profile-based search,而不是一开始就把所有方法混在一起。
05 · MAX TARGET SEQUENCES

为什么结果常常正好是 100 条?

Max target sequences 控制 BLAST 最多返回多少个 target。它是“返回上限”,不是“数据库里一共只有这么多个 homolog”。如果设置为 100,结果页可能正好显示 100 条;这并不代表第 100 条以后就没有显著命中。

Algorithm parameters→Max target sequences→100 / 500 / 1000…
目的建议
快速看近缘 homolog100 条可以作为初步浏览,但不能据此判断 homolog space 已经搜完。
准备 representative set / 建树如果第 100 条仍然是高 coverage、很小 E-value 的全长匹配,建议把上限提高到 500 或 1000 后重新搜索,再从更大的候选池中筛 representative。
探索更远 homolog先提高返回数量;如果增加数量后仍然看不到目标距离,再考虑 PSI-BLAST、HMMER 等 profile-based 方法。

怎么判断“100 条是不是够了”

  1. 看最后几条 hit,不要只看前几条。
  2. 如果尾部 hit 仍然有接近全长的 Query Cover,E-value 仍然很小,说明结果很可能只是被 Max target sequences 截断。
  3. 如果尾部开始出现低 coverage、异常长度、接近统计边界的 E-value,说明已经逐渐进入噪声或远缘边界,未必需要盲目继续增加数量。
  4. 每次改变 Max target sequences,都把这个参数记录进 metadata / 实验记录;它决定了你实际观察到的 sequence space 有多宽。
示例:如果第 100 条仍然是约 97% Query Cover、E-value 远小于 1、并且蛋白长度接近 reference,那么“100”更像是返回上限,而不是自然边界。这时应先扩大 Max target sequences,再决定后续怎么筛。
06 · DISTANT HOMOLOG ZONE

怎么找到真正值得保留的远缘 homolog 区域

不要把“排名靠后”或“identity 低”直接等同于噪声。真正有价值的 distant homolog 往往表现为:% Identity 已经明显下降,但仍然保持接近全长的 Query Cover、合理的蛋白长度和很强的 E-value。这是从近缘家族逐渐进入远缘同源空间的典型信号。

看到什么怎么处理
高 coverage + 长度接近 reference + E-value 很小
即使 identity 只有约 25–35%
优先保留。这是最值得进入 MSA / phylogeny 的 distant homolog 区域。
identity 下降,但 coverage 和长度仍稳定继续向后看,不要因为低 identity 提前截断。重点找“仍像一个完整同家族蛋白”的尾部区域。
长度突然变成 reference 的数倍,或明显出现 fusion / multi-domain 蛋白从主 full-length homolog set 中先标记或排除,但保留在 raw archive。若研究 fusion/domain evolution,可另行分析。
Query Cover 明显下降,只剩一个局部片段能比上通常不适合直接与完整 reference 一起建主树;先检查 pairwise alignment / domain,再决定是否保留。
E-value 逐渐接近统计边界,同时 coverage、长度也开始失真通常已进入低价值尾部。可以停止继续扩大普通 blastp,或改用 profile-based 方法专门找远缘同源。

一个实用判断顺序

  1. 先看 Query Cover:是不是接近完整 query。
  2. 再看 subject length:是不是还像这个蛋白家族,而不是明显 fragment / fusion。
  3. 再看 E-value:序列关系的统计证据是否仍然很强。
  4. 最后才用 % Identity 描述“近还是远”;不要拿 identity 单独做 family cutoff。
实际例子:对一个约 239 aa 的 reference,若 rank ~600 的 hit 仍有 96% Query Cover、232 aa、E-value 4e-30、identity 约 30%,它是很有价值的 distant homolog candidate;如果再往后出现 600–700 aa 的长蛋白,即使局部 BLAST 仍显著,也更适合先放入 QC / side set,而不是直接混进主 full-length tree。

要不要在 BLAST 页面里先删?

探索型项目通常不建议在 BLAST 页面里做不可逆的精细筛选。如果结果量还能管理,最稳妥的方法是:先把当前返回的结果全部下载为 raw FASTA + Clusters metadata table,再在 02C 用 metadata 批量筛。这样远缘候选不会因为一次人工判断被永久丢掉。

如果使用 ClusteredNR,这里的每一行主要是一个 cluster representative,不等于数据库里的每一条原始蛋白;因此“下载全部当前结果”本身已经是一种初步降冗余的 sequence-space sampling。
07 · RESULTS

当前 ClusteredNR 结果页怎么看

你现在使用的是 ClusteredNR,结果页主标签显示为 Clusters,表头是 Clusters producing significant alignments。因此本教程以下以当前这个界面为准;如果以后换成 nr / RefSeq 或切回 Traditional Results,界面上可能会出现 Descriptions 这样的旧/另一种表述。

结果列怎么理解
Cluster Representative Sequence当前 ClusteredNR 中每个 cluster 的代表序列名称与来源。它不是整个 cluster 的全部成员,只是代表序列;不能因为写着 hypothetical protein 就删除。
Cluster Composition显示该 cluster 包含多少 member(s) 和 organism(s)。点击左侧“+”可展开 cluster contents;主流程先用 representative 做 sequence-space sampling 即可。
Cluster Ancestor该 cluster 的分类学祖先层级,用来快速判断主要来源类群。
Max Score最佳局部比对片段的得分。更适合比较命中的强弱,不直接等同于功能。
Total Score该 subject 对 query 的所有对齐片段的总得分。
Query Coverquery 有多少比例被 subject 的比对覆盖。判断是否只是局部 domain 命中特别重要。
E value在当前数据库规模下随机得到同等或更好匹配的期望次数;越小,序列相似性的统计证据越强。
Per. Ident对齐区域中的相同氨基酸比例。必须和 Query Cover、长度一起看。
Accessioncandidate 的数据库编号,是后续追踪序列、物种、genome 和 gene neighborhood 的关键指针。
不要只按 % identity 排序。例如一个只有 25% query coverage 的 70% identity hit,可能不如一个覆盖接近全长、identity 只有 35–40% 的 hit 更适合作为完整 homolog 候选。还要特别检查结果表最后几条:它们决定你是否已经接近搜索边界,还是只是被 Max target sequences 截断。
08 · STEP 02B · EXPORT RAW HITS

在 BLAST 结果页里怎么把 02B 的两个原始文件导出来

02B 的原则是:序列和表格必须一起导出。只下载 FASTA 会丢掉 coverage、identity、E-value 等筛选依据;只下载表格又没有后续 MSA 所需的完整序列。

推荐做法:从 Clusters 表全部导出,再在 02C 离线筛选

  1. 停留在结果页的 Clusters 标签。表格标题应是 Clusters producing significant alignments。
  2. 勾选左上角 select all。如果设置了 1000 个返回结果,页面会显示 1000 clusters selected。
  3. 点击这个 Clusters 表格上方的 Download 下拉菜单。
  4. 选择 FASTA (cluster)。这是当前所选 cluster representative sequences 的 FASTA;下载后保存为 homologs_raw.fasta。
  5. 打开 Select columns,在默认列基础上再勾选 Scientific Name 和 Taxid;保留 Cluster Composition、Cluster Ancestor、Cluster Representative Sequence、Max Score、Total Score、Query Coverage、E value、Percent Identity、Acc. Len、Accession。
  6. 再次打开同一个 Download 菜单,选择 Clusters Table (CSV);下载后保存为 homologs_metadata_raw.csv。
Clusters→select all→FASTA (cluster)+Select columns→Clusters Table (CSV)
当前这个界面不要找 “Descriptions”。你使用 ClusteredNR 时主结果页就是 Clusters。本教程之前写的 “Descriptions → Download → FASTA (complete sequence)” 更适合另一种 / 旧结果界面,现在已统一改成你实际看到的 Clusters → Download → FASTA (cluster)。

Select columns 应该勾哪些

为了让 02C 不再回头补信息,建议在导出 Clusters Table (CSV) 前把下面这些列保留。默认已显示的大部分列不用动,额外把 Scientific Name 和 Taxid 勾上。

列用途
Cluster Composition记录 cluster 中 member / organism 数量,后续判断冗余程度。
Cluster Ancestor快速查看分类学来源。
Cluster Representative Sequence保留代表蛋白名称与来源描述。
Scientific Name额外勾选。后续做物种、谱系和 gene neighborhood 追踪。
Taxid额外勾选。作为稳定 taxonomy identifier,便于程序化整理。
Max Score / Total Score保留 BLAST score 信息。
Query Coverage02C 判断是否接近全长 homolog 的核心指标。
E value判断序列相似性的统计显著性。
Percent Identity描述 homolog 的近远程度,但不单独作为 cutoff。
Acc. Len02C 识别 fragment / fusion / 异常长度。
Accession连接 FASTA、metadata 和后续 genome / gene neighborhood 的主键。

Download 菜单里这些选项分别是什么

选项02B 是否需要
FASTA (cluster)需要。当前选中的 cluster representative sequences;作为 homologs_raw.fasta。
FASTA (aligned clusters)暂时不需要。它是已经按 BLAST alignment 处理的序列,不作为后续正式 MSA 的原始输入。
Clusters Table (CSV)需要。作为 homologs_metadata_raw.csv,直接保留 cluster、taxonomy、Query Coverage、E-value、Percent Identity、Acc. Len 和 Accession 等信息,是 02C 的主 metadata 表。
GenBank (cluster)可选。需要查看 cluster representative 的详细注释时再保存。

页面顶部的 Download All 要不要用

顶部 RID 旁边还有一个 Download All。它可以导出整个 BLAST job 的多种结果格式,但当前 02B 最清楚、最不容易混淆的做法是:直接使用 Clusters 表格自己的 Download 菜单,分别下载 FASTA (cluster) 和 Clusters Table (CSV)。

如果只想导出一部分

取消 select all,只勾选需要的 cluster rows,再用同一个 Download 菜单导出即可。但在尚未完成 QC 的探索型项目中,优先建议把当前返回的全部 clusters 先保存下来,再在本地根据 metadata 做 keep / drop。

Clusters 数量和 Alignments 数量不是一回事

结果页可以显示 1000 个 Clusters,但 Alignments 标签中详细展开的 pairwise alignments 数量可能另有上限。前者决定你在主结果表里看到多少个 cluster hits;后者只影响能直接展开查看多少个详细 alignment。不要因为后半部分没有 detailed alignment 展开,就认为这些 cluster hit 不存在。

再保存一份“可追溯信息”

  • query accession / FASTA
  • database(例如 ClusteredNR / nr / RefSeq)
  • algorithm(blastp)
  • taxonomy filter
  • Max target sequences
  • RID 或结果页面保存文件(BLAST 在线结果会过期)
02B 完成后不要再依赖浏览器页面作为唯一记录。从这里开始,homologs_raw.fasta + homologs_metadata_raw.csv 才是后续 02C–02F 的 raw source of truth。
09 · HANDOFF

完成 02A–02B 后,交给 02C 什么

  • reference FASTA 和本次 BLAST 的基本搜索条件,包括 database、algorithm、taxonomy filter 与 Max target sequences
  • 候选 homolog 的 accession 与 organism
  • Query Cover、E-value、% Identity、蛋白长度
  • homologs_raw.fasta:当前候选 hits 的完整蛋白序列
  • homologs_metadata_raw.csv:从 Clusters Table (CSV) 导出的原始 metadata,与 FASTA 中的 cluster representatives 一一对应