NCBI Protein BLAST:搜索、判断与导出
目标:完成 Step 02A–02B。先用 reference amino-acid FASTA 建立足够宽的 homolog candidate pool,再判断哪些区域属于有价值的 distant homolog space、哪些命中应只保留在 raw archive,最后从 BLAST 同时导出完整 FASTA 与结果表。
输入 reference protein FASTA
打开 Protein BLAST,把 Step 01 保存的完整 native amino-acid FASTA 粘贴到 Enter Query Sequence。也可以直接输入 NCBI accession,但为了让 workflow 的输入保持明确,推荐保留并使用 FASTA。
MXXXXXX...完整氨基酸序列...
数据库怎么选
| 数据库 / 模式 | 什么时候用 |
|---|---|
| nr | 第一轮广泛发现时优先。覆盖范围大,适合尽量不漏掉不同来源的 homolog,但结果也更冗余。 |
| ClusteredNR | 想快速看更广的序列空间时可用。它把 nr 中高度相近的序列先做聚类,减少重复命中,更适合作为快速概览。 |
| RefSeq proteins | 后续很重视 genome / contig 可追溯性时可补一轮。数据相对规整,但不能替代更广的 nr 搜索。 |
第一轮要不要限制物种
如果目标是了解一个蛋白家族的整体序列空间,第一轮建议先不限制 organism。过早限定物种可能让远缘序列或意外分支直接消失。
- 不限制物种:用于建立尽可能宽的 homolog pool。
- 限制到某个类群:用于第二轮聚焦,例如只研究 Cyanobacteria 时再增加 taxonomy filter。
- 排除某些来源:只有在明确知道为什么要排除时再使用,不要为了让结果“看起来干净”而随意过滤。
算法怎么选
| 算法 | 用途 |
|---|---|
| blastp | 默认选择。直接把 protein query 与 protein database 比较,是本 workflow 的标准起点。 |
| QuickBLASTP | 更快,适合主要寻找较高相似度序列时使用;如果目标包括较远同源,不作为唯一搜索。 |
| PSI-BLAST | 利用首轮结果迭代建立 position-specific profile,可在后续用于扩展更远同源。 |
| DELTA-BLAST | 利用保守结构域信息构建 profile,再做数据库搜索;可作为远缘同源探索的补充。 |
为什么结果常常正好是 100 条?
Max target sequences 控制 BLAST 最多返回多少个 target。它是“返回上限”,不是“数据库里一共只有这么多个 homolog”。如果设置为 100,结果页可能正好显示 100 条;这并不代表第 100 条以后就没有显著命中。
| 目的 | 建议 |
|---|---|
| 快速看近缘 homolog | 100 条可以作为初步浏览,但不能据此判断 homolog space 已经搜完。 |
| 准备 representative set / 建树 | 如果第 100 条仍然是高 coverage、很小 E-value 的全长匹配,建议把上限提高到 500 或 1000 后重新搜索,再从更大的候选池中筛 representative。 |
| 探索更远 homolog | 先提高返回数量;如果增加数量后仍然看不到目标距离,再考虑 PSI-BLAST、HMMER 等 profile-based 方法。 |
怎么判断“100 条是不是够了”
- 看最后几条 hit,不要只看前几条。
- 如果尾部 hit 仍然有接近全长的 Query Cover,E-value 仍然很小,说明结果很可能只是被 Max target sequences 截断。
- 如果尾部开始出现低 coverage、异常长度、接近统计边界的 E-value,说明已经逐渐进入噪声或远缘边界,未必需要盲目继续增加数量。
- 每次改变 Max target sequences,都把这个参数记录进 metadata / 实验记录;它决定了你实际观察到的 sequence space 有多宽。
怎么找到真正值得保留的远缘 homolog 区域
不要把“排名靠后”或“identity 低”直接等同于噪声。真正有价值的 distant homolog 往往表现为:% Identity 已经明显下降,但仍然保持接近全长的 Query Cover、合理的蛋白长度和很强的 E-value。这是从近缘家族逐渐进入远缘同源空间的典型信号。
| 看到什么 | 怎么处理 |
|---|---|
| 高 coverage + 长度接近 reference + E-value 很小 即使 identity 只有约 25–35% | 优先保留。这是最值得进入 MSA / phylogeny 的 distant homolog 区域。 |
| identity 下降,但 coverage 和长度仍稳定 | 继续向后看,不要因为低 identity 提前截断。重点找“仍像一个完整同家族蛋白”的尾部区域。 |
| 长度突然变成 reference 的数倍,或明显出现 fusion / multi-domain 蛋白 | 从主 full-length homolog set 中先标记或排除,但保留在 raw archive。若研究 fusion/domain evolution,可另行分析。 |
| Query Cover 明显下降,只剩一个局部片段能比上 | 通常不适合直接与完整 reference 一起建主树;先检查 pairwise alignment / domain,再决定是否保留。 |
| E-value 逐渐接近统计边界,同时 coverage、长度也开始失真 | 通常已进入低价值尾部。可以停止继续扩大普通 blastp,或改用 profile-based 方法专门找远缘同源。 |
一个实用判断顺序
- 先看 Query Cover:是不是接近完整 query。
- 再看 subject length:是不是还像这个蛋白家族,而不是明显 fragment / fusion。
- 再看 E-value:序列关系的统计证据是否仍然很强。
- 最后才用 % Identity 描述“近还是远”;不要拿 identity 单独做 family cutoff。
要不要在 BLAST 页面里先删?
探索型项目通常不建议在 BLAST 页面里做不可逆的精细筛选。如果结果量还能管理,最稳妥的方法是:先把当前返回的结果全部下载为 raw FASTA + Clusters metadata table,再在 02C 用 metadata 批量筛。这样远缘候选不会因为一次人工判断被永久丢掉。
当前 ClusteredNR 结果页怎么看
你现在使用的是 ClusteredNR,结果页主标签显示为 Clusters,表头是 Clusters producing significant alignments。因此本教程以下以当前这个界面为准;如果以后换成 nr / RefSeq 或切回 Traditional Results,界面上可能会出现 Descriptions 这样的旧/另一种表述。
| 结果列 | 怎么理解 |
|---|---|
| Cluster Representative Sequence | 当前 ClusteredNR 中每个 cluster 的代表序列名称与来源。它不是整个 cluster 的全部成员,只是代表序列;不能因为写着 hypothetical protein 就删除。 |
| Cluster Composition | 显示该 cluster 包含多少 member(s) 和 organism(s)。点击左侧“+”可展开 cluster contents;主流程先用 representative 做 sequence-space sampling 即可。 |
| Cluster Ancestor | 该 cluster 的分类学祖先层级,用来快速判断主要来源类群。 |
| Max Score | 最佳局部比对片段的得分。更适合比较命中的强弱,不直接等同于功能。 |
| Total Score | 该 subject 对 query 的所有对齐片段的总得分。 |
| Query Cover | query 有多少比例被 subject 的比对覆盖。判断是否只是局部 domain 命中特别重要。 |
| E value | 在当前数据库规模下随机得到同等或更好匹配的期望次数;越小,序列相似性的统计证据越强。 |
| Per. Ident | 对齐区域中的相同氨基酸比例。必须和 Query Cover、长度一起看。 |
| Accession | candidate 的数据库编号,是后续追踪序列、物种、genome 和 gene neighborhood 的关键指针。 |
在 BLAST 结果页里怎么把 02B 的两个原始文件导出来
02B 的原则是:序列和表格必须一起导出。只下载 FASTA 会丢掉 coverage、identity、E-value 等筛选依据;只下载表格又没有后续 MSA 所需的完整序列。
推荐做法:从 Clusters 表全部导出,再在 02C 离线筛选
- 停留在结果页的 Clusters 标签。表格标题应是 Clusters producing significant alignments。
- 勾选左上角 select all。如果设置了 1000 个返回结果,页面会显示 1000 clusters selected。
- 点击这个 Clusters 表格上方的 Download 下拉菜单。
- 选择 FASTA (cluster)。这是当前所选 cluster representative sequences 的 FASTA;下载后保存为
homologs_raw.fasta。 - 打开 Select columns,在默认列基础上再勾选 Scientific Name 和 Taxid;保留 Cluster Composition、Cluster Ancestor、Cluster Representative Sequence、Max Score、Total Score、Query Coverage、E value、Percent Identity、Acc. Len、Accession。
- 再次打开同一个 Download 菜单,选择 Clusters Table (CSV);下载后保存为
homologs_metadata_raw.csv。
Select columns 应该勾哪些
为了让 02C 不再回头补信息,建议在导出 Clusters Table (CSV) 前把下面这些列保留。默认已显示的大部分列不用动,额外把 Scientific Name 和 Taxid 勾上。
| 列 | 用途 |
|---|---|
| Cluster Composition | 记录 cluster 中 member / organism 数量,后续判断冗余程度。 |
| Cluster Ancestor | 快速查看分类学来源。 |
| Cluster Representative Sequence | 保留代表蛋白名称与来源描述。 |
| Scientific Name | 额外勾选。后续做物种、谱系和 gene neighborhood 追踪。 |
| Taxid | 额外勾选。作为稳定 taxonomy identifier,便于程序化整理。 |
| Max Score / Total Score | 保留 BLAST score 信息。 |
| Query Coverage | 02C 判断是否接近全长 homolog 的核心指标。 |
| E value | 判断序列相似性的统计显著性。 |
| Percent Identity | 描述 homolog 的近远程度,但不单独作为 cutoff。 |
| Acc. Len | 02C 识别 fragment / fusion / 异常长度。 |
| Accession | 连接 FASTA、metadata 和后续 genome / gene neighborhood 的主键。 |
Download 菜单里这些选项分别是什么
| 选项 | 02B 是否需要 |
|---|---|
| FASTA (cluster) | 需要。当前选中的 cluster representative sequences;作为 homologs_raw.fasta。 |
| FASTA (aligned clusters) | 暂时不需要。它是已经按 BLAST alignment 处理的序列,不作为后续正式 MSA 的原始输入。 |
| Clusters Table (CSV) | 需要。作为 homologs_metadata_raw.csv,直接保留 cluster、taxonomy、Query Coverage、E-value、Percent Identity、Acc. Len 和 Accession 等信息,是 02C 的主 metadata 表。 |
| GenBank (cluster) | 可选。需要查看 cluster representative 的详细注释时再保存。 |
页面顶部的 Download All 要不要用
顶部 RID 旁边还有一个 Download All。它可以导出整个 BLAST job 的多种结果格式,但当前 02B 最清楚、最不容易混淆的做法是:直接使用 Clusters 表格自己的 Download 菜单,分别下载 FASTA (cluster) 和 Clusters Table (CSV)。
如果只想导出一部分
取消 select all,只勾选需要的 cluster rows,再用同一个 Download 菜单导出即可。但在尚未完成 QC 的探索型项目中,优先建议把当前返回的全部 clusters 先保存下来,再在本地根据 metadata 做 keep / drop。
Clusters 数量和 Alignments 数量不是一回事
结果页可以显示 1000 个 Clusters,但 Alignments 标签中详细展开的 pairwise alignments 数量可能另有上限。前者决定你在主结果表里看到多少个 cluster hits;后者只影响能直接展开查看多少个详细 alignment。不要因为后半部分没有 detailed alignment 展开,就认为这些 cluster hit 不存在。
再保存一份“可追溯信息”
- query accession / FASTA
- database(例如 ClusteredNR / nr / RefSeq)
- algorithm(blastp)
- taxonomy filter
- Max target sequences
- RID 或结果页面保存文件(BLAST 在线结果会过期)
homologs_raw.fasta + homologs_metadata_raw.csv 才是后续 02C–02F 的 raw source of truth。完成 02A–02B 后,交给 02C 什么
- reference FASTA 和本次 BLAST 的基本搜索条件,包括 database、algorithm、taxonomy filter 与 Max target sequences
- 候选 homolog 的 accession 与 organism
- Query Cover、E-value、% Identity、蛋白长度
- homologs_raw.fasta:当前候选 hits 的完整蛋白序列
- homologs_metadata_raw.csv:从 Clusters Table (CSV) 导出的原始 metadata,与 FASTA 中的 cluster representatives 一一对应