Step 02 不在 BLAST 结果页结束。真正的目标是把 reference FASTA 经过同源搜索、结果导出、质量筛选、去冗余和 metadata 整理,最终得到一个可以直接交给多序列比对的 curated homolog FASTA。
02AHomolog search · 用 reference FASTA 搜同源蛋白
使用 NCBI Protein BLAST(blastp)建立尽可能宽的 homolog candidate pool。第一轮通常先不限制物种;结果同时看 Query Cover、E-value、% Identity 和蛋白长度,不要只按 identity 排序,也不要因为标注为 hypothetical protein 就删除。
02BExport raw hits · 导出原始 FASTA 与 Clusters metadata
BLAST 完成后先把当前候选空间“原样保存”下来,再进入 02C 筛选。探索型项目如果结果量可管理,优先建议全部导出,避免在网页上过早删除远缘候选。
- 如果使用 ClusteredNR,在结果页进入 Clusters 标签;勾选左上角 select all,选择当前所有 cluster representatives。
- 点击 Clusters 表格上方 Download → FASTA (cluster),保存为 homologs_raw.fasta。
- 打开 Select columns,在默认列基础上再勾选 Scientific Name 和 Taxid。
- 再次点击同一个 Download → Clusters Table (CSV),保存为 homologs_metadata_raw.csv;应保留 Cluster Composition、Cluster Ancestor、Cluster Representative Sequence、Scientific Name、Taxid、Max Score、Total Score、Query Coverage、E value、Percent Identity、Acc. Len、Accession。
- 同时记录 database、taxonomy filter、Max target sequences 和 RID / 搜索日期,使这批 raw hits 可以复现。
homologs_raw.fasta
homologs_metadata_raw.csv
02CHomolog QC · 结构完整性与远缘候选筛选
把 02B 的 homologs_raw.fasta 和 homologs_metadata_raw.csv 导入 NavLab Homolog QC,在浏览器本地完成 accession 一致性检查、coverage / length / E-value 筛选、远缘 full-length candidate 标记和人工复核。Percent Identity 默认只用于描述近远,不作为硬 cutoff。
- 先验证 FASTA 与 metadata 是否一一对应,并检查重复 accession、长度不一致和缺失 taxonomy。
- 默认探索规则:Query Coverage ≥ 90%;candidate / reference length ratio 约 0.75–1.25;E-value ≤ 1e-5。所有阈值都可调整,属于 QC heuristic,不是家族定义。
- 自动状态分为 KEEP / REVIEW / DROP,避免用一个硬阈值永久删除边界序列。
- 低 identity 但仍高 coverage、长度合理的候选自动标记为 ★ distant_full_length,优先进入人工检查。
INPUT · homologs_raw.fasta + homologs_metadata_raw.csv
OUTPUT · homologs_metadata_qc.csv + homologs_qc.fasta
02DRedundancy control · 控制序列冗余
去的是 sequence redundancy,不是 organism redundancy。同一物种可以存在多个不同 paralog,这些对后续系统发育和 gene neighborhood 可能非常重要。若使用 ClusteredNR,NCBI 已经做过一层聚类;若使用 nr 或得到大量高度近缘序列,再考虑按序列相似度选择 representative。
- 完全相同序列通常保留一个主要 accession,并在 metadata 中记录 cross-reference。
- 实验验证过的 reference / known homolog 即使高度相似也人工保留。
- 不要按“每个物种只留一条”这种规则机械去重。
02EMetadata curation · 建立序列信息表
把 accession 作为 sequence 与 metadata 之间的唯一 key。所有复杂信息放在 CSV 中,FASTA header 尽量保持简洁。建议至少保留下列字段:
| keep | accession | organism | length | query_cover | identity | evalue | annotation | note |
| yes / no | 数据库编号 | 来源物种 | aa | % | % | BLAST E-value | 数据库注释 | reference / known / distant / QC reason |
homologs_metadata.csv
accession = FASTA ↔ metadata key
02FFinalize FASTA · 生成用于 MSA 的干净序列集
根据 metadata 中的 keep / drop 结果生成最终 FASTA。header 推荐只保留 accession,或 accession + 简短 organism,避免把 identity、E-value 等不断变化的信息塞进 FASTA header。
homologs_curated.fasta
homologs_metadata.csv
这两个文件作为一对进入 Step 03。下一步做 Multiple Sequence Alignment 后,还要进行一次 alignment-based QC,之后才得到真正用于系统发育分析的 sequence set。
完成 Step 02 的标准
✓ 已保存原始 Clusters metadata:homologs_metadata_raw.csv
✓ 已保存未经筛选的完整候选序列:homologs_raw.fasta
✓ 已完成 coverage / length / E-value QC,并记录 keep / drop 原因
✓ 已处理 sequence redundancy,但未按物种机械去重
✓ 已建立 homologs_metadata.csv,accession 可一一对应序列
✓ 已生成可直接进入 MSA 的 homologs_curated.fasta