NNavLab全部科研返回首页
RESEARCH WORKFLOWS

科研工作流

不直接替代外部分析平台,而是把一个科学问题拆成连续步骤:每一步说明目标、输入、输出、判断节点以及可选工具,再跳转到成熟工具完成计算。

WORKFLOW LIBRARY

工作流工作区

先把页面入口和整体框架建立起来。第一条工作流将从我们正在讨论的 AetD 场景开始,做成通用的 Gene Neighborhood Mining,而不是 AetD 专用工具。

Gene Neighborhood Mining从目标蛋白 / homolog 出发,定位基因组上下文并形成潜在功能基因簇假说。下一步在这里继续完善。
Protein Family Mining预留:从 seed sequence 到 homolog space、聚类与代表序列。
Phylogenetic Analysis预留:从 FASTA 到可解释的系统发育树。
BGC Mining预留:从 genome / contig 到 biosynthetic hypothesis。
GENE NEIGHBORHOOD MINING

从一个蛋白名称到基因邻域假说

先从最基础的信息开始:如果目前只有一个酶或蛋白的名字,第一件事不是建树,而是确定一个可信、可追溯的参考序列。
01

从蛋白 / 酶名称到可信参考序列

Establish a reference sequence

目标是把一个名称变成一个可以用于后续分析的明确 reference。这里最终不是只拿“一个编号”,也不是只拿“一条序列”,而是建立一个可追溯的 Reference Protein Record:以天然蛋白的完整氨基酸序列作为后续计算输入,同时保留 accession 作为数据库身份与来源指针。

INPUT蛋白 / 酶名称;如果已知,可附物种、菌株、天然产物或原始论文。
GOAL排除同名但不同功能的条目,锁定一个有可靠来源的参考蛋白。
OUTPUTReference Protein Record = reference accession + native amino-acid FASTA + organism/strain + 功能依据;如存在多个等价条目,同时记录 cross-reference。

怎么做

  1. 先直接用蛋白 / 酶名称检索;如果结果过多或出现明显无关条目,再加入物种、菌株、产物或通路名称缩小范围。
  2. 找到与已知功能和物种一致的天然蛋白条目。若出现多个数据库记录,不必立即把它们视为不同蛋白,先比较物种、长度和完整序列是否一致。
  3. 选定一个主要 reference accession,并保存对应的完整 native amino-acid FASTA;同时记录 organism / strain 和蛋白长度。
  4. 用第二个数据库或原始论文交叉确认功能;如果同一蛋白在 GenBank / RefSeq / UniProt 等有多个 accession,可把这些 cross-reference 一并记录。

完成这一步的标准

✓ 已选定一个主要 reference accession,用于身份与来源追踪
✓ 已保存对应的完整 native amino-acid FASTA,用于下一步同源搜索
✓ 已记录 organism / strain、蛋白长度及必要的 cross-reference
✓ 已有原始论文或可靠数据库注释支持其目标功能
这一步真正要带走的东西:后续 BLAST / HMM 等计算真正使用的是 native amino-acid FASTA;accession 的作用是让这条序列保持可追溯,并能在后续重新找到物种、基因组和基因邻域。因此 reference sequence 与 reference accession 应作为一对保存。蛋白名称只负责帮助找到这个 reference,不用于定义整个蛋白家族。
02

构建同源蛋白候选序列集

Build a curated homolog set

Step 02 不在 BLAST 结果页结束。真正的目标是把 reference FASTA 经过同源搜索、结果导出、质量筛选、去冗余和 metadata 整理,最终得到一个可以直接交给多序列比对的 curated homolog FASTA。

INPUTStep 01 的 reference accession + native amino-acid FASTA。
GOAL建立足够宽、可追溯、不过度冗余的 homolog candidate set;暂不凭蛋白名称或单一 identity 阈值判断功能。
OUTPUThomologs_curated.fasta + homologs_metadata.csv,并保留原始 BLAST 结果用于追溯。
02AHomolog search · 用 reference FASTA 搜同源蛋白

使用 NCBI Protein BLAST(blastp)建立尽可能宽的 homolog candidate pool。第一轮通常先不限制物种;结果同时看 Query Cover、E-value、% Identity 和蛋白长度,不要只按 identity 排序,也不要因为标注为 hypothetical protein 就删除。

02BExport raw hits · 导出原始 FASTA 与 Clusters metadata

BLAST 完成后先把当前候选空间“原样保存”下来,再进入 02C 筛选。探索型项目如果结果量可管理,优先建议全部导出,避免在网页上过早删除远缘候选。

  1. 如果使用 ClusteredNR,在结果页进入 Clusters 标签;勾选左上角 select all,选择当前所有 cluster representatives。
  2. 点击 Clusters 表格上方 Download → FASTA (cluster),保存为 homologs_raw.fasta。
  3. 打开 Select columns,在默认列基础上再勾选 Scientific Name 和 Taxid。
  4. 再次点击同一个 Download → Clusters Table (CSV),保存为 homologs_metadata_raw.csv;应保留 Cluster Composition、Cluster Ancestor、Cluster Representative Sequence、Scientific Name、Taxid、Max Score、Total Score、Query Coverage、E value、Percent Identity、Acc. Len、Accession。
  5. 同时记录 database、taxonomy filter、Max target sequences 和 RID / 搜索日期,使这批 raw hits 可以复现。
homologs_raw.fasta
homologs_metadata_raw.csv
02CHomolog QC · 结构完整性与远缘候选筛选

把 02B 的 homologs_raw.fasta 和 homologs_metadata_raw.csv 导入 NavLab Homolog QC,在浏览器本地完成 accession 一致性检查、coverage / length / E-value 筛选、远缘 full-length candidate 标记和人工复核。Percent Identity 默认只用于描述近远,不作为硬 cutoff。

  • 先验证 FASTA 与 metadata 是否一一对应,并检查重复 accession、长度不一致和缺失 taxonomy。
  • 默认探索规则:Query Coverage ≥ 90%;candidate / reference length ratio 约 0.75–1.25;E-value ≤ 1e-5。所有阈值都可调整,属于 QC heuristic,不是家族定义。
  • 自动状态分为 KEEP / REVIEW / DROP,避免用一个硬阈值永久删除边界序列。
  • 低 identity 但仍高 coverage、长度合理的候选自动标记为 ★ distant_full_length,优先进入人工检查。
INPUT · homologs_raw.fasta + homologs_metadata_raw.csv
OUTPUT · homologs_metadata_qc.csv + homologs_qc.fasta
02DRedundancy control · 控制序列冗余

去的是 sequence redundancy,不是 organism redundancy。同一物种可以存在多个不同 paralog,这些对后续系统发育和 gene neighborhood 可能非常重要。若使用 ClusteredNR,NCBI 已经做过一层聚类;若使用 nr 或得到大量高度近缘序列,再考虑按序列相似度选择 representative。

  • 完全相同序列通常保留一个主要 accession,并在 metadata 中记录 cross-reference。
  • 实验验证过的 reference / known homolog 即使高度相似也人工保留。
  • 不要按“每个物种只留一条”这种规则机械去重。
02EMetadata curation · 建立序列信息表

把 accession 作为 sequence 与 metadata 之间的唯一 key。所有复杂信息放在 CSV 中,FASTA header 尽量保持简洁。建议至少保留下列字段:

keepaccessionorganismlengthquery_coveridentityevalueannotationnote
yes / no数据库编号来源物种aa%%BLAST E-value数据库注释reference / known / distant / QC reason
homologs_metadata.csv
accession = FASTA ↔ metadata key
02FFinalize FASTA · 生成用于 MSA 的干净序列集

根据 metadata 中的 keep / drop 结果生成最终 FASTA。header 推荐只保留 accession,或 accession + 简短 organism,避免把 identity、E-value 等不断变化的信息塞进 FASTA header。

homologs_curated.fasta
homologs_metadata.csv

这两个文件作为一对进入 Step 03。下一步做 Multiple Sequence Alignment 后,还要进行一次 alignment-based QC,之后才得到真正用于系统发育分析的 sequence set。

完成 Step 02 的标准

✓ 已保存原始 Clusters metadata:homologs_metadata_raw.csv
✓ 已保存未经筛选的完整候选序列:homologs_raw.fasta
✓ 已完成 coverage / length / E-value QC,并记录 keep / drop 原因
✓ 已处理 sequence redundancy,但未按物种机械去重
✓ 已建立 homologs_metadata.csv,accession 可一一对应序列
✓ 已生成可直接进入 MSA 的 homologs_curated.fasta
Step 02 的结束标志不是“BLAST 跑完了”。只有当 homologs_raw.fasta + homologs_metadata_raw.csv → homologs_metadata.csv → homologs_curated.fasta 这条证据链建立完成,才进入 Step 03 多序列比对。原则是:FASTA 管序列,metadata 管信息,accession 把两者连接起来。