基因组组装
全基因组de novo组装
📝 服务介绍
基因组组装利用三代测序(PacBio HiFi/Oxford Nanopore)长读长数据结合Hi-C辅助支架化,对未有参考基因组的物种进行de novo基因组组装,构建染色体级别基因组。
🔬 实验原理
基因组组装分析原理:基因组组装将测序reads拼接为更长的contigs/scaffolds/chromosomes。短reads(Illumina)适合高准确度组装,长reads(PacBio/Nanopore)解决重复序列和gap。Hi-C数据辅助染色体级别组装。组装质量评估包括N50/完整性/准确性。
📋 应用领域
- 基因组从头组装(de novo)
- 细菌/病毒完整基因组组装
- 组装质量评估(QUAST等)
- 基因结构注释与功能预测
- 比较基因组/核心基因组pangenome
- 宏基因组组装与分箱
⭐ 服务优势
- 三代测序:长读长高连续性
- Hi-C支架化:染色体级别组装
- 多平台整合:PacBio+Illumina+Hi-C
- 注释完整:基因预测和功能注释
🔄 服务流程
- 数据质控(PacBio HiFi/ONT+Illumina+Hi-C)
- 基因组评估(基因组大小/杂合度/K-mer分析)
- 长读长组装(hifiasm/flye)
- Illumina抛光(Pilon/NextPolish)
- Hi-C支架化(Juicer/3D-DNA)
- 基因预测(BRAKER/Augustus)
- 功能注释(eggNOG/InterPro/KEGG)
- 评估报告
📋 服务详情 / 客户提供
| 项目 | 要求 |
|---|---|
| 数据类型 | PacBio HiFi/ONT/Illumina/Hi-C FASTQ |
| 物种信息 | 物种名称/基因组大小估计/杂合度 |
| 组装目标 | Contig N50/染色体级别 |
| 注释需求 | 基因预测/功能注释/比较基因组 |
| 特殊要求 | 叶绿体/线粒体基因组 |
📊 结果展示
基因组组装报告(含组装统计Contig/Scaffold N50、BUSCO评估、基因注释结果、基因组图谱)。
📦 最终交付
基因组组装报告(含组装统计Contig/Scaffold N50、BUSCO评估、基因注释结果、基因组图谱)。
Q: 基因组组装需要多少测序数据
PacBio HiFi建议30-50x覆盖度(取决于基因组大小);Illumina 100x抛光;Hi-C 100x。例如1Gb基因组需HiFi 30-50Gb+Illumina 100Gb+Hi-C 100Gb。具体量取决于基因组复杂度。
Q: 如何评估基因组组装质量
Contig N50(连续性)、BUSCO完整度(基因完整性>95%为优秀)、LAI指数(重复序列组装质量)、Mer评估(k-mer一致性)。染色体级别还需评估Hi-C heatmap连续性和染色体数目正确性。
Q: 基因组组装怎么做
1)DNA提取(HMW DNA: PacBio/Nanopore需高分子量DNA>20kb);2)测序: Illumina PE150(短reads高准确度)+PacBio HiFi/Nanopore(长reads跨重复)+Hi-C(染色体构型); 3)组装: 短reads(SParse/SPAdes)或长reads(Flye/wtdbg2/Canu/Raven);4)抛光: Illumina reads抛光(Polca/Racon);5)Hi-C scaffold(Juicer/3D-DNA)→染色体级别组装;6)评估(QUAST/BUSCO: N50/完整性/准确性)。
Q: 基因组组装质量怎么评估
1)N50/NG50(50%基因组组装的最短contig/scaffold长度, 越大越好);2)BUSCO(Benchmarking Universal Single-Copy Orthologs: 保守单拷贝基因完整性>90%为好);3)Complete BUSCO(C:95%+ S:90% D:1% 为高质量);4)LAI(LTR Assembly Index: 逆转录转子完整性, >10为高质量);5)Merqury(k-mer准确性: QV>40为高质量);6)CG含量/Contamination(去细菌/宿主污染)。
Q: 基因组组装和基因组重测序区别
基因组组装: 从头组装(de novo assembly)无参考基因组,拼接reads构建新基因组(适合新物种/高度变异)。基因组重测序(Resequencing): 已有参考基因组,将reads比对到参考基因组→检测变异(SNP/InDel/CNV/SV)。新物种选组装(无参考),已知物种选重测序(经济)。建议先重测序(经济)→如有需求再组装(高质量参考)。
Q: 基因组组装需要多少数据
Illumina: 100-200×覆盖度(PE150)。PacBio HiFi: 20-30×覆盖度(HiFi reads 10-20kb准确度>99%)。Nanopore: 30-50×覆盖度(ultra-long reads 100kb+)。Hi-C: 100-200×覆盖度(染色体级别scaffold)。建议Illumina 100× + PacBio HiFi 20× + Hi-C 100×(高质量基因组)。
Q: 基因组组装能做什么
1)新物种基因组(植物/动物/微生物从头组装);2)高质量参考基因组(长reads+Hi-C);3)泛基因组(Pan-genome: 多个体组装→结构变异/基因Presence/Absence);4)单倍型组装(Hifiasm: 二倍体两套单倍型分别组装);5)细胞器基因组(叶绿体/线粒体组装)。建议长reads(PacBio HiFi)+Hi-C(染色体级别)。