基因组组装

全基因组de novo组装

技术服务

基因组组装

全基因组de novo组装

📝 服务介绍

基因组组装利用三代测序(PacBio HiFi/Oxford Nanopore)长读长数据结合Hi-C辅助支架化,对未有参考基因组的物种进行de novo基因组组装,构建染色体级别基因组。

🔬 实验原理

基因组组装分析原理:基因组组装将测序reads拼接为更长的contigs/scaffolds/chromosomes。短reads(Illumina)适合高准确度组装,长reads(PacBio/Nanopore)解决重复序列和gap。Hi-C数据辅助染色体级别组装。组装质量评估包括N50/完整性/准确性。

📋 应用领域

  • 基因组从头组装(de novo)
  • 细菌/病毒完整基因组组装
  • 组装质量评估(QUAST等)
  • 基因结构注释与功能预测
  • 比较基因组/核心基因组pangenome
  • 宏基因组组装与分箱

⭐ 服务优势

  • 三代测序:长读长高连续性
  • Hi-C支架化:染色体级别组装
  • 多平台整合:PacBio+Illumina+Hi-C
  • 注释完整:基因预测和功能注释

🔄 服务流程

  1. 数据质控(PacBio HiFi/ONT+Illumina+Hi-C)
  2. 基因组评估(基因组大小/杂合度/K-mer分析)
  3. 长读长组装(hifiasm/flye)
  4. Illumina抛光(Pilon/NextPolish)
  5. Hi-C支架化(Juicer/3D-DNA)
  6. 基因预测(BRAKER/Augustus)
  7. 功能注释(eggNOG/InterPro/KEGG)
  8. 评估报告

📋 服务详情 / 客户提供

项目要求
数据类型PacBio HiFi/ONT/Illumina/Hi-C FASTQ
物种信息物种名称/基因组大小估计/杂合度
组装目标Contig N50/染色体级别
注释需求基因预测/功能注释/比较基因组
特殊要求叶绿体/线粒体基因组

📊 结果展示

基因组组装报告(含组装统计Contig/Scaffold N50、BUSCO评估、基因注释结果、基因组图谱)。

📦 最终交付

基因组组装报告(含组装统计Contig/Scaffold N50、BUSCO评估、基因注释结果、基因组图谱)。

Q: 基因组组装需要多少测序数据

PacBio HiFi建议30-50x覆盖度(取决于基因组大小);Illumina 100x抛光;Hi-C 100x。例如1Gb基因组需HiFi 30-50Gb+Illumina 100Gb+Hi-C 100Gb。具体量取决于基因组复杂度。

Q: 如何评估基因组组装质量

Contig N50(连续性)、BUSCO完整度(基因完整性>95%为优秀)、LAI指数(重复序列组装质量)、Mer评估(k-mer一致性)。染色体级别还需评估Hi-C heatmap连续性和染色体数目正确性。

Q: 基因组组装怎么做

1)DNA提取(HMW DNA: PacBio/Nanopore需高分子量DNA>20kb);2)测序: Illumina PE150(短reads高准确度)+PacBio HiFi/Nanopore(长reads跨重复)+Hi-C(染色体构型); 3)组装: 短reads(SParse/SPAdes)或长reads(Flye/wtdbg2/Canu/Raven);4)抛光: Illumina reads抛光(Polca/Racon);5)Hi-C scaffold(Juicer/3D-DNA)→染色体级别组装;6)评估(QUAST/BUSCO: N50/完整性/准确性)。

Q: 基因组组装质量怎么评估

1)N50/NG50(50%基因组组装的最短contig/scaffold长度, 越大越好);2)BUSCO(Benchmarking Universal Single-Copy Orthologs: 保守单拷贝基因完整性>90%为好);3)Complete BUSCO(C:95%+ S:90% D:1% 为高质量);4)LAI(LTR Assembly Index: 逆转录转子完整性, >10为高质量);5)Merqury(k-mer准确性: QV>40为高质量);6)CG含量/Contamination(去细菌/宿主污染)。

Q: 基因组组装和基因组重测序区别

基因组组装: 从头组装(de novo assembly)无参考基因组,拼接reads构建新基因组(适合新物种/高度变异)。基因组重测序(Resequencing): 已有参考基因组,将reads比对到参考基因组→检测变异(SNP/InDel/CNV/SV)。新物种选组装(无参考),已知物种选重测序(经济)。建议先重测序(经济)→如有需求再组装(高质量参考)。

Q: 基因组组装需要多少数据

Illumina: 100-200×覆盖度(PE150)。PacBio HiFi: 20-30×覆盖度(HiFi reads 10-20kb准确度>99%)。Nanopore: 30-50×覆盖度(ultra-long reads 100kb+)。Hi-C: 100-200×覆盖度(染色体级别scaffold)。建议Illumina 100× + PacBio HiFi 20× + Hi-C 100×(高质量基因组)。

Q: 基因组组装能做什么

1)新物种基因组(植物/动物/微生物从头组装);2)高质量参考基因组(长reads+Hi-C);3)泛基因组(Pan-genome: 多个体组装→结构变异/基因Presence/Absence);4)单倍型组装(Hifiasm: 二倍体两套单倍型分别组装);5)细胞器基因组(叶绿体/线粒体组装)。建议长reads(PacBio HiFi)+Hi-C(染色体级别)。

技术服务
分子与免疫实验技术服务
细胞生物学技术服务
病理技术服务
动物实验技术服务
类器官技术服务
分子互作技术服务
蛋白组学技术服务
生信分析服务