Comparação de pipelines computacionais para montagem de genomas de procariotos com dados de Nanopore
Autor: Adriano Terra da Roza (Currículo Lattes)
Orientador: Profa. Dra. Karina dos Santos Machado
Resumo
Desde os primeiros métodos de sequenciamento de DNA, os avanços tecnológicos têm impulsionado a genômica e ampliado aplicações na medicina e na biotecnologia. Entre as tecnologias atuais, o sequenciamento nanopore destaca-se pela geração de leituras longas e pela flexibilidade operacional, exigindo, contudo, etapas computacionais robustas para obtenção de montagens genômicas de alta qualidade. Este trabalho teve como objetivo comparar pipelines computacionais para montagem de genomas de procariotos a partir de dados Nanopore. Foi realizada uma revisão sistemática da literatura para identificar as ferramentas mais utilizadas nas etapas de basecalling, controle de qualidade, filtragem, montagem e polimento. Com base nesses achados, foi estruturado um fluxo padronizado aplicado a seis organismos bacterianos (Acinetobacter pittii, Haemophilus haemolyticus, Klebsiella pneumoniae, Shigella sonnei, Staphylococcus aureus e Stenotrophomonas maltophilia), totalizando 72 combinações por organismo. As configurações foram comparadas por métricas de completude (BUSCO), contiguidade (N50) e precisão (indels), além do desempenho computacional. O modelo sup de basecalling apresentou consistentemente os melhores resultados, com valores de completude (BUSCO) variando de 93,5% a 99,6%, em comparação a valores inferiores nos demais modelos. Em termos de contiguidade, os melhores fluxos atingiram valores de N50 de até 5.134.685 bp, com montagens frequentemente próximas ao tamanho esperado dos genomas. A etapa de correção de erros com Medaka, isoladamente ou combinada com Racon, promoveu redução significativa na taxa de indels, com valores mínimos de até 3,48 indels/100 kb, em contraste com valores superiores a 100 indels/100 kb em cenários menos otimizados. As estratégias de filtragem apresentaram impacto limitado sobre as métricas avaliadas. De forma geral, os resultados indicam que a combinação do modelo sup com polimento baseado em Medaka constitui a abordagem mais eficiente e precisa para a montagem de genomas bacterianos a partir de dados de sequenciamento Nanopore.