readVcf is Slow if ScanVcfParam which Regions is Lengthy
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 43/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Tranquilo
- Stack tecnológico
- r
- Área
- data, performance
Línea de trabajo
Comienza reproduciendo la diferencia de tiempos entre readVcf con y sin ScanVcfParam(which = goldStandards), usando el ejemplo de GRanges derivado de BED indicado en el informe. Lee los puntos de entrada de readVcf y ScanVcfParam y compara el comportamiento con subsetByOverlaps. Se considera completado cuando exista un cambio acordado en el código o la documentación que haga práctico leer VCF por regiones o documente claramente la solución alternativa.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Recently, U.S. Food and Drug Administration, National Institute of Standards and Technology and Illumina researchers defined highly reproducible regions (H.R.R.s) of the human genome and made available BED files to define a set of regions in which variant callers consistently call variants on technical replicate samples, effectively defining a while-list for whole genome sequencing data. readVcf takes a long time if which of ScanVcfParam is specified. Importing the V.C.F. takes about five minutes if which not specified but I terminated it after one hour when which was specified.
library(rtracklayer)
goldStandards <- list.files("HRR/", "bed", full.names = TRUE)
goldStandards <- lapply(goldStandards, import.bed)
goldStandards <- unlist(goldStandards)
goldStandards <- reduce(goldStandards)
> goldStandards
GRanges object with 2988875 ranges and 0 metadata columns:
... ...
variants <- readVcf("DRAGENgermline.vcf.gz", param = ScanVcfParam(which = goldStandards)) # Stopped after one hour.
Importing the whole V.C.F. file into the session and then using subsetByOverlaps seems a reasonable and fast workaround. To best help other users, would a documentation change or code change be better to make this user experience nicer?
- Lenguaje dominante
- R
- Estrellas
- 32
- Forks
- 21
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de Bioconductor/VariantAnnotation
-
refactor the package Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
Bioconductor/VariantAnnotation#115 · 4 comentarios ·
-
Bioconductor/VariantAnnotation#114 · 1 reacción · 2 asignados ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 35/100
Bioconductor/VariantAnnotation#113 · 2 comentarios ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
-
ensemblVEP::parseCSQToGRanges Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 30/100
Bioconductor/VariantAnnotation#88 · 2 comentarios ·
Todos los issues de Bioconductor/VariantAnnotation
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
robjhyndman/forecast#1220 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
JamesHWade/deputy#192 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
bug triage_needed
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
pharmaverse/rtables#1123 · 1 comentario · 1 reacción ·