Skip to main content
zenodoopen

Test data for sv-callers workflow

<p>This distribution includes data analyzed by the <em>sv-callers</em> workflow (v1.1.0) in the single-sample (germline) and paired-sample (somatic) modes:</p> <ul> <li>human reference genomes (in<em> .fa[sta]</em>)</li> <li>excluded genomic regions (in<em> .bed[pe]</em>) <ul> <li><a href="https://identifiers.org/encode/ENCFF001TDO">ENCODE:ENCFF001TDO</a></li> <li><a href="https://doi.org/10.1186/gb-2014-15-6-r84#ref-CR28">CEPH</a> by <a href="https://doi.org/10.1186/gb-2014-15-6-r84">Layer <em>et al</em>. (2014)</a></li> </ul> </li> <li>structural variants (SVs) detected by the workflow (in <em>.vcf</em>)</li> <li>SV <em>truth</em> sets (in<em> .bed[pe] </em>and <em>.vcf.gz</em>) <ul> <li><a href="https://ftp-trace.ncbi.nlm.nih.gov/giab/ftp/technical/svclassify_Manuscript/Supplementary_Information/Personalis_1000_Genomes_deduplicated_deletions.bed">Personalis/1000 Genomes Project</a> data by <a href="https://doi.org/10.1186/s12864-016-2366-2">Parikh <em>et al</em>. (2016)</a></li> <li><a href="https://static-content.springer.com/esm/art%3A10.1186%2Fgb-2014-15-6-r84/MediaObjects/13059_2013_3363_MOESM4_ESM.zip">PacBio/Moleculo</a> data by <a href="https://doi.org/10.1186/gb-2014-15-6-r84">Layer <em>et al</em>. (2014)</a></li> <li><a href="https://ftp.ncbi.nlm.nih.gov/pub/dbVar/data/Homo_sapiens/by_study/vcf/nstd167.GRCh37.variant_call.vcf.gz">dbVar:nstd167</a> data by <a href="https://doi.org/10.1038/s41587-019-0217-9">Wenger <em>et al</em>. (2019)</a></li> <li><a href="https://ftp.ncbi.nlm.nih.gov/pub/dbVar/data/Homo_sapiens/by_study/vcf/nstd137.GRCh37.variant_call.vcf.gz">dbVar:nstd137</a> data by <a href="https://doi.org/10.1101/gr.214007.116">Huddleston <em>et al</em>. (2017)</a></li> </ul> </li> <li>workflow samples (in<em> .csv</em>) and config files (in <em>.yaml</em>)</li> <li>short-read alignments are not included due to large sizes but are freely available for download (in <em>.bam</em>) <ul> <li>NA12878 <a href="https://ftp-trace.ncbi.nlm.nih.gov/giab/ftp/data/NA12878/NIST_NA12878_HG001_HiSeq_300x/RMNISTHS_30xdownsample.bam">sample</a></li> <li>NA24385 <a href="https://ftp-trace.ncbi.nlm.nih.gov/giab/ftp/data/AshkenazimTrio/HG002_NA24385_son/NIST_Illumina_2x250bps/novoalign_bams/HG002.hs37d5.2x250.bam">sample</a></li> <li>CHM1_CHM13 <a href="https://identifiers.org/ena.embl:ERX1413368">sample</a></li> <li>COLO829 <a href="https://identifiers.org/ena.embl:ERX2765496">tumor sample</a> with matched <a href="https://identifiers.org/ena.embl:ERX2765495">normal sample</a></li> </ul> </li> <li><a href="https://github.com/GooglingTheCancerGenome/notebooks">Jupyter Notebooks</a> to analyze SV callsets (in <em>.ipynb</em>)</li> </ul>

ShareScore

24/100

Overall dataset sharing score

Score breakdown

These five areas show where the dataset supports — or may limit — practical reuse.

Stewardship
8
Harmonization
4
Access
8
Reuse readiness
0
Engagement
4

Topics