Two kinds of data. Raw data (fast5) stays at the original repositories and is indexed on the raw data download page. Processed data and benchmark results produced by the unified pipeline are hosted on Zenodo (DOI 10.5281/zenodo.10889896).

Dataset overview

Task columns: BC base calling · PD polyA detection · SA segmentation & event alignment · MD modification detection. For MD the cell shows which modification the sample carries ground truth for.

DatasetPublishedAccessionSpeciesTypeSampleFlow cellKitBCPDSAMD
ont_ployA_standard2018-09PRJEB28423SyntheticRNA10xpolyAflo-min106sqk-rna001✓✓✓–
ont_ployA_standard2018-09PRJEB28423SyntheticRNA15xpolyAflo-min106sqk-rna001✓✓✓–
ont_ployA_standard2018-09PRJEB28423SyntheticRNA30xpolyAflo-min106sqk-rna001✓✓✓–
ont_ployA_standard2018-09PRJEB28423SyntheticRNA60xpolyAflo-min106sqk-rna001✓✓✓–
ont_ployA_standard2018-09PRJEB28423SyntheticRNA80xpolyAflo-min106sqk-rna001✓✓✓–
ont_ployA_standard2018-09PRJEB28423SyntheticRNA100xpolyAflo-min106sqk-rna001✓✓✓–
eGFP_polyA_DNA2019-06PRJEB31806SyntheticcDNAdna_rep1_sqklsk108_flipflopflo-min106sqk-lsk108✓✓✓–
eGFP_polyA_DNA2019-06PRJEB31806SyntheticcDNAdna_rep2_sqklsk109_flipflopflo-min106sqk-lsk109✓✓✓–
eGFP_polyA_RNA2019-06PRJEB31806SyntheticRNArna_rep1_sqkrna001_plus_rtflo-min106sqk-rna001✓✓✓–
eGFP_polyA_RNA2019-06PRJEB31806SyntheticRNArna_rep2_sqkrna001_plus_rtflo-min106sqk-rna001✓✓✓–
eGFP_polyA_RNA2019-06PRJEB31806SyntheticRNArna_rep3_sqkrna002_minus_rtflo-min106sqk-rna002✓✓✓–
lambda_phage2021-03PRJNA926802lambda phageDNAVER5940flo-flg001sqk-lsk109✓–✓–
NA128782019-06PRJEB23027Homo sapiensDNAFAB42828flo-min106sqk-lsk108✓–✓–
NA128782019-06PRJEB23027Homo sapiensDNAFAF04090flo-min106sqk-lsk108✓–✓–
NA128782019-06PRJEB23027Homo sapiensDNAFAF09968flo-min106sqk-lsk108✓–✓–
curlcake2019-07PRJNA511582SyntheticRNAm6A-mod-rep1flo-min106sqk-rna001✓–✓m6A
curlcake2019-07PRJNA511582SyntheticRNAm6A-mod-rep2flo-min106sqk-rna001✓–✓m6A
curlcake2019-07PRJNA511582SyntheticRNAnon-mod-rep1flo-min106sqk-rna001✓–✓–
curlcake2019-07PRJNA511582SyntheticRNAnon-mod-rep2flo-min106sqk-rna001✓–✓–
scBY4741_m5C2021-06PRJNA563591SyntheticRNAm5C_modifiedflo-min106sqk-rna001✓–✓m5C
scBY4741_hm5C2021-06PRJNA548268SyntheticRNAhm5C_modifiedflo-min106sqk-rna001✓–✓hm5C
scBY4741_pU2021-02PRJNA549001SyntheticRNApU_modifiedflo-min106sqk-rna001✓–✓Ψ
hct1162021-04PRJEB44348Homo sapiensRNAHCT-WT-rep1flo-min106sqk-rna002✓–✓m6A
hct1162021-04PRJEB44348Homo sapiensRNAHCT-WT-rep2flo-min106sqk-rna002✓–✓m6A
hct1162021-04PRJEB44348Homo sapiensRNAHCT-WT-rep3flo-min106sqk-rna002✓–✓m6A
hek293t_wt2021-01PRJEB40872Homo sapiensRNAHEK293T-WT-rep1flo-min106sqk-rna001✓–✓m6A
hek293t_wt2021-01PRJEB40872Homo sapiensRNAHEK293T-WT-rep2flo-min106sqk-rna002✓–✓m6A
hek293t_wt2021-01PRJEB40872Homo sapiensRNAHEK293T-WT-rep3flo-min106sqk-rna002✓–✓m6A
hek293t_ko2021-01PRJEB40872Homo sapiensRNAHEK293T-Mettl3-KO-rep1flo-min106sqk-rna001✓–✓–
hek293t_ko2021-01PRJEB40872Homo sapiensRNAHEK293T-Mettl3-KO-rep2flo-min106sqk-rna002✓–✓–
hek293t_ko2021-01PRJEB40872Homo sapiensRNAHEK293T-Mettl3-KO-rep3flo-min106sqk-rna002✓–✓–
mESCs_eligos2020-10PRJNA497103 · SRP166020Mus musculusRNAmESCs_Mettl3_WTflo-min106sqk-rna002✓–✓m6A
mESCs_eligos2020-10PRJNA497103 · SRP166020Mus musculusRNAmESCs_Mettl3_KOflo-min106sqk-rna002✓–✓–
ecoli_eligos2020-08PRJNA497103 · SRP166020Escherichia coliRNAIVT_Inosineflo-min106sqk-rna002✓–✓Inosine
ecoli_eligos2020-08PRJNA497103 · SRP166020Escherichia coliRNAIVT_m5Cflo-min106sqk-rna002✓–✓m5C
ecoli_eligos2020-08PRJNA497103 · SRP166020Escherichia coliRNAIVT_m6Aflo-min106sqk-rna002✓–✓m6A
ecoli_eligos2020-08PRJNA497103 · SRP166020Escherichia coliRNAIVT_normalAflo-min106sqk-rna002✓–✓–
ecoli_eligos2020-08PRJNA497103 · SRP166020Escherichia coliRNAIVT_normalCflo-min106sqk-rna002✓–✓–
dinopore_ivt2023-01SRP363295SyntheticRNAgBlock_pureIflo-min106sqk-rna001✓–✓Inosine
dinopore_ivt2023-01SRP363295SyntheticRNAgBlock_Gflo-min106sqk-rna001✓–✓–
dinopore_xenopus2022-04SRP363295Xenopus laviesRNArep3_stage1_20200812flo-min106sqk-rna002✓–✓Inosine
dinopore_xenopus2022-04SRP363295Xenopus laviesRNArep3_stage1_20201005flo-min106sqk-rna002✓–✓Inosine
dinopore_xenopus2022-04SRP363295Xenopus laviesRNArep3_stage9_20200812flo-min106sqk-rna002✓–✓Inosine
dinopore_xenopus2022-04SRP363295Xenopus laviesRNArep3_stage9_20201008flo-min106sqk-rna002✓–✓Inosine

Dataset statistics

Read counts and average lengths come from the unified pipeline. * Base-called sequence lengths are from Guppy 6.0.1.

DatasetTypeRaw sizeSample# multi-fast5# readsAvg. signal lengthAvg. base length*
ont_ployA_standardRNA81 GB10xpolyA2492,42859,001.81,207.2
ont_ployA_standardRNA15xpolyA2391,08456,518.51,216.3
ont_ployA_standardRNA30xpolyA1663,88654,111.51,192.7
ont_ployA_standardRNA60xpolyA28108,31457,397.11,172.6
ont_ployA_standardRNA80xpolyA103409,63447,166.3859.3
ont_ployA_standardRNA100xpolyA70279,89561,938.01,173.4
eGFP_polyA_DNAcDNA43 GBdna_rep1_sqklsk108_flipflop121484,0008,956.7763.5
eGFP_polyA_DNAcDNAdna_rep2_sqklsk109_flipflop71280,42821,619.21,667.1
eGFP_polyA_RNARNA529 GBrna_rep1_sqkrna001_plus_rt231922,82657,068.71,126.5
eGFP_polyA_RNARNArna_rep2_sqkrna001_plus_rt3641,452,04250,103.4928.4
eGFP_polyA_RNARNArna_rep3_sqkrna002_minus_rt149592,57130,888.6465.0
lambda_phageDNA19 GBVER5940114113,514116,272.69,562.0
NA12878DNA68 GBFAB42828933,633131,148.96,810.4
NA12878DNAFAF040902462,833509,826.917,801.2
NA12878DNAFAF09968621,947334,921.053,615.0
curlcakeRNA584 GBm6A-mod-rep134134,37469,745.8850.2
curlcakeRNAm6A-mod-rep2160638,86058,341.9835.0
curlcakeRNAnon-mod-rep11766,73657,930.6867.0
curlcakeRNAnon-mod-rep2212846,59561,719.51,066.5
scBY4741_m5CRNA37 GBm5C_modified104415,45340,792.4539.9
scBY4741_hm5CRNA17 GBhm5C_modified28111,01581,528.21,022.9
scBY4741_pURNA4 GBpU_modified1142,38646,652.9475.2
hct116RNA346 GBHCT-WT-rep1247987,48866,363.11,217.4
hct116RNAHCT-WT-rep22541,015,89357,524.51,023.0
hct116RNAHCT-WT-rep34191,673,39465,628.31,153.2
hek293t_wtRNA224 GBHEK293T-WT-rep12611,040,66160,169.8939.8
hek293t_wtRNAHEK293T-WT-rep23491,396,00054,077.71,077.6
hek293t_wtRNAHEK293T-WT-rep3133513,56156,785.61,005.1
hek293t_koRNA356 GBHEK293T-Mettl3-KO-rep13731,490,21058,140.7952.6
hek293t_koRNAHEK293T-Mettl3-KO-rep24541,815,58952,569.8993.9
hek293t_koRNAHEK293T-Mettl3-KO-rep34211,677,07550,186.0970.3
mESCs_eligosRNA220 GBmESCs_Mettl3_WT7913,163,28633,202.3526.2
mESCs_eligosRNAmESCs_Mettl3_KO3821,527,56128,350.7437.7
ecoli_eligosRNA214 GBIVT_Inosine203811,95332,978.0845.4
ecoli_eligosRNAIVT_m5C144573,67445,397.1719.5
ecoli_eligosRNAIVT_m6A3711,482,43741,642.1708.3
ecoli_eligosRNAIVT_normalA96383,20933,499.8620.8
ecoli_eligosRNAIVT_normalC114452,80644,566.8731.8
dinopore_ivtRNA15 GBgBlock_pureI47165,62829,869.7450.3
dinopore_ivtRNAgBlock_G43150,40532,047.1641.2
dinopore_xenopusRNA399 GBrep3_stage1_202008123631,451,28946,688.4917.2
dinopore_xenopusRNArep3_stage1_202010054541,812,20027,213.7532.6
dinopore_xenopusRNArep3_stage9_202008123911,560,03244,621.8894.4
dinopore_xenopusRNArep3_stage9_202010083131,251,13031,185.5448.1

Processed dataset download

All processed data can be downloaded from Zenodo record 10889896. The dataset is dynamic: the current version is 1.0.0, and processed results for additional software are added over time. A small demo dataset is the fastest way to see every intermediate format.

Processed dataset structure

Every dataset follows the same directory layout, numbered by pipeline step. Not all datasets contain all modules: Tailfindr and SegPore cannot process DNA, so DNA datasets usually lack 3_tailfindr and 6_segpore. The example below has two samples.

<dataset>/
├── 0_reference/
│   └── ref.fa                      # reference genome / transcriptome
├── 1_raw_signal/
│   ├── single_fast5/               # as downloaded (if applicable)
│   ├── multi_fast5/                # standardized input for all tools
│   └── multi_pod5/                 # for Dorado
├── 2_base_called/
│   ├── guppy/{pass,fail,workspace}/
│   ├── dorado/dorado.bam
│   ├── <dataset>.fastq
│   └── reads-ref.sorted.filter.bam # minimap2 + samtools
├── 3_tailfindr/
│   └── tails.csv
├── 4_nanopolish/
│   ├── polya.tsv, polya-pass-only-with-head.tsv
│   ├── eventalign.txt, eventalign_combined.txt
│   └── summary.txt
├── 5_tombo/
│   └── single_reads/{tombo_resquiggle.txt, tombo_summary.txt}
└── 6_segpore/
Directory tree of a processed NanoBaseLib dataset with two samples
Processed dataset layout as shipped on Zenodo (two samples: sample_0, sample_1).

Dataset documentation

Collection criteria. Raw fast5/pod5 must be freely downloadable from a public repository; datasets should span diverse species; common RNA modifications (m6A, m5C, hm5C, inosine, pseudouridine) should be covered; and ground truth should be available for several tasks. All collected datasets use R9.4 or R9.4.1 chemistry.

Intended use. Developing and benchmarking machine-learning methods for the four tasks. Uses that re-identify individuals or contradict the original data providers' intent are out of scope; see the paper's discussion of societal impact.

Licensing and maintenance. Processed data: CC BY 4.0. Software: Apache 2.0. Data are hosted on Zenodo for long-term preservation; this website and the GitHub repository are maintained by the authors. A machine-readable datasets.json and schema.org Dataset metadata (embedded in this page) describe the collection.