Logo

Our Datasets and AI Tools

Browse our dataset catalog for AI training, evaluation, and benchmarking. Our datasets are available in two tiers:

Public Access: Full datasets available for download under their respective open-source licenses. Suitable for research and non-commercial use.

Commercial License: Preview samples available for review. Full datasets available for purchase for commercial AI development.

Contact services@tonative.org for pricing and licensing.

Available Datasets

Dataset NameDescriptionCuration MethodRecords CuratedLanguagesData TypeValidationAccessActionMetadataLicensing
African StorytellingMultilingual dataset of African contemporary and folk stories featuring 5–10 minute natural narrations for ASR, TTS, and speech-text alignment researchCommissioned5Igbo, Hausa, Yoruba, DholuoSpeech + TranscriptHuman QACommercialPreview SampleCroissant MetadataCC BY-NC-ND 4.0
NaijaHealthBenchRubric-scoring dataset for evaluating LLM performance on medical queries within the Nigerian healthcare context, and across different Nigerian languagesAdapted500English, Nigerian Pidgin, Igbo, Yoruba, Hausa, FulaParallel TextHuman QACommercialPreview SampleCroissant MetadataCC BY-NC-ND 4.0
Swahili Parallel Text ExtensionEnglish extension of the Kidaw'ida, Kalenjin and Dholuo parallel corpus via MT and human validationAdapted29,230Swahili ↔ English, Kidaw'ida, Kalenjin, DholuoParallel Text - MTAI Validated + Human QAPublicDirect AccessCC-BY-NC-4.0
XNLICross-lingual natural language inference for reasoning tasksAdapted31,500Igbo, Kinyarwanda, Kikuyu, Luo, Yoruba, Hausa, Nigerian PidginNon-Parallel TextHuman QAPublicDirect AccessCC BY 4.0
MRL-BenchmarkCommonsense reasoning benchmarking dataset for LLMsCollaborated400Nigerian Pidgin, YorubaNon-Parallel TextHuman QAPublicDirect AccessCC-BY-SA-4.0

For technical inquiries or data access requests, please contact us at

Have a question or want to get started? Reach out to our team.

services@tonative.org