StreamingOmni-Combined
Dataset Description
This dataset combines three StreamingOmni datasets:
- ASR: Automatic Speech Recognition data from LibriSpeech, TEDLIUM, and VoxPopuli
- MT: Machine Translation data from IWSLT 2017 (en-fr, en-de)
- QA: Question Answering data from SQuAD
The dataset is formatted in the StreamingOmni unified format, designed for training multi-modal Omni models.
Data Splits
- Train: ~171,506 samples
- Validation: ~21,653 samples
- Test: ~31,548 samples
Capabilities
This dataset supports:
- Automatic Speech Recognition (ASR): Audio -> Text
- Machine Translation (MT): Text (source) -> Text (target)
- Question Answering (QA): Question + Context -> Answer
Source Datasets
- ASR: LibriSpeech (CC-BY-4.0), TEDLIUM, VoxPopuli (CC0-1.0)
- MT: IWSLT 2017 (en-fr, en-de)
- QA: SQuAD (CC-BY-4.0)
License
CC BY-NC 4.0
Usage Example
from datasets import load_dataset
# Load the dataset
dataset = load_dataset("your-username/streamingomni-combined")
# Access a sample
sample = dataset["train"][0]
print(f"Task: {sample[\"task_type\"]}")
print(f"Instruction: {sample[\"instruction\"]}")
print(f"Target: {sample[\"targets\"][\"answer\"]}")
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support