StreamingOmni-Combined

Dataset Description

This dataset combines three StreamingOmni datasets:

  • ASR: Automatic Speech Recognition data from LibriSpeech, TEDLIUM, and VoxPopuli
  • MT: Machine Translation data from IWSLT 2017 (en-fr, en-de)
  • QA: Question Answering data from SQuAD

The dataset is formatted in the StreamingOmni unified format, designed for training multi-modal Omni models.

Data Splits

  • Train: ~171,506 samples
  • Validation: ~21,653 samples
  • Test: ~31,548 samples

Capabilities

This dataset supports:

  1. Automatic Speech Recognition (ASR): Audio -> Text
  2. Machine Translation (MT): Text (source) -> Text (target)
  3. Question Answering (QA): Question + Context -> Answer

Source Datasets

  • ASR: LibriSpeech (CC-BY-4.0), TEDLIUM, VoxPopuli (CC0-1.0)
  • MT: IWSLT 2017 (en-fr, en-de)
  • QA: SQuAD (CC-BY-4.0)

License

CC BY-NC 4.0

Usage Example

from datasets import load_dataset

# Load the dataset
dataset = load_dataset("your-username/streamingomni-combined")

# Access a sample
sample = dataset["train"][0]
print(f"Task: {sample[\"task_type\"]}")
print(f"Instruction: {sample[\"instruction\"]}")
print(f"Target: {sample[\"targets\"][\"answer\"]}")
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support