stack-v3-docs / README.md
tokinasin's picture
Upload README.md with huggingface_hub
144c24d verified
|
Raw History Blame Contribute Delete
2.73 kB
metadata
configs:
  - config_name: Markdown
    default: true
    data_files:
      - split: train
        path: data/Markdown/train/*.parquet
  - config_name: AsciiDoc
    data_files:
      - split: train
        path: data/AsciiDoc/train/*.parquet
  - config_name: Org
    data_files:
      - split: train
        path: data/Org/train/*.parquet
  - config_name: Pod
    data_files:
      - split: train
        path: data/Pod/train/*.parquet
  - config_name: RMarkdown
    data_files:
      - split: train
        path: data/RMarkdown/train/*.parquet
  - config_name: Roff
    data_files:
      - split: train
        path: data/Roff/train/*.parquet
  - config_name: Roff Manpage
    data_files:
      - split: train
        path: data/Roff Manpage/train/*.parquet
  - config_name: TeX
    data_files:
      - split: train
        path: data/TeX/train/*.parquet
  - config_name: Texinfo
    data_files:
      - split: train
        path: data/Texinfo/train/*.parquet
  - config_name: Text
    data_files:
      - split: train
        path: data/Text/train/*.parquet
  - config_name: Textile
    data_files:
      - split: train
        path: data/Textile/train/*.parquet
  - config_name: Typst
    data_files:
      - split: train
        path: data/Typst/train/*.parquet
  - config_name: Vim Help File
    data_files:
      - split: train
        path: data/Vim Help File/train/*.parquet
  - config_name: Wikitext
    data_files:
      - split: train
        path: data/Wikitext/train/*.parquet
  - config_name: reStructuredText
    data_files:
      - split: train
        path: data/reStructuredText/train/*.parquet

stack-v3-docs

Language Samples
Markdown 199,003,312
TeX 5,139,532
reStructuredText 3,067,032
Text 2,752,971
RMarkdown 1,959,373
Org 1,043,577
AsciiDoc 840,637
Roff 570,452
Wikitext 455,210
Roff Manpage 406,048
Textile 64,706
Typst 43,944
Pod 40,833
Vim Help File 38,634
Texinfo 21,402
  • Exact duplicate samples were removed after extraction.

Licensing information

These subsets are derived from The Stack v3 train dataset, which is released under the ODC-By 1.0 license. Individual source files may have different original licenses; their use must comply with those terms, including attribution where applicable. Repository provenance and per-file license metadata (repo_path, commit_id, license_type, and detected_licenses) are preserved in each sample. License detection may be incomplete or inaccurate.