File size: 2,730 Bytes
144c24d
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
---
configs:
  - config_name: "Markdown"
    default: true
    data_files:
      - split: train
        path: "data/Markdown/train/*.parquet"
  - config_name: "AsciiDoc"
    data_files:
      - split: train
        path: "data/AsciiDoc/train/*.parquet"
  - config_name: "Org"
    data_files:
      - split: train
        path: "data/Org/train/*.parquet"
  - config_name: "Pod"
    data_files:
      - split: train
        path: "data/Pod/train/*.parquet"
  - config_name: "RMarkdown"
    data_files:
      - split: train
        path: "data/RMarkdown/train/*.parquet"
  - config_name: "Roff"
    data_files:
      - split: train
        path: "data/Roff/train/*.parquet"
  - config_name: "Roff Manpage"
    data_files:
      - split: train
        path: "data/Roff Manpage/train/*.parquet"
  - config_name: "TeX"
    data_files:
      - split: train
        path: "data/TeX/train/*.parquet"
  - config_name: "Texinfo"
    data_files:
      - split: train
        path: "data/Texinfo/train/*.parquet"
  - config_name: "Text"
    data_files:
      - split: train
        path: "data/Text/train/*.parquet"
  - config_name: "Textile"
    data_files:
      - split: train
        path: "data/Textile/train/*.parquet"
  - config_name: "Typst"
    data_files:
      - split: train
        path: "data/Typst/train/*.parquet"
  - config_name: "Vim Help File"
    data_files:
      - split: train
        path: "data/Vim Help File/train/*.parquet"
  - config_name: "Wikitext"
    data_files:
      - split: train
        path: "data/Wikitext/train/*.parquet"
  - config_name: "reStructuredText"
    data_files:
      - split: train
        path: "data/reStructuredText/train/*.parquet"
---

# stack-v3-docs


| Language | Samples |
| --- | ---: |
| Markdown | 199,003,312 |
| TeX | 5,139,532 |
| reStructuredText | 3,067,032 |
| Text | 2,752,971 |
| RMarkdown | 1,959,373 |
| Org | 1,043,577 |
| AsciiDoc | 840,637 |
| Roff | 570,452 |
| Wikitext | 455,210 |
| Roff Manpage | 406,048 |
| Textile | 64,706 |
| Typst | 43,944 |
| Pod | 40,833 |
| Vim Help File | 38,634 |
| Texinfo | 21,402 |

- Exact duplicate samples were removed after extraction.

## Licensing information

These subsets are derived from [The Stack v3 train dataset](https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train), which is released under the [ODC-By 1.0 license](https://opendatacommons.org/licenses/by/1-0/). Individual source files may have different original licenses; their use must comply with those terms, including attribution where applicable. Repository provenance and per-file license metadata (`repo_path`, `commit_id`, `license_type`, and `detected_licenses`) are preserved in each sample. License detection may be incomplete or inaccurate.