|
Download README.md from tokinasin/stack-v3-docs: direct link, hf CLI and curl.
- Browser
- Download file 2.73 kB
-
https://huggingface.co/tokinasin/stack-v3-docs/resolve/main/README.md
- Command line
-
hf download hf://tokinasin/stack-v3-docs/README.md
-
curl -L -o README.md https://huggingface.co/tokinasin/stack-v3-docs/resolve/main/README.md
2.73 kB
metadata
configs:
- config_name: Markdown
default: true
data_files:
- split: train
path: data/Markdown/train/*.parquet
- config_name: AsciiDoc
data_files:
- split: train
path: data/AsciiDoc/train/*.parquet
- config_name: Org
data_files:
- split: train
path: data/Org/train/*.parquet
- config_name: Pod
data_files:
- split: train
path: data/Pod/train/*.parquet
- config_name: RMarkdown
data_files:
- split: train
path: data/RMarkdown/train/*.parquet
- config_name: Roff
data_files:
- split: train
path: data/Roff/train/*.parquet
- config_name: Roff Manpage
data_files:
- split: train
path: data/Roff Manpage/train/*.parquet
- config_name: TeX
data_files:
- split: train
path: data/TeX/train/*.parquet
- config_name: Texinfo
data_files:
- split: train
path: data/Texinfo/train/*.parquet
- config_name: Text
data_files:
- split: train
path: data/Text/train/*.parquet
- config_name: Textile
data_files:
- split: train
path: data/Textile/train/*.parquet
- config_name: Typst
data_files:
- split: train
path: data/Typst/train/*.parquet
- config_name: Vim Help File
data_files:
- split: train
path: data/Vim Help File/train/*.parquet
- config_name: Wikitext
data_files:
- split: train
path: data/Wikitext/train/*.parquet
- config_name: reStructuredText
data_files:
- split: train
path: data/reStructuredText/train/*.parquet
stack-v3-docs
| Language | Samples |
|---|---|
| Markdown | 199,003,312 |
| TeX | 5,139,532 |
| reStructuredText | 3,067,032 |
| Text | 2,752,971 |
| RMarkdown | 1,959,373 |
| Org | 1,043,577 |
| AsciiDoc | 840,637 |
| Roff | 570,452 |
| Wikitext | 455,210 |
| Roff Manpage | 406,048 |
| Textile | 64,706 |
| Typst | 43,944 |
| Pod | 40,833 |
| Vim Help File | 38,634 |
| Texinfo | 21,402 |
- Exact duplicate samples were removed after extraction.
Licensing information
These subsets are derived from The Stack v3 train dataset, which is released under the ODC-By 1.0 license. Individual source files may have different original licenses; their use must comply with those terms, including attribution where applicable. Repository provenance and per-file license metadata (repo_path, commit_id, license_type, and detected_licenses) are preserved in each sample. License detection may be incomplete or inaccurate.