|
Download README.md from tokinasin/stack-v3-docs: direct link, hf CLI and curl.
- Browser
- Download file 2.73 kB
-
https://huggingface.co/tokinasin/stack-v3-docs/resolve/main/README.md
- Command line
-
hf download hf://tokinasin/stack-v3-docs/README.md
-
curl -L -o README.md https://huggingface.co/tokinasin/stack-v3-docs/resolve/main/README.md
2.73 kB
| configs: | |
| - config_name: "Markdown" | |
| default: true | |
| data_files: | |
| - split: train | |
| path: "data/Markdown/train/*.parquet" | |
| - config_name: "AsciiDoc" | |
| data_files: | |
| - split: train | |
| path: "data/AsciiDoc/train/*.parquet" | |
| - config_name: "Org" | |
| data_files: | |
| - split: train | |
| path: "data/Org/train/*.parquet" | |
| - config_name: "Pod" | |
| data_files: | |
| - split: train | |
| path: "data/Pod/train/*.parquet" | |
| - config_name: "RMarkdown" | |
| data_files: | |
| - split: train | |
| path: "data/RMarkdown/train/*.parquet" | |
| - config_name: "Roff" | |
| data_files: | |
| - split: train | |
| path: "data/Roff/train/*.parquet" | |
| - config_name: "Roff Manpage" | |
| data_files: | |
| - split: train | |
| path: "data/Roff Manpage/train/*.parquet" | |
| - config_name: "TeX" | |
| data_files: | |
| - split: train | |
| path: "data/TeX/train/*.parquet" | |
| - config_name: "Texinfo" | |
| data_files: | |
| - split: train | |
| path: "data/Texinfo/train/*.parquet" | |
| - config_name: "Text" | |
| data_files: | |
| - split: train | |
| path: "data/Text/train/*.parquet" | |
| - config_name: "Textile" | |
| data_files: | |
| - split: train | |
| path: "data/Textile/train/*.parquet" | |
| - config_name: "Typst" | |
| data_files: | |
| - split: train | |
| path: "data/Typst/train/*.parquet" | |
| - config_name: "Vim Help File" | |
| data_files: | |
| - split: train | |
| path: "data/Vim Help File/train/*.parquet" | |
| - config_name: "Wikitext" | |
| data_files: | |
| - split: train | |
| path: "data/Wikitext/train/*.parquet" | |
| - config_name: "reStructuredText" | |
| data_files: | |
| - split: train | |
| path: "data/reStructuredText/train/*.parquet" | |
| # stack-v3-docs | |
| | Language | Samples | | |
| | --- | ---: | | |
| | Markdown | 199,003,312 | | |
| | TeX | 5,139,532 | | |
| | reStructuredText | 3,067,032 | | |
| | Text | 2,752,971 | | |
| | RMarkdown | 1,959,373 | | |
| | Org | 1,043,577 | | |
| | AsciiDoc | 840,637 | | |
| | Roff | 570,452 | | |
| | Wikitext | 455,210 | | |
| | Roff Manpage | 406,048 | | |
| | Textile | 64,706 | | |
| | Typst | 43,944 | | |
| | Pod | 40,833 | | |
| | Vim Help File | 38,634 | | |
| | Texinfo | 21,402 | | |
| - Exact duplicate samples were removed after extraction. | |
| ## Licensing information | |
| These subsets are derived from [The Stack v3 train dataset](https://huggingface.co/datasets/HuggingFaceCode/stack-v3-train), which is released under the [ODC-By 1.0 license](https://opendatacommons.org/licenses/by/1-0/). Individual source files may have different original licenses; their use must comply with those terms, including attribution where applicable. Repository provenance and per-file license metadata (`repo_path`, `commit_id`, `license_type`, and `detected_licenses`) are preserved in each sample. License detection may be incomplete or inaccurate. | |