gsaltintas commited on
Commit
c95517b
·
verified ·
1 Parent(s): 29788fc

Upload folder using huggingface_hub

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,69 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ language:
4
+ - arb
5
+ - ces
6
+ - cmn
7
+ - dan
8
+ - deu
9
+ - ell
10
+ - fra
11
+ - eng
12
+ - hun
13
+ - ind
14
+ - ita
15
+ - jpn
16
+ - nld
17
+ - pol
18
+ - por
19
+ - rus
20
+ - spa
21
+ - swe
22
+ - tur
23
+ - vie #'[''arb_Arab'', ''ces_Latn'', ''cmn_Hani'', ''dan_Latn'', ''deu_Latn'', ''ell_Grek'',
24
+
25
+ tags:
26
+ - tokenizer
27
+ - bpe
28
+ - flexitok
29
+ - fineweb2
30
+ ---
31
+
32
+ # Byte-Level BPE Tokenizer: ['arb_Arab', 'ces_Latn', 'cmn_Hani', 'dan_Latn', 'deu_Latn', 'ell_Grek', 'fra_Latn', 'fw_edu', 'hun_Latn', 'ind_Latn', 'ita_Latn', 'jpn_Jpan', 'nld_Latn', 'pol_Latn', 'por_Latn', 'rus_Cyrl', 'spa_Latn', 'swe_Latn', 'tur_Latn', 'vie_Latn'] (128K)
33
+
34
+ A **Byte-Level BPE** tokenizer trained on **['arb_Arab', 'ces_Latn', 'cmn_Hani', 'dan_Latn', 'deu_Latn', 'ell_Grek', 'fra_Latn', 'fw_edu', 'hun_Latn', 'ind_Latn', 'ita_Latn', 'jpn_Jpan', 'nld_Latn', 'pol_Latn', 'por_Latn', 'rus_Cyrl', 'spa_Latn', 'swe_Latn', 'tur_Latn', 'vie_Latn']** data from Fineweb-2-HQ.
35
+
36
+ ## Training Details
37
+
38
+ | Parameter | Value |
39
+ |-----------|-------|
40
+ | Algorithm | Byte-Level BPE |
41
+ | Language | `['arb_Arab', 'ces_Latn', 'cmn_Hani', 'dan_Latn', 'deu_Latn', 'ell_Grek', 'fra_Latn', 'fw_edu', 'hun_Latn', 'ind_Latn', 'ita_Latn', 'jpn_Jpan', 'nld_Latn', 'pol_Latn', 'por_Latn', 'rus_Cyrl', 'spa_Latn', 'swe_Latn', 'tur_Latn', 'vie_Latn']` |
42
+ | Target Vocab Size | 128,000 |
43
+ | Final Vocab Size | 128,410 |
44
+ | Pre-tokenizer | boundless_bpe |
45
+ | Number handling | ltr_3digit |
46
+ | Contraction handling | True |
47
+ | Normalizer | NFC |
48
+ | Special Tokens | `<s>`, `</s>`, `<pad>`, `<unk>` |
49
+ | Training Shards | 40 |
50
+
51
+ ## Usage
52
+
53
+ ```python
54
+ from transformers import AutoTokenizer
55
+
56
+ tokenizer = AutoTokenizer.from_pretrained("flexitok/bpe_AllL_128000")
57
+ tokens = tokenizer.encode("Hello, world!")
58
+ ```
59
+
60
+ ## Files
61
+
62
+ - `tokenizer.json` — Full HuggingFace tokenizer
63
+ - `vocab.json` — Vocabulary mapping
64
+ - `merges.txt` — BPE merge rules
65
+
66
+ ## Sample Encoding
67
+ | Text | Tokens | Token IDs |
68
+ |------|--------|-----------|
69
+ | `Hello, world! 12345 This is a test. こんにちは` | `H, ell, o,Ġ, world, !Ġ, 123, 45, ĠThisĠ, isĠaĠ, test, .Ġ, ãģ, ĵ, ãĤ, ĵ, ãģ«, ãģ, ¡, ãģ, ¯` | `42, 4180, 27833, 35778, 48248, 21162, 4495, 94456, 57600, 35365, 564, 12229, 244, 20619, 244, 110542, 12229, 97, 12229, 110` |
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
special_tokens_map.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token": "<s>",
3
+ "eos_token": "</s>",
4
+ "pad_token": "<pad>"
5
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5a91ea4deee70e867bbad7611c6ad0b495e338eef9fd6cb277c074db7725074c
3
+ size 14020501
tokenizer_config.json ADDED
The diff for this file is too large to render. See raw diff
 
vocab.json ADDED
The diff for this file is too large to render. See raw diff