PythonSTB commited on
Commit
b5f438e
·
verified ·
1 Parent(s): 49719cc

Delete tokenizers/TOKENIZERS_USER_GUIDE.txt

Browse files
tokenizers/TOKENIZERS_USER_GUIDE.txt DELETED
@@ -1,69 +0,0 @@
1
- ================================================================================
2
- TOKENIZERS - USER GUIDE (Android Python STB) - Generated by RIMI
3
- ================================================================================
4
-
5
- WHAT IT IS
6
- HuggingFace `tokenizers` 0.23.2 - fast Rust implementation of modern
7
- tokenizers (BPE, WordPiece, WordLevel, Unigram) with Python bindings
8
- (PyO3). Train vocabularies and encode/decode text at high speed.
9
-
10
- WHEELS (STANDALONE folder)
11
- tokenizers-0.23.2-cp312-cp312-android_24_x86_64.whl (emulator)
12
- tokenizers-0.23.2-cp312-cp312-android_24_arm64_v8a.whl (phones)
13
- huggingface_hub-1.30.0-py3-none-any.whl (pure-Python dep,
14
- official PyPI wheel, unmodified)
15
- Install the wheel matching your device arch, plus huggingface_hub.
16
-
17
- IMPORT
18
- from tokenizers import Tokenizer
19
- from tokenizers.models import BPE, WordPiece, WordLevel
20
- from tokenizers.trainers import BpeTrainer, WordPieceTrainer, WordLevelTrainer
21
- from tokenizers.pre_tokenizers import Whitespace, WhitespaceSplit
22
- from tokenizers.normalizers import Lowercase, NFKC
23
- from tokenizers.processors import BertProcessing
24
- from tokenizers.decoders import BPEDecoder
25
- import tokenizers
26
- print(tokenizers.__version__) # 0.23.2
27
-
28
- QUICK EXAMPLE - BPE train + roundtrip
29
- from tokenizers import Tokenizer
30
- from tokenizers.models import BPE
31
- from tokenizers.trainers import BpeTrainer
32
- from tokenizers.pre_tokenizers import Whitespace
33
-
34
- tok = Tokenizer(BPE(unk_token="[UNK]"))
35
- tok.pre_tokenizer = Whitespace()
36
- trainer = BpeTrainer(vocab_size=200, special_tokens=["[UNK]"])
37
- tok.train(["my_corpus.txt"], trainer)
38
- enc = tok.encode("Hello world")
39
- print(enc.ids, enc.tokens)
40
- print(tok.decode(enc.ids))
41
-
42
- QUICK EXAMPLE - WordLevel
43
- from tokenizers import Tokenizer
44
- from tokenizers.models import WordLevel
45
- tok = Tokenizer(WordLevel(vocab={"hello": 0, "world": 1, "[UNK]": 2},
46
- unk_token="[UNK]"))
47
- print(tok.encode("hello world").ids) # [0, 1]
48
-
49
- SAVE / LOAD
50
- tok.save("/path/tok.json")
51
- tok2 = Tokenizer.from_file("/path/tok.json")
52
-
53
- ANDROID NOTES
54
- - Native extension: tokenizers/tokenizers.cpython-312.so (Rust cdylib,
55
- 16KB page-aligned, NoRELRO, stripped, DT_NEEDED includes librimi.so
56
- app-lock + libc++_shared + libpython3.12.so.1.0).
57
- - Requires huggingface_hub at runtime (Requires-Dist kept in METADATA).
58
- huggingface_hub's optional native dep hf-xet is NOT bundled and NOT
59
- needed; the hub falls back to httpx without it.
60
- - No network needed for train/encode/decode; only for hub downloads.
61
-
62
- TESTED FEATURES (Test_Tokenizers.py, exit 0 = all pass)
63
- import + __version__ 0.23.2; submodules import; BPE train on tiny
64
- corpus; encode/decode roundtrip; encode_batch; WordLevel; save/load;
65
- Lowercase normalizer; BertProcessing.
66
-
67
- ================================================================================
68
- Generated by RIMI
69
- ================================================================================