Getting Started
The Computational Linguistics suite integrates with a wide range of computational linguistics and ML tooling. Each skill references the tools relevant to its domain.
| Tool | Coverage | Used By |
|---|
| GlotLID (2024) | 1,600+ languages, paragraph-level | magic-linguistic-corpus |
| FastText LID (176 languages) | High-resource speed | magic-linguistic-corpus |
| CLD3 | Broad coverage | magic-linguistic-corpus (fallback) |
| Tool | Purpose | Used By |
|---|
Python unicodedata | NFC/NFKC normalization | magic-linguistic-scripts |
| Unicode TR39 confusable data | Mixed-script deduplication | magic-linguistic-scripts |
detect_confusables.py | Fold/detect confusables + joiners | magic-linguistic-scripts |
| Tool | Purpose | Used By |
|---|
| SentencePiece 0.1.96+ | Unigram/BPE tokenizer training | magic-linguistic-tokenize |
| FOCUS | Vocab extension (close script pairs) | magic-linguistic-tokenize |
| OFA | Vocab extension (with parallel data) | magic-linguistic-tokenize |
| HyperOfa | Vocab extension (minimal data) | magic-linguistic-tokenize |
| Resource | Languages | Used By |
|---|
| CulturaX | 167 languages | magic-linguistic-corpus |
| MADLAD-400 | 400+ languages | magic-linguistic-corpus |
| Glot500 | 500+ languages | magic-linguistic-corpus |
| OLDI (Open Language Data Initiative) | 100+ languages | magic-linguistic-corpus |
| Wikipedia dumps | 300+ languages | magic-linguistic-corpus |
| OPUS | Parallel data, many languages | magic-linguistic-bitext |
| FLORES-200 | 200 languages, eval | magic-linguistic-eval |
| NTREX-128 | 128 languages, eval | magic-linguistic-eval |
| Belebele | 122 languages, reading comp | magic-linguistic-eval |
| Tool | Purpose | Used By |
|---|
| LASER3 | Sentence embeddings for alignment | magic-linguistic-bitext |
| SONAR (Meta 2024) | Embeddings — stronger for Bantu/Indigenous | magic-linguistic-bitext |
| Vecalign | Sentence alignment (preferred) | magic-linguistic-bitext |
| hunalign | Sentence alignment (legacy) | magic-linguistic-bitext |
| Tool | Strengths | Used By |
|---|
| Unsloth | 2× faster QLoRA, single-GPU | magic-linguistic-transfer |
| LLaMA-Factory | Multi-GPU + complex sampling | magic-linguistic-transfer |
| Axolotl | YAML-config middle ground | magic-linguistic-transfer |
| HuggingFace PEFT | Flexible LoRA/QLoRA/DoRA | magic-linguistic-transfer |
| MAD-X / BAD-X adapters | Language + task adapter stacks | magic-linguistic-transfer |
| Tool | Purpose | Used By |
|---|
| UniMorph | Gold paradigms, 100+ languages | magic-linguistic-morph |
| SIGMORPHON 2022/2023 | Unsupervised segmenters | magic-linguistic-morph |
| HFST | Rule-based FST analyzer | magic-linguistic-morph |
| foma | Alternative FST toolkit | magic-linguistic-morph |
| Morfessor | Statistical segmenter | magic-linguistic-morph |
| Tool | Strengths | Used By |
|---|
| Trankit (2021) | Best low-resource UD quality (XLM-R) | magic-linguistic-syntax |
| stanza (Stanford 2020) | 70+ languages, fast | magic-linguistic-syntax |
| UDify (2019) | Single multilingual model | magic-linguistic-syntax |
| UD treebank corpus | 100+ languages | magic-linguistic-syntax |
| Tool | Purpose | Used By |
|---|
| Open Multilingual WordNet (OMW) | Synsets for 100+ languages | magic-linguistic-semantics |
| PARSEME | MWE annotation datasets | magic-linguistic-semantics |
| COMET-22 | Learned MT quality metric | magic-linguistic-semantics, magic-linguistic-eval |
| LaBSE / SONAR | Cross-lingual embeddings | magic-linguistic-semantics, magic-linguistic-eval |
| Tool | Coverage | Used By |
|---|
| MMS (Meta Massively Multilingual Speech) | 1,107 languages | magic-linguistic-speech |
| Whisper (OpenAI) | ~99 languages | magic-linguistic-speech |
| Lhotse | Audio pipeline (CutSet standard) | magic-linguistic-speech |
| ELAN | Field annotation format | magic-linguistic-speech |
| Praat (TextGrid) | Phonetic annotation | magic-linguistic-speech |
| FLEx FieldWorks | Lexicographic field data | magic-linguistic-speech |
| WikiPron | G2P / IPA crowd-sourced data | magic-linguistic-speech |
| VITS / Tacotron2 | Low-resource TTS | magic-linguistic-speech |
| Tool | Purpose | Used By |
|---|
| Label Studio | General annotation UI | magic-linguistic-annotate |
| Prodigy | Active-learning annotation | magic-linguistic-annotate |
| INCEpTION | NLP annotation with IAA | magic-linguistic-annotate |
| brat | Lightweight web annotation | magic-linguistic-annotate |
| Tool | Metric | Used By |
|---|
| sacrebleu | chrF++, spBLEU, BLEU | magic-linguistic-eval |
| COMET / xCOMET | Learned MT quality | magic-linguistic-eval |
| GEMBA-MQM | LLM-judge MQM rubric | magic-linguistic-eval |
| AfroBench | African language benchmarks | magic-linguistic-eval |
| IndicXTREME | Indic language benchmarks | magic-linguistic-eval |
| SEACrowd | Southeast Asian benchmarks | magic-linguistic-eval |
| Database | Coverage | Used By |
|---|
| WALS (World Atlas of Language Structures) | 2,662 languages | magic-linguistic-scope |
| Grambank | 2,467 languages | magic-linguistic-scope |
| URIEL / lang2vec | Typological distance vectors | magic-linguistic-scope, magic-linguistic-transfer |
| Glottolog | Language catalog + genealogy | magic-linguistic-scope |