- install dependencies from
requirements.txt - set
PYTHONPATH=src - optionally set
DRAVIDIAN_LM_BASEif running outside the repo root
The code now uses a project-relative layout:
data/raw/data/processed/data/splits/artifacts/tokenizers/artifacts/models/results/raw/
- Download raw corpora.
- Clean and merge each language corpus.
- Create train/val/test splits.
- Train tokenizers.
- Train models.
- Summarize result JSON files.
export PYTHONPATH=src
export DRAVIDIAN_LM_BASE=$PWD
python -m dravidian_lm.data.download --lang te
python -m dravidian_lm.data.clean --lang te
python -m dravidian_lm.data.split --lang te
python -m dravidian_lm.tokenization.train_tokenizer --lang te
python -m dravidian_lm.models.gpt2.train --language telugu --tokenizer_name te
python -m dravidian_lm.analysis.summarize_results