par indobenchmark
Open source · 321k downloads · 46 likes
IndoBERT Base (phase1 - uncased) est un modèle de langage de pointe spécialement conçu pour l'indonésien, basé sur l'architecture BERT. Entraîné avec des objectifs de modélisation de langage masqué et de prédiction de phrase suivante, il excelle dans la compréhension et la génération de texte en indonésien. Ses capacités principales incluent l'analyse sémantique, la classification de texte et la génération de représentations contextuelles riches. Ce modèle est particulièrement adapté aux tâches de traitement automatique des langues en indonésien, comme l'analyse de sentiments, la réponse aux questions ou la classification de documents. Ce qui le distingue, c'est son entraînement spécifique sur un vaste corpus en indonésien, lui permettant de surpasser les modèles multilingues génériques pour cette langue.
IndoBERT is a state-of-the-art language model for Indonesian based on the BERT model. The pretrained model is trained using a masked language modeling (MLM) objective and next sentence prediction (NSP) objective.
| Model | #params | Arch. | Training data |
|---|---|---|---|
indobenchmark/indobert-base-p1 | 124.5M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-base-p2 | 124.5M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-large-p1 | 335.2M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-large-p2 | 335.2M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-base-p1 | 11.7M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-base-p2 | 11.7M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-large-p1 | 17.7M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-large-p2 | 17.7M | Large | Indo4B (23.43 GB of text) |
from transformers import BertTokenizer, AutoModel
tokenizer = BertTokenizer.from_pretrained("indobenchmark/indobert-base-p1")
model = AutoModel.from_pretrained("indobenchmark/indobert-base-p1")
x = torch.LongTensor(tokenizer.encode('aku adalah anak [MASK]')).view(1,-1)
print(x, model(x)[0].sum())
IndoBERT was trained and evaluated by Bryan Wilie*, Karissa Vincentio*, Genta Indra Winata*, Samuel Cahyawijaya*, Xiaohong Li, Zhi Yuan Lim, Sidik Soleman, Rahmad Mahendra, Pascale Fung, Syafri Bahar, Ayu Purwarianti.
If you use our work, please cite:
@inproceedings{wilie2020indonlu,
title={IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding},
author={Bryan Wilie and Karissa Vincentio and Genta Indra Winata and Samuel Cahyawijaya and X. Li and Zhi Yuan Lim and S. Soleman and R. Mahendra and Pascale Fung and Syafri Bahar and A. Purwarianti},
booktitle={Proceedings of the 1st Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 10th International Joint Conference on Natural Language Processing},
year={2020}
}