par indobenchmark
Open source · 20k downloads · 7 likes
IndoBERT Base P2 est un modèle de langage de pointe spécialement conçu pour l'indonésien, basé sur l'architecture BERT. Il a été entraîné avec des objectifs de modélisation de langage masqué et de prédiction de phrase suivante, ce qui lui permet de comprendre et de générer du texte en indonésien avec une grande précision. Ce modèle excelle dans des tâches comme la classification de texte, l'analyse de sentiments, la réponse aux questions et la génération de contenu, tout en prenant en compte les nuances linguistiques spécifiques à l'indonésien. Ses principaux cas d'usage incluent l'automatisation des services clients, l'analyse de données textuelles à grande échelle ou encore l'amélioration des outils de traduction automatique. Ce qui le distingue, c'est sa capacité à offrir des performances optimales pour l'indonésien, une langue complexe et riche, tout en restant accessible et efficace pour des applications variées.
IndoBERT is a state-of-the-art language model for Indonesian based on the BERT model. The pretrained model is trained using a masked language modeling (MLM) objective and next sentence prediction (NSP) objective.
| Model | #params | Arch. | Training data |
|---|---|---|---|
indobenchmark/indobert-base-p1 | 124.5M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-base-p2 | 124.5M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-large-p1 | 335.2M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-large-p2 | 335.2M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-base-p1 | 11.7M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-base-p2 | 11.7M | Base | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-large-p1 | 17.7M | Large | Indo4B (23.43 GB of text) |
indobenchmark/indobert-lite-large-p2 | 17.7M | Large | Indo4B (23.43 GB of text) |
from transformers import BertTokenizer, AutoModel
tokenizer = BertTokenizer.from_pretrained("indobenchmark/indobert-base-p2")
model = AutoModel.from_pretrained("indobenchmark/indobert-base-p2")
x = torch.LongTensor(tokenizer.encode('aku adalah anak [MASK]')).view(1,-1)
print(x, model(x)[0].sum())
IndoBERT was trained and evaluated by Bryan Wilie*, Karissa Vincentio*, Genta Indra Winata*, Samuel Cahyawijaya*, Xiaohong Li, Zhi Yuan Lim, Sidik Soleman, Rahmad Mahendra, Pascale Fung, Syafri Bahar, Ayu Purwarianti.
If you use our work, please cite:
@inproceedings{wilie2020indonlu,
title={IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding},
author={Bryan Wilie and Karissa Vincentio and Genta Indra Winata and Samuel Cahyawijaya and X. Li and Zhi Yuan Lim and S. Soleman and R. Mahendra and Pascale Fung and Syafri Bahar and A. Purwarianti},
booktitle={Proceedings of the 1st Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 10th International Joint Conference on Natural Language Processing},
year={2020}
}