Researchers have developed HelaBERT, a new family of BERT-based language models specifically designed to enhance understanding of the Sinhala language. These models, HelaBERT-Small and HelaBERT-Large, were pre-trained on approximately one billion tokens of Sinhala text from various sources, including news articles and Wikipedia. The models utilize a specialized SentencePiece Unigram tokenizer to handle Sinhala's unique linguistic features. Evaluations on four downstream Sinhala text classification tasks showed promising results, with a proposed dual pooling classification head offering consistent improvements in sentiment analysis and moderate gains in news category classification. AI
IMPACT These models could significantly advance NLP capabilities for Sinhala speakers, enabling better applications in sentiment analysis and content classification.
RANK_REASON The cluster describes a new research paper introducing novel language models for a specific language. [lever_c_demoted from research: ic=1 ai=1.0]
- BERT
- CulturaX
- HelaBERT
- HelaBERT-Large
- HelaBERT-Small
- Hugging Face
- MADLAD-400
- natural language processing
- SentencePiece Unigram
- Sinhala
AI-generated summary · Google Gemini · from 1 sources. How we write summaries →