BaDLAD: A Large Multi-Domain Bengali Document Layout Analysis Dataset
Paper • 2303.05325 • Published
How to use bengaliAI/badlad-yolov8m-seg with ultralytics:
from ultralytics import YOLOvv8
model = YOLOvv8.from_pretrained("bengaliAI/badlad-yolov8m-seg")
source = 'http://images.cocodataset.org/val2017/000000039769.jpg'
model.predict(source=source, save=True)YOLOv8 medium segmentation model trained on BaDLAD for Bengali document layout analysis. Used as the layout stage in Bengali.AI OCR pipelines (bbocr / chitrolipi) and for large-scale pseudolabeling.
Paper: BaDLAD (ICDAR 2023)
Code: BengaliAI/BADLAD
Dataset: BaDLAD on Kaggle
| Field | Value |
|---|---|
| Architecture | YOLOv8m-seg |
| Framework | Ultralytics 8.0.59 |
| Classes | paragraph, text_box, image, table (4) |
| Training data | BaDLAD labeled train |
| Epochs | 20 |
| Batch | 32 |
| Image size | 640 |
| Optimizer | SGD (lr0=0.01) |
| Checkpoint | best.pt (~52 MB) |
| sha256 | 890e6661af89d92c30f175cc2137e0f677eb425172720b0c77d43454fa09dcce |
| Trained | 2023-04-03 |
Hyperparameters above are taken from the checkpoint’s embedded train_args
(Ultralytics stores the full training config inside every .pt).
from ultralytics import YOLO
from huggingface_hub import hf_hub_download
weights = hf_hub_download("bengaliAI/badlad-yolov8m-seg", "best.pt")
model = YOLO(weights)
results = model.predict("page.png", conf=0.05, imgsz=640)
| Repo | Role |
|---|---|
bengaliAI/badlad-mrcnn-paper |
Detectron Mask R-CNN paper baseline |
bengaliAI/badlad-frcnn-paper |
Detectron Faster R-CNN paper baseline |
@inproceedings{shihab2023badlad,
title = {{BaDLAD}: A Large Multi-Domain {Bengali} Document Layout Analysis Dataset},
author = {Shihab, Md. Istiak Hossain and Hasan, Md. Rakibul and Emon, Mahfuzur Rahman and Hossen, Syed Mobassir and Ansary, Md. Nazmuddoha and Ahmed, Intesur and Rakib, Fazle Rabbi and Dhruvo, Shahriar Elahi and Dip, Souhardya Saha and Pavel, Akib Hasan and Meghla, Marsia Haque and Haque, Md. Rezwanul and Chowdhury, Sayma Sultana and Sadeque, Farig and Reasat, Tahsin and Humayun, Ahmed Imtiaz and Sushmit, Asif Shahriyar},
booktitle = {Proceedings of the 17th International Conference on Document Analysis and Recognition (ICDAR)},
year = {2023},
url = {https://arxiv.org/abs/2303.05325},
}