ViT-Base Vehicle Classifier (7 classes)
Fine-tuned google/vit-base-patch16-224-in21k for 7-class vehicle classification.
Classes
Auto Rickshaws, Bikes, Cars, Motorcycles, Planes, Ships, Trains
Results (held-out validation)
| Metric | Value |
|---|---|
| Accuracy | 99.46% |
| Macro F1 | 99.46% |
| Train images | 4,472 |
| Val images | 1,118 |
| Data leakage (train to val) | 0 |
Usage
from transformers import ViTForImageClassification, ViTImageProcessor
from PIL import Image
import torch
model = ViTForImageClassification.from_pretrained('Darshan764/vit-vehicles-7class')
processor = ViTImageProcessor.from_pretrained('google/vit-base-patch16-224-in21k')
img = Image.open('vehicle.jpg').convert('RGB')
inputs = processor(images=img, return_tensors='pt')
with torch.no_grad():
probs = model(**inputs).logits.softmax(-1)[0]
print(model.config.id2label[probs.argmax().item()], f'{probs.max():.2%}')
Training details
- Base model:
google/vit-base-patch16-224-in21k(ImageNet-21k pretrained) - Epochs: 5
- Batch size: 32
- LR: 2e-5 (cosine schedule, 10 percent warmup)
- Weight decay: 0.05
- Optimizer: AdamW
- Mixed precision (fp16): yes
- Hardware: Colab T4
- Framework:
transformers,datasets, PyTorch
How to cite
@misc{Darshan764_vit_vehicles_7class,
author = {Darshan764},
title = {ViT-Base Vehicle Classifier},
year = {2025},
publisher = {Hugging Face},
url = {https://huggingface.co/Darshan764/vit-vehicles-7class}
}
- Downloads last month
- -
Model tree for Darshan764/vit-vehicles-7class
Base model
google/vit-base-patch16-224-in21k