ViT-Base Vehicle Classifier (7 classes)

Fine-tuned google/vit-base-patch16-224-in21k for 7-class vehicle classification.

Classes

Auto Rickshaws, Bikes, Cars, Motorcycles, Planes, Ships, Trains

Results (held-out validation)

Metric Value
Accuracy 99.46%
Macro F1 99.46%
Train images 4,472
Val images 1,118
Data leakage (train to val) 0

Usage

from transformers import ViTForImageClassification, ViTImageProcessor
from PIL import Image
import torch

model = ViTForImageClassification.from_pretrained('Darshan764/vit-vehicles-7class')
processor = ViTImageProcessor.from_pretrained('google/vit-base-patch16-224-in21k')

img = Image.open('vehicle.jpg').convert('RGB')
inputs = processor(images=img, return_tensors='pt')
with torch.no_grad():
    probs = model(**inputs).logits.softmax(-1)[0]

print(model.config.id2label[probs.argmax().item()], f'{probs.max():.2%}')

Training details

  • Base model: google/vit-base-patch16-224-in21k (ImageNet-21k pretrained)
  • Epochs: 5
  • Batch size: 32
  • LR: 2e-5 (cosine schedule, 10 percent warmup)
  • Weight decay: 0.05
  • Optimizer: AdamW
  • Mixed precision (fp16): yes
  • Hardware: Colab T4
  • Framework: transformers, datasets, PyTorch

How to cite

@misc{Darshan764_vit_vehicles_7class,
  author = {Darshan764},
  title = {ViT-Base Vehicle Classifier},
  year = {2025},
  publisher = {Hugging Face},
  url = {https://huggingface.co/Darshan764/vit-vehicles-7class}
}
Downloads last month
-
Safetensors
Model size
85.8M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Darshan764/vit-vehicles-7class

Finetuned
(2582)
this model