See our collection for all versions of MaxViT.

Run MaxViT with Keras 3: JAX, PyTorch, or TensorFlow

GitHub Docs Collection

kerasformers/maxvit_large_tf_512_in1k

Paper: MaxViT: Multi-Axis Vision Transformer (arXiv:2204.01697) · HF Papers

MaxViT combines blocked local and dilated global attention (multi-axis) in a hierarchical CNN/Transformer hybrid.

For more details on the model, please go to the upstream model card.

Pure-Keras 3 conversion of timm/maxvit_large_tf_512.in1k for kerasformers. One implementation runs unmodified on TensorFlow / Torch / JAX.

This is an image-classification / backbone checkpoint (MaxViTImageClassify / MaxViTModel).

✨ Quick start

import os
os.environ["KERAS_BACKEND"] = "torch"  # or "jax" / "tensorflow"

from PIL import Image
import numpy as np
from kerasformers.models.maxvit import MaxViTImageClassify, MaxViTModel

model = MaxViTImageClassify.from_weights("kerasformers/maxvit_large_tf_512_in1k")
backbone = MaxViTModel.from_weights(
    "kerasformers/maxvit_large_tf_512_in1k", as_backbone=True
)

image = Image.open("your_image.jpg").convert("RGB")
image = image.resize((224, 224))
x = np.asarray(image, dtype="float32")[None]  # (1, H, W, 3)
print(model(x).shape)  # (1, num_classes)
feats = backbone(x)
print(len(feats), [tuple(f.shape) for f in feats])

Load any MaxViT variant the same way with from_weights("kerasformers/<variant>"):

Variant Hub
maxvit_base_tf_224_in1k kerasformers/maxvit_base_tf_224_in1k
maxvit_base_tf_224_in21k kerasformers/maxvit_base_tf_224_in21k
maxvit_base_tf_384_in1k kerasformers/maxvit_base_tf_384_in1k
maxvit_base_tf_384_in21k_ft_in1k kerasformers/maxvit_base_tf_384_in21k_ft_in1k
maxvit_base_tf_512_in1k kerasformers/maxvit_base_tf_512_in1k
maxvit_base_tf_512_in21k_ft_in1k kerasformers/maxvit_base_tf_512_in21k_ft_in1k
maxvit_large_tf_224_in1k kerasformers/maxvit_large_tf_224_in1k
maxvit_large_tf_224_in21k kerasformers/maxvit_large_tf_224_in21k
maxvit_large_tf_384_in1k kerasformers/maxvit_large_tf_384_in1k
maxvit_large_tf_384_in21k_ft_in1k kerasformers/maxvit_large_tf_384_in21k_ft_in1k
maxvit_large_tf_512_in1k kerasformers/maxvit_large_tf_512_in1k
maxvit_large_tf_512_in21k_ft_in1k kerasformers/maxvit_large_tf_512_in21k_ft_in1k
maxvit_small_tf_224_in1k kerasformers/maxvit_small_tf_224_in1k
maxvit_small_tf_384_in1k kerasformers/maxvit_small_tf_384_in1k
maxvit_small_tf_512_in1k kerasformers/maxvit_small_tf_512_in1k
maxvit_tiny_tf_224_in1k kerasformers/maxvit_tiny_tf_224_in1k
maxvit_tiny_tf_384_in1k kerasformers/maxvit_tiny_tf_384_in1k
maxvit_tiny_tf_512_in1k kerasformers/maxvit_tiny_tf_512_in1k
maxvit_xlarge_tf_224_in21k kerasformers/maxvit_xlarge_tf_224_in21k
maxvit_xlarge_tf_384_in21k_ft_in1k kerasformers/maxvit_xlarge_tf_384_in21k_ft_in1k
maxvit_xlarge_tf_512_in21k_ft_in1k kerasformers/maxvit_xlarge_tf_512_in21k_ft_in1k

Tips

  • Set KERAS_BACKEND before importing Keras / kerasformers.
  • MaxViTImageClassify returns class logits; MaxViTModel returns features (as_backbone=True for multi-scale stages).
  • See docs and Loading Weights.
  • Upstream / timm checkpoints: MaxViTImageClassify.from_weights("hf:timm/maxvit_large_tf_512.in1k").

Special Thanks

A huge thank you to the MaxViT authors and the timm / Hub communities for creating and releasing these models.

License: see YAML license (usually matches the upstream checkpoint).

Downloads last month
23
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for kerasformers/maxvit_large_tf_512_in1k

Finetuned
(1)
this model

Collection including kerasformers/maxvit_large_tf_512_in1k

Paper for kerasformers/maxvit_large_tf_512_in1k