Vision transformers vit
Transformers voor beeld
Vision Transformers (ViT) zijn een architectuur die de Transformer, oorspronkelijk ontwikkeld voor tekst, toepast op beeldherkenning. Het idee is om een afbeelding op te delen in vaste, niet-overlappende patches, bijvoorbeeld van 16x16 pixels. Elke patch wordt afgevlakt en lineair geprojecteerd naar een embedding. Daarnaast wordt een speciale classificatie-token toegevoegd, en worden positionele embeddings toegevoegd om de positie van elke patch te behouden. De resulterende sequentie van embeddings wordt door een standaard Transformer-encoder gehaald. De uitvoer van de classificatie-token wordt gebruikt voor de classificatie. ViT heeft aangetoond dat een pure Transformer, zonder convoluties, state-of-the-art resultaten kan behalen op beeldclassificatie, mits er voldoende data is. Bij kleine datasets presteert ViT slechter dan CNN's, omdat het niet de ingebouwde inductieve bias van convoluties heeft. Maar bij grote datasets, zoals JFT-300M, overtreft ViT CNN's. ViT is de basis geworden voor vele multimodale modellen, zoals CLIP en DALL-E. Het heeft de weg geopend naar een unified architectuur voor verschillende modaliteiten.
Varianten en toepassingen
Er bestaan vele varianten van ViT. DeiT (Data-efficient Image Transformer) gebruikt distillatie van een CNN om met minder data te trainen. Swin Transformer gebruikt een hiërarchische structuur met verschoven vensters, wat efficiënter is voor hoge resoluties. BeiT gebruikt een self-supervised voorafgaande training. ViT wordt gebruikt voor beeldclassificatie, objectdetectie, beeldsegmentatie en medische beeldanalyse. Het wordt ook gecombineerd met CNN's in hybride modellen. ViT heeft ook toepassingen in video-analyse, waar het temporele informatie kan verwerken. De architectuur is flexibel: men kan de patchgrootte aanpassen, het aantal lagen, en het aantal attention-heads. ViT is een mijlpaal in computer vision omdat het aantoont dat een algemene architectuur, zonder domeinspecifieke aannames, superieure prestaties kan leveren. Het heeft bijgedragen aan de convergentie van architecturen voor verschillende modaliteiten, wat leidt tot unified modellen zoals GPT-4 en Gemini. ViT is een essentieel onderdeel van de moderne AI-toolbox.