Wat zijn diffusion models diffusiemodellen?

Van ruis naar data

Diffusiemodellen zijn een klasse van generatieve modellen die de laatste jaren enorm aan populariteit hebben gewonnen, mede door hun succes in beeldgeneratie (DALL-E 2, Stable Diffusion, Midjourney). Het idee is gebaseerd op thermodynamica: men voegt geleidelijk ruis toe aan een datapunt totdat het volledig ruis is (het forward proces). Vervolgens leert een neuraal netwerk om dit proces om te keren: van ruis terug naar data (het reverse proces). Tijdens de training leert het model de ruis die op elk tijdstip is toegevoegd te voorspellen. Bij generatie begint men met pure ruis en past men het geleerde reverse proces iteratief toe, vaak in 50 tot 1000 stappen, om een nieuw datapunt te creëren. Diffusiemodellen hebben een aantal voordelen ten opzichte van GANs. Ze zijn stabieler te trainen, hebben geen last van mode collapse, en produceren vaak hoogwaardigere en diversere output. Ze zijn echter langzamer in generatie, omdat er veel stappen nodig zijn. Technieken zoals DDIM, latent diffusion en distillation verminderen het aantal stappen. Diffusiemodellen worden gebruikt voor beeldgeneratie, beeldbewerking, audio en zelfs molecuulontwerp.

Werking en varianten

Het diffusieproces bestaat uit een forward en een reverse proces. In het forward proces wordt Gaussian ruis toegevoegd in T stappen, volgens een variantieschema. Na genoeg stappen is de data ononderscheidbaar van pure ruis. In het reverse proces leert een neuraal netwerk, vaak een U-Net, om de ruis op elk tijdstip te voorspellen. Het model wordt getraind door de echte ruis te vergelijken met de voorspelde ruis. Er bestaan verschillende varianten. Denoising Diffusion Probabilistic Models (DDPM) zijn de basis. DDIM (Denoising Diffusion Implicit Models) versnelt de generatie door minder stappen te gebruiken. Latent Diffusion Models (LDM), gebruikt in Stable Diffusion, passen diffusie toe in een latente ruimte in plaats van de pixelruimte, wat rekenkracht bespaart. Classifier-free guidance stelt het model in staat om de generatie te sturen met een tekstprompt. Diffusiemodellen worden ook gebruikt voor het genereren van 3D-modellen, video en audio. Ze zijn een van de meest veelbelovende richtingen in generatieve AI.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.