KENNISBANK · 50 BEGRIPPEN
Deep learning-architecturen
Alle begrippen over deep learning-architecturen, van A tot Z. Elk begrip begint met een uitleg in één zin, daarna gaan we de diepte in.
A
Wat is het attention mechanism aandachtsmechanisme?
Attention laat een model zich richten op de meest relevante delen van de invoer bij het maken van een voorspelling, wat de prestaties en interpreteerbaarheid verbetert.
Lees uitleg →
Audio denoising en ruisonderdrukking
Audio denoising verwijdert ongewenste ruis uit audio om spraak of muziek helderder te maken.
Lees uitleg →
Audio language models
Audio-Language Models combineren audio en tekst voor taken zoals audio-captioning en spraakvraagbeantwoording.
Lees uitleg →
Audio tokenisatie en spectrogrammen
Audio tokenisatie zet geluid om in discrete eenheden; spectrogrammen visualiseren frequenties over tijd.
Lees uitleg →
Wat is een autoencoder?
Een autoencoder is een neuraal netwerk dat zijn eigen invoer probeert te reconstrueren via een compressede representatie, nuttig voor dimensionaliteitsreductie en feature learning.
Lees uitleg →
Wat is automatic speech recognition asr?
ASR is de technologie die gesproken taal omzet in tekst, ook wel spraakherkenning genoemd.
Lees uitleg →
C
Capsule networks
Capsule Networks gebruiken capsules die groepen neuronen bevatten om hiërarchische relaties en ruimtelijke informatie beter te modelleren dan CNN's.
Lees uitleg →
Convolutionele neurale netwerken cnn
CNN's zijn gespecialiseerd in het verwerken van beelddata door gebruik te maken van convolutionele lagen die lokale patronen herkennen.
Lees uitleg →
Cross modal retrieval
Cross-modal retrieval zoekt informatie in de ene modaliteit op basis van een query in een andere modaliteit.
Lees uitleg →
D
Dall e en stable diffusion architectuur
DALL-E en Stable Diffusion zijn tekst-naar-beeld modellen die gebruikmaken van diffusie en cross-attention om beelden te genereren op basis van tekstprompts.
Lees uitleg →
De transformer architectuur uitgelegd
De Transformer is een architectuur gebaseerd op self-attention, zonder recurrentie, die parallelle verwerking mogelijk maakt en de basis vormt van moderne taalmodellen.
Lees uitleg →
Wat is een deep neural network dnn?
Een Deep Neural Network is een neuraal netwerk met meerdere verborgen lagen dat complexe, niet-lineaire relaties kan leren uit grote hoeveelheden data.
Lees uitleg →
Wat zijn diffusion models diffusiemodellen?
Diffusiemodellen genereren data door stap voor stap ruis toe te voegen en vervolgens het proces om te keren om nieuwe data te creëren.
Lees uitleg →
Dropout als regularisatietechniek
Dropout schakelt tijdens de training willekeurig neuronen uit om overfitting te voorkomen en de generalisatie te verbeteren.
Lees uitleg →
E
Emotion recognition uit spraak
Emotieherkenning uit spraak detecteert de emotionele toestand van een spreker op basis van stemkenmerken.
Lees uitleg →
Wat is de encoder decoder structuur?
De encoder-decoder structuur bestaat uit een encoder die de invoer comprimeert tot een representatie en een decoder die daaruit de uitvoer genereert.
Lees uitleg →
F
G
Gated recurrent units gru
GRU's zijn een vereenvoudigde variant van LSTM's met twee poorten, die vergelijkbare prestaties leveren met minder parameters.
Lees uitleg →
Generative adversarial networks gans
GANs bestaan uit een generator die data maakt en een discriminator die echtheid beoordeelt, die samen worden getraind in een concurrentiestrijd.
Lees uitleg →
Graph neural networks gnn
GNN's zijn neurale netwerken die werken op graafstructuren, waarbij knopen informatie uitwisselen met hun buren om representaties te leren.
Lees uitleg →
H
Hoe werken convolutionele lagen en pooling?
Convolutionele lagen detecteren lokale patronen met filters, terwijl pooling-lagen de ruimtelijke resolutie verkleinen en de belangrijkste informatie behouden.
Lees uitleg →
Hoe werken de generator en discriminator in gans?
De generator maakt data uit ruis, de discriminator beoordeelt of data echt of nep is; samen drijven ze elkaar tot betere prestaties.
Lees uitleg →
L
Latent audio diffusion
Latent audio diffusion genereert audio door diffusie in een gecomprimeerde latente ruimte, wat efficiëntie en kwaliteit combineert.
Lees uitleg →
Long short term memory lstm netwerken
LSTM's zijn een verbeterde vorm van RNN's die met behulp van poorten langetermijnafhankelijkheden kunnen leren en het vanishing gradient-probleem overwinnen.
Lees uitleg →
M
Mixture of experts moe architectuur
MoE combineert meerdere gespecialiseerde submodellen (experts) via een gating-netwerk dat bepaalt welke experts worden ingezet voor een gegeven invoer.
Lees uitleg →
Multi head attention uitgelegd
Multi-head attention voert meerdere attention-operaties parallel uit, zodat het model verschillende soorten relaties kan leren.
Lees uitleg →
Multimodale ai integratie van tekst beeld en audio
Multimodale AI verwerkt en combineert informatie uit meerdere modaliteiten, zoals tekst, beeld en audio.
Lees uitleg →
Multimodale transformers
Multimodale Transformers verwerken meerdere modaliteiten (tekst, beeld, audio) in één model, waardoor cross-modale taken mogelijk worden.
Lees uitleg →
Music generation via ai suno udio
AI-muziekgeneratie maakt muziek op basis van tekstprompts, met tools zoals Suno en Udio.
Lees uitleg →
Music source separation stems scheiden
Music source separation splitst een muziekopname in afzonderlijke instrumenten of stems, zoals zang, drums en bas.
Lees uitleg →
N
Neuromorfe audiodetectie
Neuromorfe audiodetectie gebruikt brein-geïnspireerde hardware voor efficiënte realtime geluidsverwerking.
Lees uitleg →
Normalisatielagen batch norm layer norm
Normalisatielagen stabiliseren en versnellen de training van neurale netwerken door activaties te normaliseren.
Lees uitleg →
P
Phoneme level alignering
Phoneme-level alignering bepaalt de tijdsduur van elk foneem in een audio-opname.
Lees uitleg →
Physics informed neural networks pinn
PINN's combineren neurale netwerken met fysische vergelijkingen, zodat het model natuurwetten respecteert bij het oplossen van differentiaalvergelijkingen.
Lees uitleg →
Positional encoding in transformers
Positional encoding voegt informatie toe over de positie van tokens in een sequentie, omdat Transformers zelf geen ordening kennen.
Lees uitleg →
R
Real time audio streaming inferentie
Realtime audio streaming inferentie verwerkt audio continu met lage latentie, essentieel voor live toepassingen.
Lees uitleg →
Recurrent neural networks rnn
RNN's zijn neurale netwerken met terugkoppelingen die sequentiële data kunnen verwerken door een geheugen bij te houden.
Lees uitleg →
Residual networks resnet skip connections
ResNet introduceerde skip connections die het mogelijk maken om zeer diepe neurale netwerken te trainen zonder last van vanishing gradients.
Lees uitleg →
S
Self attention vs cross attention
Self-attention relateert elementen binnen dezelfde sequentie, terwijl cross-attention elementen van de ene sequentie relateert aan een andere.
Lees uitleg →
Sound event detection het herkennen van omgevingsgeluiden
Sound Event Detection identificeert en lokaliseert geluiden zoals glazen breken, honden blaffen of autotoeters.
Lees uitleg →
Speaker diarization wie spreekt wanneer
Speaker diarization bepaalt wie wanneer spreekt in een audio-opname met meerdere sprekers.
Lees uitleg →
Speech to speech translation
Speech-to-speech translation vertaalt gesproken taal direct naar een andere gesproken taal, met behoud van stem en emotie.
Lees uitleg →
Spiking neural networks snn
SNN's zijn neurale netwerken die werken met discrete spikepulsen in de tijd, geïnspireerd op de werking van biologische neuronen.
Lees uitleg →
State space models ssm en mamba
SSM's modelleren sequentiële data met lineaire differentiaalvergelijkingen; Mamba is een efficiënte SSM-variant die concurreert met Transformers.
Lees uitleg →
T
V
Variational autoencoders vae
VAE's zijn probabilistische autoencoders die een latente ruimte leren die kan worden gesampled om nieuwe data te genereren.
Lees uitleg →
Vision language models vlm
VLM's combineren beeld en tekst om taken zoals beeldbeschrijving en visuele vraagbeantwoording uit te voeren.
Lees uitleg →
Vision transformers vit
ViT past de Transformer-architectuur toe op afbeeldingen door deze op te delen in patches en deze als tokens te behandelen.
Lees uitleg →
Voice cloning en stem synthese
Voice cloning maakt het mogelijk om de stem van een persoon na te bootsen met AI, vaak met weinig referentie-audio.
Lees uitleg →
Z
Geen begrip gevonden in deze categorie. Zoek in de hele kennisbank.
Van begrip
naar toepassing?
We laten zien wat AI concreet voor jouw processen kan doen, met binnen een week een werkend prototype.