Audio tokenisatie en spectrogrammen
Spectrogrammen
Een spectrogram is een visuele representatie van audio waarbij de x-as de tijd is, de y-as de frequentie en de kleur of intensiteit de energie. Het wordt gemaakt met een Short-Time Fourier Transform (STFT), die het signaal opdeelt in korte overlappende vensters en voor elk venster de frequentie-inhoud berekent. Spectrogrammen zijn cruciaal in spraakverwerking omdat ze patronen zichtbaar maken die relevant zijn voor spraakherkenning, muziekanalyse en geluidsclassificatie. Mel-spectrogrammen zijn een variant waarbij de frequentieschaal wordt aangepast aan de menselijke perceptie (Mel-schaal). Hierdoor worden lagere frequenties fijner weergegeven, wat beter overeenkomt met hoe mensen geluid ervaren. Mel-spectrogrammen worden veel gebruikt als input voor neurale netwerken in ASR en TTS. Ze comprimeren de audio-informatie tot een vorm die efficiënt te verwerken is. Het nadeel is dat fase-informatie verloren gaat, wat belangrijk kan zijn voor sommige toepassingen. Desondanks zijn spectrogrammen de dominante representatie in moderne audio-AI.
Audio tokenisatie
Audio tokenisatie is het proces waarbij continu geluid wordt omgezet in discrete tokens, vergelijkbaar met hoe tekst wordt getokeniseerd. Dit is nodig voor modellen die met discrete sequenties werken, zoals transformers. Een veelgebruikte methode is het gebruiken van een neuraal audio-codec, zoals SoundStream of EnCodec, die audio comprimeert tot een reeks tokens. Deze tokens kunnen vervolgens worden gebruikt voor taken zoals spraaksynthese, muziekgeneratie en spraakvertaling. Audio tokenisatie maakt het mogelijk om audio en tekst in hetzelfde model te verwerken, wat multimodale AI mogelijk maakt. Het is een actief onderzoeksgebied, met uitdagingen zoals het behouden van geluidskwaliteit, het omgaan met verschillende sample rates en het reduceren van de tokenlengte. Tokenisatie is een fundamentele stap in het bouwen van generatieve audiomodellen.