Wat is de latency van een ai model?

Factoren die latency beïnvloeden

Latency hangt af van modelgrootte, architectuur, hardware, batchgrootte en netwerkomstandigheden. Een groot taalmodel met miljarden parameters heeft meer tijd nodig dan een klein classificatiemodel. GPU's en TPU's verlagen latency ten opzichte van CPU's, maar zijn duurder. Batchverwerking verhoogt de doorvoer maar kan de latency per request verhogen. Netwerklatency speelt een rol bij cloudgebaseerde inferentie. Voor real-time toepassingen zoals autonome voertuigen en chirurgische robots is lage latency cruciaal. Het meten en optimaliseren van latency is daarom een kernaspect van AI-engineering. Latency wordt vaak onderscheiden van doorvoer: latency is de tijd per request, doorvoer het aantal requests per tijdseenheid.

Latency versus doorvoer en kosten

Er bestaat een tradeoff tussen latency, doorvoer en kosten. Grotere batches verhogen de doorvoer maar ook de latency. Kleinere modellen verlagen latency maar kunnen nauwkeurigheid inleveren. Edge-inferentie verlaagt netwerklatency maar beperkt de modelgrootte. Kwantisatie en pruning verlagen latency en kosten, soms ten koste van precisie. Voor sommige toepassingen is een iets hogere latency acceptabel, bijvoorbeeld bij batchgewijze documentanalyse. Voor andere, zoals high-frequency trading, is elke milliseconde van belang. Het ontwerpen van een AI-systeem vereist daarom een bewuste afweging tussen snelheid, nauwkeurigheid en kosten. Monitoring van latency in productie helpt bij het opsporen van knelpunten en regressies.

Dit toepassen in
jouw bedrijf?

We vertalen het naar jouw processen en laten binnen een week een werkend prototype zien.