Context compression long context llms
Context compression
Context compression is een verzameling technieken om de hoeveelheid tekst die een LLM moet verwerken te reduceren zonder belangrijke informatie te verliezen. Dit is nodig omdat het context window van LLM's beperkt is en omdat langere contexten meer rekenkracht en geheugen vereisen. Compression kan plaatsvinden vóór of tijdens de inferentie. Voorbeelden zijn het samenvatten van documenten, het verwijderen van redundante zinnen en het gebruik van embeddings om alleen de meest relevante delen te selecteren. Een populaire methode is het gebruik van een klein model om de context samen te vatten voordat deze naar het grote model gaat. Ook kunnen attention-mechanismen worden aangepast om alleen relevante tokens te verwerken. Context compression is essentieel voor RAG, waar meerdere documenten moeten worden gecombineerd binnen een beperkt context window. Het verbetert de efficiëntie en verlaagt de kosten. Uitdagingen zijn het behouden van nuance en het vermijden van het verliezen van kritische informatie. Het is een actief onderzoeksgebied met veel nieuwe technieken.
Long-context LLM's
Long-context LLM's zijn modellen die zijn ontworpen om zeer lange sequenties te verwerken, soms tot een miljoen tokens. Dit wordt mogelijk gemaakt door verbeteringen in positionele encodering (zoals RoPE-varianten), efficiënte attention-mechanismen (zoals sparse attention) en optimalisaties in geheugenbeheer. Long-context modellen kunnen hele boeken, grote codebases of uitgebreide gesprekken verwerken. Dit opent nieuwe toepassingen, zoals het analyseren van juridische contracten, het samenvatten van onderzoeksliteratuur en het voeren van langdurige gesprekken. Echter, langere contexten betekenen niet automatisch betere prestaties. Modellen kunnen moeite hebben om informatie in het midden van een lange context te vinden, een fenomeen dat 'lost in the middle' wordt genoemd. Ook de kosten en latentie nemen toe. Daarom worden long-context modellen vaak gecombineerd met retrieval en compression. De ontwikkeling van long-context LLM's is een belangrijk onderzoeksgebied, omdat het de manier waarop we met taalmodellen omgaan fundamenteel kan veranderen.