Producten automatisch categoriseren met AI
Een AI-systeem kan productinformatie gebruiken om artikelen automatisch in de juiste categorie te plaatsen en ontbrekende kenmerken te signaleren. Je leest hoe dat werkt, waarin deze aanpak verschilt van vaste regels en waarom menselijke controle belangrijk blijft.
Welke productgegevens AI gebruikt voor categorisering
Om een product aan een categorie te koppelen, kijkt AI naar meer dan alleen de naam. Een titel als ‘Runner X2’ vertelt op zichzelf weinig, maar in combinatie met een merk, materiaal, beschrijving, kleur en producttype ontstaat een bruikbaarder beeld. Ook informatie uit specificatievelden, leveranciersbestanden en soms afbeeldingen kan helpen. Het model zoekt naar patronen in die gegevens en vergelijkt ze met categorieën die binnen de catalogus beschikbaar zijn.
De kwaliteit van de invoer blijft bepalend. Een volledige beschrijving met gebruiksdoel en productspecificaties geeft meer houvast dan een korte, intern gebruikte SKU-omschrijving. Daarbij kunnen bronnen elkaar tegenspreken: een leveranciersfeed noemt een artikel bijvoorbeeld ‘jas’, terwijl de titel en kenmerken eerder op een bodywarmer wijzen. Een systeem moet zulke signalen wegen, niet simpelweg één veld als waarheid behandelen.
Context maakt het verschil
De betekenis van een kenmerk hangt af van de productgroep. ‘Maat 42’ kan bij schoenen een schoenmaat zijn, maar bij kleding een kledingmaat. Een slimme indeling houdt daarom rekening met relaties tussen categorie, kenmerken en producttype. Dat voorkomt dat dezelfde waarde op verschillende plekken dezelfde betekenis krijgt. In de praktijk helpt het om vast te leggen welke gegevens betrouwbaar zijn, welke optioneel zijn en welke alleen voor bepaalde productgroepen relevant zijn.
Van producttekst naar categorie en kenmerken
AI categoriseert doorgaans niet door een woord letterlijk op te zoeken in een lijst. Een model analyseert de samenhang tussen woorden en gegevensvelden en schat welke categorie het best past. Bij ‘waterdichte wandeljas voor dames’ wijzen zowel het producttype als het gebruik en de doelgroep in een richting. Een categorietaxonomie kan daar vervolgens een concrete plek aan koppelen, bijvoorbeeld dameskleding, jassen en daaronder outdoorjassen. Hoe diep die indeling gaat, hangt af van de taxonomie en de beschikbare informatie.
Naast de categorie kan het systeem kenmerken voorstellen, zoals materiaal, doelgroep, kleur of toepassing. Sommige kenmerken staan al expliciet in de brondata; andere zijn af te leiden uit een combinatie van tekst en context. Dat onderscheid moet zichtbaar blijven. ‘Kleur: zwart’ uit een productspecificatie is iets anders dan zwart afleiden uit een foto, zeker als belichting of productvarianten de waarneming kunnen beïnvloeden.
Waarschijnlijkheid is geen zekerheid
De uitkomst is vaak een voorspelling met een mate van vertrouwen, geen gegarandeerd feit. Een model kan bijvoorbeeld sterk zeker zijn over de hoofdcategorie, maar twijfelen tussen twee subcategorieën. Ook kan het een kenmerk voorstellen dat logisch klinkt maar niet in de brondata staat. Daarom is het nuttig om categorieën en kenmerken afzonderlijk te beoordelen. Zo kan een product automatisch een hoofdcategorie krijgen, terwijl twijfelachtige kenmerken eerst ter controle worden aangeboden.
AI-categorisering vergeleken met vaste regels
Vaste regels werken met expliciete voorwaarden. Als de titel ‘laptop’ bevat, plaats het product dan in computers; als een veld ‘schoen’ bevat, kies dan de categorie schoenen. Zulke regels zijn begrijpelijk, snel en goed te controleren. Ze zijn vooral geschikt voor stabiele gegevensbronnen met voorspelbare benamingen. Het probleem ontstaat bij variatie: ‘notebook’, ‘ultrabook’ en een leverancierscode kunnen naar hetzelfde producttype verwijzen, terwijl één woord in een andere context iets anders kan betekenen.
AI kan varianten en context beter herkennen, maar is minder voorspelbaar dan een eenvoudige regel. De uitkomst volgt uit patronen die het model heeft geleerd en kan veranderen wanneer gegevens of modelversies wijzigen. Een foutieve regel is vaak makkelijk aan te wijzen; een foutieve AI-voorspelling kan voortkomen uit een combinatie van verouderde voorbeelden, onduidelijke brondata en een ongeschikte taxonomie.
Hybride werken is vaak praktischer
In veel catalogi vullen regels en AI elkaar aan. Een harde regel kan bijvoorbeeld een officieel producttype uit een betrouwbare feed volgen, terwijl AI vrije titels interpreteert of tussen subcategorieën kiest. Ook kan een regel bepaalde producten uitsluiten, zoals bundels of onderdelen waarvoor een afwijkende behandeling nodig is. Die combinatie beperkt onnodige onzekerheid zonder alle uitzonderingen handmatig te programmeren. De afweging is onderhoud: regels moeten worden bijgewerkt wanneer leveranciers veranderen, terwijl AI periodiek gecontroleerd moet worden op nauwkeurigheid en ongewenste verschuivingen.
Omgaan met ontbrekende, foutieve en tegenstrijdige productdata
Een veelvoorkomende uitdaging is dat productinformatie onvolledig is. Een artikel kan een titel en prijs hebben, maar geen merk, materiaal of duidelijke omschrijving. AI kan op basis van de beschikbare context soms toch een categorie voorstellen, maar een ontbrekend gegeven is niet hetzelfde als een gegeven dat veilig kan worden afgeleid. Als een product uitsluitend ‘Model 18 blauw’ heet, is een precieze productgroep mogelijk niet betrouwbaar vast te stellen. Een systeem dat altijd een antwoord forceert, vult zulke gaten al snel met aannames.
Ook foutieve of tegenstrijdige waarden vragen om beleid. Staat in het ene veld ‘leer’ en in een ander veld ‘synthetisch’, dan moet duidelijk zijn welke bron voorrang krijgt of dat het product naar controle gaat. Een ontbrekend kenmerk kan bovendien afhankelijk zijn van de categorie: bij een stoel is materiaal nuttig, maar een schoenmaat niet relevant. De taxonomie bepaalt dus mede welke datakwaliteit nodig is.
Maak onzekerheid bruikbaar
In plaats van ontbrekende informatie stilzwijgend aan te vullen, kan het systeem een waarde openlaten, een mogelijke waarde voorstellen of een product markeren voor beoordeling. Dat vraagt om duidelijke grenzen: welke velden mogen worden afgeleid, welke moeten uit een bron komen en welke zijn verplicht vóór publicatie? Door onzekerheid en herkomst vast te leggen, kunnen medewerkers onderscheid maken tussen een ontbrekend gegeven en een model dat onvoldoende bewijs heeft. Dat voorkomt dat aannames ongemerkt als productfeiten in de catalogus belanden.
Verschillende taxonomieën tussen webshop en leverancier
Een leverancier en een webshop kunnen hetzelfde product op heel verschillende manieren indelen. Een leverancier gebruikt bijvoorbeeld ‘Sport & vrije tijd’ als brede categorie, terwijl een webshop producten uitsplitst naar hardloopschoenen, trailrunning en wandelschoenen. Een directe één-op-één vertaling bestaat dan niet. AI kan helpen om de productgegevens inhoudelijk te koppelen aan de eigen indeling, maar moet eerst weten welke categorieën beschikbaar zijn en hoe die zich tot elkaar verhouden.
Daarbij speelt het doel van de indeling mee. Een interne productadministratie kan categorieën gebruiken voor rapportage, terwijl een webshop navigatie en filters wil ondersteunen. De beste plaats in de taxonomie voor interne processen is dus niet automatisch de beste plek voor klanten. Ook kan één artikel in verschillende contexten passen, bijvoorbeeld een rugzak die zowel voor reizen als wandelen wordt gebruikt. De gewenste primaire categorie moet dan worden bepaald aan de hand van afspraken over gebruik, verkoop of navigatie.
Bewaar de oorspronkelijke classificatie
Een robuuste koppeling overschrijft de bronindeling niet zonder meer. Bewaar bijvoorbeeld de leverancierscategorie naast de eigen categorie en leg de gebruikte mapping vast. Zo zijn verschillen terug te vinden wanneer de leverancier zijn structuur wijzigt of de webshop nieuwe subcategorieën toevoegt. Bij ingrijpende wijzigingen is een mappingtabel vaak betrouwbaarder dan een losse AI-voorspelling. AI kan voorstellen doen voor onbekende of gewijzigde waarden, maar de uiteindelijke koppeling moet aansluiten op de betekenis en het beheer van beide taxonomieën.
Productvarianten, bundels en uitzonderingen herkennen
Een catalogus bevat vaak varianten die sterk op elkaar lijken: dezelfde trui in meerdere maten en kleuren, of een telefoon met verschillende opslagcapaciteiten. Het is meestal verstandig om de categorie op productfamilieniveau te bepalen en variantkenmerken afzonderlijk te verwerken. Als elke variant als volledig los product wordt geclassificeerd, kunnen kleine verschillen in titel tot uiteenlopende categorieën leiden. Dat veroorzaakt inconsistente navigatie en maakt filters minder betrouwbaar.
Bundels en samengestelde artikelen zijn lastiger. Een pakket met een camera, lens en tas hoort niet vanzelfsprekend in dezelfde categorie als elk onderdeel afzonderlijk. Het model moet kunnen onderscheiden of de brondata één verkoopbaar pakket beschrijft of meerdere gekoppelde producten. Ook accessoires, vervangingsonderdelen en verbruiksartikelen kunnen woorden delen met het hoofdproduct. Een titel met ‘voor camera X’ duidt bijvoorbeeld vaak op compatibiliteit, niet op een camera zelf.
Leg uitzonderingslogica expliciet vast
Daarom is het nuttig om productrelaties en artikeltypen mee te nemen: hoofdproduct, variant, bundel, accessoire of onderdeel. Die informatie kan uit bestaande velden komen, maar vraagt soms om een aparte classificatie. Voor uitzonderingsgroepen kunnen vaste regels betrouwbaarder zijn dan een algemene voorspelling. Controleer ook hoe wijzigingen op de hoofdvariant doorwerken naar onderliggende varianten. Zonder zo’n relatiebeheer kan een correctie op één artikel tientallen inconsistente varianten achterlaten.
Een categoriseringsproces met betrouwbaarheidsgrenzen inrichten
Automatische categorisering werkt het best als onderdeel van een gecontroleerde gegevensstroom. Nieuwe productdata wordt eerst opgeschoond en waar mogelijk genormaliseerd, bijvoorbeeld door schrijfwijzen van kleuren en merken gelijk te trekken. Daarna bepaalt het systeem categorieën en kenmerken, waarna controles kunnen volgen op verplichte velden, ongeldige combinaties en dubbele producten. Pas na die stappen gaat de informatie door naar de webshop of het productinformatiesysteem. Zo wordt voorkomen dat een plausibele voorspelling direct als gecontroleerde catalogusdata wordt gepubliceerd.
Een praktische inrichting gebruikt verschillende routes op basis van vertrouwen en risico. Een duidelijke classificatie van een gangbaar product kan automatisch worden verwerkt. Een lage score, een conflicterende bron of een gevoelige productgroep kan naar een medewerker gaan. De grens hoeft niet voor alle categorieën gelijk te zijn: een fout bij een decoratieve kleur kan minder impact hebben dan een verkeerde classificatie die wettelijke informatie of veiligheidsfilters beïnvloedt.
Meet meer dan alleen het percentage goed
Test de uitkomsten op representatieve voorbeelden en bekijk fouten per categorie, kenmerk en leverancier. Een algemeen nauwkeurigheidspercentage kan problemen verbergen als één kleine maar belangrijke productgroep vaak verkeerd wordt ingedeeld. Houd daarnaast bij hoeveel producten handmatige correctie nodig hebben en hoe lang die beoordeling duurt. Bewaar de gebruikte modelversie en invoerdata, zodat een onverwachte wijziging onderzocht kan worden. Dit maakt het proces controleerbaar wanneer modellen, taxonomieën of bronfeeds veranderen.
Menselijke controle, correcties en blijvende kwaliteitsbewaking
Menselijke controle blijft nodig, ook wanneer de meeste producten automatisch worden verwerkt. Medewerkers zien uitzonderingen die in trainingsvoorbeelden weinig voorkomen en kunnen beoordelen of een categorie past bij de manier waarop klanten zoeken. De controle is het nuttigst wanneer die gericht is op twijfelgevallen, afwijkende combinaties en productgroepen met grote gevolgen van een fout. Alles handmatig nalopen kost veel tijd; alles zonder toezicht publiceren maakt fouten moeilijker te ontdekken.
Een goede beoordelingsinterface toont niet alleen de voorgestelde categorie, maar ook relevante bronvelden, ontbrekende gegevens en de reden voor een waarschuwing. Een medewerker moet eenvoudig kunnen zien of de voorspelling steunt op producttekst, een leverancierscategorie of een afgeleide eigenschap. Correcties zijn vervolgens waardevolle voorbeelden, mits ze zorgvuldig worden opgeslagen. Eén correctie mag niet automatisch als universele regel gelden: een medewerker kan een uitzondering oplossen die alleen voor één leverancier of productfamilie geldt.
Let op verschuivingen in de catalogus
Catalogi veranderen door nieuwe assortimenten, andere leveranciers en aangepaste categorieën. Een model dat goed presteerde op bestaande producten kan daardoor geleidelijk minder passend worden. Vergelijk daarom periodiek voorspellingen met gecontroleerde uitkomsten en let op nieuwe waarden, oplopende correcties en categorieën waarin onzekerheid toeneemt. Controleer ook of medewerkers dezelfde definities hanteren. Als de taxonomie verandert, moeten oude mappings en voorbeelden worden beoordeeld; anders leert het systeem classificaties die niet meer aansluiten op de actuele catalogusafspraken.
Veelgestelde vragen
Hoe voer je AI-categorisering in zonder je bestaande catalogus te verstoren?
Voer AI-categorisering eerst in als proef naast je bestaande proces, zonder de uitkomsten meteen te publiceren. Laat het systeem bijvoorbeeld een afgebakende groep nieuwe producten classificeren en vergelijk de voorstellen met de huidige werkwijze. Zo ontdek je waar het model goed presteert en welke uitzonderingen extra aandacht vragen.
- Begin met één productgroep of leverancier.
- Bewaar de bestaande categorieën als terugvaloptie.
- Schaal pas op wanneer de resultaten aan vooraf afgesproken kwaliteitscriteria voldoen.
Moet je een AI-model trainen met je eigen productcatalogus?
Niet altijd, maar je moet wel controleren of het model jouw producten en taxonomie goed genoeg begrijpt. Een algemeen model kan bruikbare voorstellen doen, terwijl voorbeelden uit je eigen catalogus helpen om bedrijfsspecifieke categorieën en benamingen beter te herkennen. Begin met een representatieve testset voordat je besluit of aanvullende training of configuratie nodig is.
- Neem zowel veelvoorkomende producten als uitzonderingen op in de testset.
- Gebruik gecontroleerde voorbeelden met de gewenste categorieën.
- Beoordeel prestaties opnieuw wanneer je taxonomie of assortiment verandert.
Hoe bescherm je productgegevens wanneer je AI gebruikt voor categorisering?
Bescherm productgegevens door vooraf vast te leggen welke informatie het AI-systeem mag verwerken en hoe die gegevens worden opgeslagen. Productinformatie bevat niet altijd persoonsgegevens, maar leveranciersbestanden of interne velden kunnen wel vertrouwelijke informatie bevatten. Controleer daarom de afspraken over gebruik, bewaartermijnen, toegang en eventuele inzet van gegevens voor het trainen van modellen.
- Verstuur alleen velden die nodig zijn voor de classificatie.
- Beperk toegang tot invoer, uitkomsten en correcties.
- Leg vast hoe gegevens worden verwijderd en wie verantwoordelijk is voor controle.
Kan AI producten in meerdere talen automatisch categoriseren?
Ja, AI kan productinformatie in meerdere talen verwerken, maar de kwaliteit hangt af van de talen, de beschikbare productgegevens en de gebruikte categorieën. Een producttitel kan bijvoorbeeld per markt anders zijn, terwijl de webshop dezelfde taxonomie gebruikt. Controleer daarom de classificatie per taal en voorkom dat vertaalverschillen of lokale productnamen tot andere categorieën leiden.
- Bewaar de oorspronkelijke tekst naast eventuele vertalingen.
- Test gangbare synoniemen en lokale benamingen per markt.
- Leg vast of categorieën centraal of per taalgebied worden beheerd.
Hoe koppel je AI-categorisering aan een PIM- of ERP-systeem?
Koppel AI-categorisering aan je PIM- of ERP-systeem via een gecontroleerde gegevensstroom die invoer, voorstellen, beoordeling en terugschrijven van resultaten afzonderlijk behandelt. Zo kan het systeem categorieën voorstellen zonder bestaande productgegevens ongemerkt te overschrijven. Spreek ook af wat er gebeurt als een product opnieuw wordt verwerkt of een medewerker een eerdere voorspelling heeft aangepast.
- Gebruik vaste veldnamen en afgesproken categorie-ID’s.
- Bewaar de status en herkomst van iedere voorspelling.
- Test wijzigingen eerst in een testomgeving en zorg voor een herstelmogelijkheid.