· Kennisbank · 6 min lezen
Sitemap-crawl: hoe Fynd je pagina’s indexeert
Van XML-sitemap naar documenten, chunks en optionele producten, inclusief blogdetectie via JSON-LD.
Een sitemap crawlen in Fynd
Wat een sitemap-crawl doet
Met een sitemap-crawl geef je Fynd een herhaalbaar startpunt voor kennis van een publieke website. Je hoeft niet elke URL afzonderlijk toe te voegen: je voert de sitemap-URL in en Fynd onderzoekt de pagina’s die daarin staan. Dit is handig voor webshops met productpagina’s, koopgidsen, helpartikelen, redactionele pagina’s of een blog die de assistent moet kunnen gebruiken.
Een crawl is geen ongerichte kopie van de hele website. Fynd volgt de URL’s die de sitemap aanbiedt, haalt geschikte pagina’s op en classificeert bruikbare inhoud. Daarbij kan Fynd productgegevens herkennen die als Product JSON-LD zijn gepubliceerd. Ook redactionele gegevens als BlogPosting of Article JSON-LD worden herkend. Pagina’s die als bloginhoud worden geïdentificeerd krijgen page_type=blog, zodat het kennissysteem en de synchronisatie-interface ze als artikelen behandelen in plaats van als producten.
Gebruik een sitemap-crawl wanneer de inhoud al online staat en je Fynd dezelfde publieke bron wilt laten gebruiken. Dit past goed bij een webshop waarvan de CMS-inhoud centraal wordt beheerd en waarvoor geen tweede, handmatig bijgehouden catalogus gewenst is.
Controleer de bron vooraf
Open de sitemap eerst in een browser. Een sitemap heeft meestal een URL zoals:
https://voorbeeld.nl/sitemap.xml
https://voorbeeld.nl/sitemap_index.xml
https://voorbeeld.nl/wp-sitemap.xml
Controleer het volgende voordat je begint:
- de sitemap en eventuele onderliggende sitemaps zijn publiek bereikbaar;
- de relevante product- en artikel-URL’s zijn opgenomen;
- pagina’s vereisen geen klantlogin;
- toegangsregels blokkeren de crawler niet;
- canonieke URL’s verwijzen naar de publieke versie van de pagina;
- product- en artikelgegevens zijn beschikbaar in de HTML-respons.
Gebruik geen sitemap van een test- of acceptatieomgeving met proefproducten, tijdelijke URL’s of wachtwoordbeveiliging. De kwaliteit van antwoorden hangt direct samen met de kwaliteit van de bron. Heeft je site meerdere talen, kies dan bewust de sitemap van de taal waaruit de assistent moet antwoorden, of maak aparte bronnen per taal.
Voeg de sitemapbron toe
Ga in Fynd naar het kennisgedeelte en kies de optie om websitekennis toe te voegen. Selecteer een bron op basis van een sitemap en plak de volledige sitemap-URL. Neem https:// mee en voer geen gewone pagina-URL in op een plek waar een sitemap wordt verwacht.
Geef de bron een duidelijke naam, bijvoorbeeld Webshop-sitemap – Nederlands in plaats van alleen Website. Duidelijke namen zijn belangrijk wanneer je later meerdere bronnen moet controleren.
Kies vervolgens de crawllimiet. De configuratie max_pages bepaalt hoeveel pagina’s Fynd voor deze bron maximaal in één synchronisatie mag verwerken. Dit is een begrenzing, geen belofte dat precies dat aantal pagina’s wordt geïmporteerd. Een crawl kan eerder stoppen als de sitemap minder geschikte pagina’s bevat of als URL’s niet kunnen worden opgehaald.
Begin met een limiet die het deel van de site dekt dat je werkelijk nodig hebt. Een catalogus met 300 producten en 40 artikelen hoeft niet automatisch een brede sitemap met duizenden archief-, filter- en dubbele URL’s te verwerken. Verhoog max_pages pas nadat je hebt vastgesteld dat de geselecteerde URL’s waardevol zijn.
Hoe Fynd inhoud herkent
Fynd leest de paginarespons en zoekt naar betekenisvolle gestructureerde informatie. Productpagina’s worden herkend via Product JSON-LD. Dit bevat vaak een productnaam, beschrijving, afbeelding, prijs, voorraadstatus, merk of aanbiedingsgegevens. Gestructureerde productdata is betrouwbaarder dan informatie afleiden uit een paginaopmaak, omdat de crawler dan expliciete velden kan gebruiken.
Voor redactionele pagina’s herkent Fynd BlogPosting en Article JSON-LD. Als een van deze typen wordt gevonden, krijgt de pagina de classificatie:
page_type=blog
Deze classificatie is nuttig bij het beoordelen van een synchronisatie. Een productvraag en een vraag over een adviesartikel putten niet altijd uit hetzelfde soort bron. De blogclassificatie maakt bovendien zichtbaar of de crawl de verwachte gidsen en berichten heeft gevonden.
Sommige pagina’s bevatten zowel productverwijzingen als redactionele tekst. Fynd gebruikt de gestructureerde data die het aantreft; zorg daarom dat je markup het hoofddoel van de pagina correct beschrijft. Markeer gewone categorie- of campagnepagina’s niet als product om de crawl te beïnvloeden. Onjuiste JSON-LD leidt tot onjuiste kennis.
Bekijk de synchronisatieresultaten
Open na afloop de brondetails of de sync UI. Controleer het totale aantal verwerkte pagina’s, overgeslagen of mislukte URL’s, productaantallen en blogaantallen. De sync UI toont blogaantallen, zodat je kunt controleren of pagina’s met BlogPosting en Article zijn ontdekt in plaats van ongemerkt als algemene pagina te worden behandeld.
Gebruik de aantallen om te onderzoeken wat er gebeurt:
- Geen producten kan betekenen dat productpagina’s ontbreken in de sitemap of geen
ProductJSON-LD hebben. - Geen blogpagina’s kan betekenen dat artikelen niet in de sitemap staan of geen
BlogPosting- ofArticleJSON-LD aanbieden. - Onverwacht hoge aantallen wijzen soms op dubbele URL’s, archieven, paginering of taalvarianten.
- Een crawl die op de limiet stopt betekent dat
max_pagesmogelijk te laag is voor de gewenste reikwijdte. - Ophaalfouten wijzen vaak op redirects, geblokkeerde verzoeken, verlopen URL’s of serverfouten.
Beoordeel een bron niet alleen op het totale aantal pagina’s. Open enkele representatieve product- en artikelrecords en controleer of titel, beschrijving, prijs en artikeltekst overeenkomen met de publieke pagina. Een kleinere, schone bron is bruikbaarder dan een grote bron met herhaalde navigatie en archiefpagina’s met weinig inhoud.
Verbeter onvolledige resultaten
Ontbreekt een product, zoek dan eerst in de sitemap zelf. Staat het daar niet in, pas dan de CMS- of sitemapinstelling aan in plaats van de Fynd-limiet te verhogen. Staat de URL er wel in maar wordt de pagina niet als product ingedeeld, inspecteer dan de broncode op geldige Product JSON-LD. Herstel foutieve gestructureerde data en start daarna opnieuw een sync.
Controleer bij ontbrekende artikelen of het bericht BlogPosting of Article JSON-LD gebruikt en in een crawlbare sitemap voorkomt. Een pagina kan voor een bezoeker duidelijk een blogbericht zijn, maar toch niet worden geclassificeerd als er alleen visuele inhoud staat zonder redactionele structured data.
Beperk ruis waar mogelijk bij de bron. Sluit interne zoekpagina’s, gefacetteerde filters, tagarchieven en dunne dubbele pagina’s uit van de sitemap. Deze pagina’s verbruiken max_pages zonder betere antwoorden op te leveren. Kan je platform geen gerichte sitemap maken, gebruik dan een aparte sitemap-URL voor het kenniswaardige deel van de site.
Veilig periodiek synchroniseren
Start de bron opnieuw na het publiceren van producten, prijswijzigingen, nieuwe gidsen of belangrijke aanpassingen aan artikelen. Beschouw de sitemap als de leidende URL-lijst: wanneer een pagina eruit verdwijnt, beoordeel dan of die nog in de kennis moet blijven.
Wijzig bij onderzoek steeds één onderdeel tegelijk. Herstel bijvoorbeeld eerst de JSON-LD, synchroniseer daarna en bekijk vervolgens het blogaantal. Zo is duidelijk welk effect je wijziging had. Leg ook vast waarom max_pages de gekozen waarde heeft, vooral wanneer de bron met de tijd groeit.
Checklist bij problemen
De sitemap kan niet worden gelezen
Controleer de exacte URL, het HTTPS-certificaat, redirects en publieke bereikbaarheid. Een test in de browser helpt, maar controleer ook dat de respons niet alleen voor ingelogde gebruikers wordt aangepast.
Producten worden als algemene pagina verwerkt
Valideer dat productdetailpagina’s geldige Product JSON-LD bieden in de HTML die de crawler ontvangt. Controleer ook dat in de sitemap de juiste product-URL’s staan, en niet uitsluitend collectiepagina’s.
Artikelen ontbreken in het blogaantal
Controleer of artikel-URL’s zijn opgenomen en BlogPosting of Article JSON-LD aanbieden. Start daarna opnieuw een sync en bekijk het gerapporteerde blogaantal.
De crawl is niet volledig
Vergelijk het aantal verwerkte pagina’s met max_pages. Is de limiet bereikt, verhoog die dan zorgvuldig. Is de limiet niet bereikt, onderzoek dan overgeslagen en mislukte URL’s en herstel de sitemap of de toegang tot de pagina.
Samenvatting
Een sitemap-crawl is geschikt wanneer je publieke site de product- en redactionele kennis al bevat die Fynd nodig heeft. Houd de sitemap gericht, publiceer correcte Product, BlogPosting en Article JSON-LD, kies bewust een max_pages-limiet en gebruik de product- en blogaantallen in de sync UI om elke run te controleren.
Meer guides
Alle guides →-
Widget-thema en branding afstemmen op je storefront
Branding is vertrouwen. Stem thema en copy af op de storefront en test op echte PDP’s.
Lees guide → -
Planlimieten en gebruik begrijpen
Limieten zijn stuurinformatie. Zo haal je meer waarde per gesprek vóór je een plan upgrade.
Lees guide → -
Meerdere kennisbronnen combineren zonder tegenstrijdigheden
Meer bronnen helpt alleen met duidelijke eigenaren. Zo voorkom je dubbele policies en twijfelachtig advies.
Lees guide →