01Doel en herkenning
De crawler leest goedgekeurde openbare registerpagina's en nieuw gevonden openbare detailpagina's. Pagina's die klanten volgen en pagina's uit zoekresultaten van klanten gaan in deze eerste verzamelfase niet naar de gedeelde crawler. Verzoeken maken zich bekend als ModouDiscoveryBot/1.0 en verwijzen naar deze pagina.
02Waar de crawler bij kan
De crawler probeert eerst een gewoon webverzoek. Een aparte, streng begrensde browser mag JavaScript alleen uitvoeren voor een bron die Modou daar uitdrukkelijk voor heeft goedgekeurd. De crawler logt niet in, lost geen CAPTCHA's op, omzeilt geen betaalmuren, gebruikt geen proxy's, downloadt geen bestanden via de browser en omzeilt geen blokkades van de website. Voordat de crawler een pagina ophaalt, controleert hij robots.txt.
03Verzoeksnelheid
De HTTP-worker doet nooit meer dan twee verzoeken tegelijk en de optionele browser verwerkt één pagina tegelijk. Modou stuurt nooit parallelle verzoeken naar één host en wacht minstens vijf seconden tussen verzoeken naar dezelfde host.
04Wat Modou opslaat
Modou bewaart de paginatitel, maximaal 20.000 tekens opgeschoonde openbare tekst, bronlinks, taal, publicatiedatum, ophaaldatum en technische controlegegevens. Modou bewaart geen ruwe HTML en verwijdert mailadressen en telefoonnummers uit geïndexeerde tekst.
05Verwijdering en correctie
Je kunt de crawler blokkeren via robots.txt. Wil je een al geïndexeerde pagina laten verwijderen of het gedrag van de crawler op je site laten corrigeren, mail dan de betrokken URL naar hi@modou.io. We beoordelen je verzoek en verwijderen inhoud die daarvoor in aanmerking komt.