Kwam je hier via je serverlogs? Dan heeft deze crawler een pagina van je website opgevraagd. Hieronder staat wie hem beheert, wat hij doet en hoe je hem uitsluit.
Wat de crawler doet
Webcollector leest openbaar toegankelijke pagina's van Nederlandse webshops om een marktoverzicht op te bouwen: welke webshopplatformen er worden gebruikt, welke marketing- en analysetechnologie er op sites draait, en hoe die markt zich ontwikkelt.
Wat hij nadrukkelijk niet doet:
- inloggen, formulieren verzenden, accounts aanmaken of bestellingen plaatsen;
- CAPTCHA's, inlogschermen of botbeveiliging omzeilen;
- van IP-adres wisselen om een blokkade te omzeilen;
- afgeschermde pagina's benaderen of persoonlijke gegevens van bezoekers verzamelen.
Word je site geblokkeerd of afgeschermd, dan noteren we dat als uitkomst en stoppen we — we proberen het niet langs een andere weg.
Hoe je hem herkent
| User-agent |
Webcollector/<versie> (+https://webcollector.nl;
collector@webcollector.nl)
|
|---|---|
| IP-adres | 62.129.142.40 |
| Reverse DNS | egress-01.webcollector.nl |
Al ons crawlverkeer komt van dat ene adres. Zie je een user-agent die zich zo noemt maar van een ander IP komt, dan zijn wij dat niet — laat het ons dan vooral weten.
Hoe vaak we langskomen
| Gelijktijdig | één verzoek per domein, nooit meer |
|---|---|
| Tussenpauze | minimaal 1,5 seconde tussen twee verzoeken aan hetzelfde domein |
| Aantal pagina's |
doorgaans een handvol per site: de homepage, robots.txt, de sitemap en een
paar representatieve pagina's
|
| Bij drukte of fouten |
we respecteren Retry-After en wachten na een foutmelding minimaal 15
minuten
|
Ons uitsluiten
We volgen robots.txt. Zet dit in het bestand op de hoofdmap van je site en we
komen niet meer langs:
User-agent: Webcollector
Disallow: /
Wil je alleen een deel afschermen, dan werkt dat zoals je gewend bent — geef in plaats van
/ het pad op dat je wilt uitsluiten. Wijzigingen pikken we binnen een dag op.
Liever direct geregeld, of gaat het om meerdere domeinen? Mail collector@webcollector.nl en we zetten je domeinen op onze uitsluitlijst. Dat werkt ook zonder dat je je robots.txt hoeft aan te passen.
Welke gegevens we bewaren
Webcollector is een dienst van Digital Bean, gevestigd in Nederland; dat bedrijf is verwerkingsverantwoordelijke voor wat hieronder staat. Van je website bewaren we waarnemingen, geen kopieën: welk platform er draait, welke technologie we hebben gezien, en zakelijke contactgegevens die je zelf openbaar op je site publiceert. Ruwe pagina-inhoud en schermafbeeldingen bewaren we alleen tijdelijk en lokaal, en nooit in onze langetermijnopslag.
We verzamelen geen gegevens over jouw bezoekers en verzenden geen e-mail op basis van crawlgegevens zonder een eigen afweging vooraf. Wil je weten wat we over jouw website hebben vastgelegd, of wil je dat we het verwijderen? Stuur een bericht naar collector@webcollector.nl; we handelen dat af en bevestigen wanneer het is doorgevoerd.
