95matchBot
Našli jste 95matchBot v access logu a chcete vědět, co je zač? Tahle stránka to vysvětluje. Pokud si nepřejete, abychom váš web stahovali, napište nám a vyřadíme ho.
1. Co je 95matchBot
95matchBot je crawler platformy 95match.cz, která propojuje firmy hledající zaměstnance s lidmi, kteří hledají práci. Sbírá veřejně dostupné pracovní inzeráty, aby je uchazeči našli na jednom místě - u každého inzerátu odkazujeme zpět na původní zdroj.
2. Co stahujeme
- Veřejně přístupné stránky s pracovními inzeráty - přehledy pozic a jejich detaily.
- Nic za přihlášením. Nepřihlašujeme se, neobcházíme autentizaci a nestahujeme obsah, který vyžaduje účet.
- Žádné osobní údaje uchazečů. Zajímají nás pozice, ne lidé.
- Nevyplňujeme formuláře a neodesíláme žádná data. Posíláme výhradně požadavky
GET, tedy jen čteme.
3. Jak často a jak intenzivně
Chodíme dvakrát denně - ráno kolem 05:00 UTC a odpoledne kolem 11:00 UTC (07:00 a 13:00 středoevropského letního času). Mimo tyhle dva běhy na váš web nesaháme.
Během běhu stáhneme jednu stránku s přehledem pozic a k tomu detail jen u inzerátů, které jsou nové nebo se od minule změnily. Nezměněné inzeráty znovu nestahujeme. U typického webu s několika otevřenými pozicemi to znamená řádově jednotky požadavků denně.
Požadavky posíláme sekvenčně, jeden po druhém - nikdy paralelně a bez souběžných spojení.
4. Jak nás poznáte v logu
Posíláme tento User-Agent:
95matchBot/1.0 (+https://95match.cz/bot)
Identifikujeme se u všech svých požadavků - tento User-Agent posíláme ze všech svých zdrojů. Výjimkou je několik málo webů, jejichž ochrana bot token nepropustí - nebo jim místo inzerátů tiše vrátí jinou, neúplnou stránku - a tam posíláme běžný prohlížečový User-Agent (řetězec Chrome). Na tom, co děláme, to nic nemění - pořád čteme jen veřejné stránky s inzeráty. Pokud si nejste jistí, jestli požadavek přišel od nás, napište nám a ověříme to.
Pro další malou skupinu zdrojů, které náš přístup neumožňují vůbec, používáme službu třetí strany (Bright Data Web Unlocker) - ta požadavek odbaví z české datacentrové IP adresy a má vlastní otisk prohlížeče, takže se k vám náš User-Agent v tomto případě vůbec nedostane. Pořád jde jen o nízký objem požadavků na veřejně dostupné inzeráty, se stejnou frekvencí a ohledy jako jinde.
Řetězec 95matchBot je stabilní a neměníme ho. Neuvádíme rozsahy IP adres - běžíme v cloudu bez statických adres a slibovat vám rozsah, který se může změnit, by bylo horší než ho neuvádět vůbec.
5. Kontakt
Napište na bot@95match.cz. Ozveme se.
Pokud si nepřejete, abychom váš web stahovali, stačí napsat - vyřadíme ho a přestaneme na něj chodit. Nemusíte nic dokazovat ani vyplňovat. Stejně tak nám dejte vědět, když vám nesedí frekvence nebo rozsah, ať to nemusíte řešit blokací.
English
What 95matchBot is
95matchBot is the crawler of 95match.cz, a platform matching companies with job seekers. It collects publicly available job postings so candidates can find them in one place; every listing links back to its original source.
What we fetch
- Publicly accessible job listing pages - position overviews and their detail pages.
- Nothing behind a login. We do not authenticate, do not bypass authentication, and do not fetch content that requires an account.
- No personal data of candidates. We are interested in positions, not people.
- We never submit forms or send you any data. We issue
GETrequests only - we read, nothing else.
How often and how heavily
We visit twice per day - around 05:00 UTC in the morning and 11:00 UTC in the afternoon (07:00 and 13:00 Central European Summer Time). Outside these two runs we do not touch your site.
Per run we fetch one listing page plus detail pages only for postings that are new or have changed since the last run. Unchanged postings are not re-fetched. For a typical site with a handful of open positions this amounts to a few requests per day.
Requests are sent sequentially, one at a time - never in parallel, no concurrent connections.
How to identify us in your logs
We send this User-Agent:
95matchBot/1.0 (+https://95match.cz/bot)
We identify ourselves on all of our requests - this User-Agent goes out from every one of our sources. The exception is a handful of sites whose protection rejects the bot token - or quietly answers it with a different, incomplete page instead of the listings - and there we send a common browser User-Agent (a Chrome string). Nothing else about the visit changes - we still read only public job listing pages. If you are unsure whether a request came from us, email us and we will check.
For another small set of sources our normal fetch cannot reach at all, we use a third-party service (Bright Data Web Unlocker) - the request reaches you from a Czech datacenter IP address with its own browser fingerprint, so our User-Agent never reaches you on that path at all. It is still a low volume of requests to public job listings, at the same frequency and courtesy as everywhere else.
The 95matchBot token is stable and will not change. We do not publish IP ranges - we run on cloud infrastructure without static addresses, and promising a range we cannot guarantee would be worse than publishing none.
Contact
Email bot@95match.cz and we will get back to you.
If you do not want us crawling your site, just say so - we will remove it and stop visiting. No proof or paperwork needed. The same goes if the frequency or scope does not work for you; tell us instead of having to block us.