CenolabBot
CenolabBot to robot porównywarki Cenolab.pl, prowadzonej przez PremiumAds sp. z o.o. w Gdyni. Odwiedza sklepy internetowe w Polsce, żeby znaleźć ich publiczny plik produktowy (feed) i pobrać dane potrzebne do porównania cen. Ta strona opisuje, co dokładnie pobiera, jak często i jak go zatrzymać.
Jak się przedstawia
Każde zapytanie robota ma ten sam nagłówek User-Agent:
CenolabBot/1.0 (+https://cenolab.pl/bot/)Jeśli w logach swojego serwera widzisz taki wpis, to był CenolabBot. Zapytań z innym nagłówkiem nie wysyłamy.
Co pobiera
- Plik produktowy (feed). Adres wystawiony przez sklep albo znaleziony w typowych miejscach: w robots.txt, w mapach witryny i pod ścieżkami używanymi przez popularne platformy sklepowe. Z feedu bierzemy oferty: tytuł, cenę, zdjęcie, dostępność i identyfikatory produktów.
- Stronę główną. Żeby rozpoznać, czy to sklep, na jakiej działa platformie oraz jaki ma język i walutę.
- Stronę kontaktu i regulamin. Z tych stron bierzemy wyłącznie dane kontaktowe firmy (nazwę, adres, NIP, e-mail, telefon) oraz informacje o dostawie i zwrotach. Nic więcej.
Dane kontaktowe pobieramy dopiero wtedy, gdy sklep trafia do porównywarki. Sklep, który odrzucimy, nie zostawia u nas żadnych danych kontaktowych.
Jak często
- Najwyżej 1 zapytanie na 2 sekundy do jednej domeny.
- Przy szukaniu pliku produktowego najwyżej 12 zapytań do jednej domeny.
- Przy odczycie profilu sklepu najwyżej 5 stron.
- Feedy sklepów, które są w porównywarce, pobieramy co 6 godzin.
Robots.txt i zastrzeżenia TDM
Przed pierwszym pobraniem z domeny sprawdzamy jej plik robots.txt, a potem odświeżamy go najwyżej raz na dobę. Jeśli sekcja dla CenolabBot albo dla wszystkich robotów (User-agent: *) zawiera Disallow: /, nie pobieramy z domeny niczego poza samym robots.txt. Przy zakazie częściowym omijamy zabronione ścieżki.
Honorujemy też zastrzeżenia maszynowe dotyczące eksploracji tekstów i danych (TDM): nagłówek odpowiedzi tdm-reservation: 1 oraz znacznik meta tdm-reservation na stronie. Przy takim zastrzeżeniu z profilu sklepu zapisujemy tylko dane kontaktowe, bez opisu sklepu.
Nie obchodzimy zabezpieczeń. Jeśli plik produktowy odpowiada kodem 401 albo 403 albo wymaga białej listy adresów IP, nie próbujemy tego obejść.
Jak zablokować CenolabBot
Dopisz do robots.txt swojej domeny:
User-agent: CenolabBot
Disallow: /Zmianę zauważymy najpóźniej po dobie, przy kolejnym odczycie robots.txt. Od tej chwili robot nie pobiera z Twojej domeny nic poza samym robots.txt.
Jak ograniczyć tempo
Jeśli wolisz rzadsze zapytania, ustaw przerwę między nimi:
User-agent: CenolabBot
Crawl-delay: 10Wartość oznacza sekundy między zapytaniami. Honorujemy ją do 30 sekund; wyższa wartość jest traktowana jak 30 sekund.
Jak poprosić o usunięcie
Jeśli Twój sklep jest w Cenolab i chcesz go usunąć albo nie życzysz sobie wizyt robota, napisz na [email protected] albo skorzystaj ze strony dla sklepów. Domena zgłoszona do usunięcia trafia na listę wykluczeń i nie wraca do kolejki ani do importu.