Archiv · Chronik · Gedächtnis Prag, Tschechien
Für Website-Betreiber

Unser Crawler

Sie sind auf dieser Seite, weil in den Protokollen Ihrer Website ein Besucher aufgetaucht ist, der sich mit einem Link hierher ausweist. So ist es gedacht: Wer zu Ihnen kommt, soll sagen, wer er ist.

Wer das ist

Kennung
Praha-X/0.1 (+https://praha-x.cz/bot)
Betreiber
Praha-X.cz, das Stadtgedächtnis Prags und der tschechischen Regionen
Woher er kommt
von unseren eigenen Adressen; der Server steht in der Europäischen Union

Was er tut

Er liest öffentlich veröffentlichte Meldungen: RSS- und Atom-Feeds von Behörden und Stadtbezirken, amtliche Bekanntmachungen, Pressemitteilungen von Institutionen und Unternehmen. Daraus übernehmen wir Überschrift, Datum, Link und einen kurzen Kontext, um über das Ereignis einen eigenen Satz mit einem Link auf Sie als Quelle zu schreiben. Fremde Texte veröffentlichen wir nicht erneut.

Für Meldungen, über die wir schreiben, öffnet der Crawler einmal auch die Artikelseite, auf die der Feed verweist, und liest ihren Text als Material für unsere eigene Zusammenfassung. Dieser Text bleibt bei uns als Arbeitsmaterial und erscheint nicht auf der Website. Einen Nutzungsvorbehalt für Text- und Data-Mining beachten wir (tdm-reservation, Protokoll TDMRep): Wo er erklärt ist, übernehmen wir den Text nicht.

Für die Rangliste der Top 100 tschechischen Websites öffnet der Crawler einmal pro Woche die Startseite und das Icon von etwa dreihundert der meistbesuchten tschechischen Websites: Er prüft, ob die Website erreichbar ist, wohin sie weiterleitet und wie sie heißt. Mehr liest er von der Website nicht, und den Inhalt der Startseite speichert er nicht.

Wie er sich verhält

  • Er befolgt die robots.txt: Was gesperrt ist, lesen wir nicht.
  • Er ist langsam: Feeds mehrmals am Tag, eine Artikelseite nur einmal, höchstens eine Anfrage alle drei Sekunden pro Website, ohne parallele Verbindungen und ohne die ganze Website zu durchsuchen.
  • Er umgeht keine Sperren. Wenn Sie uns abweisen (mit 403, 429 oder einer Prüfseite), hören wir auf und vermerken die Quelle als geschlossen. Andere Adressen und andere Kennungen probieren wir nicht.
  • Er gibt sich nicht als Browser aus und füllt keine Formulare aus.
  • Er sammelt keine personenbezogenen Daten über das hinaus, was in der öffentlich veröffentlichten Meldung steht.

Wenn Sie uns nicht wollen

Eine Zeile in Ihrer robots.txt genügt: Wir lesen sie und gehen.

User-agent: Praha-X
Disallow: /

Oder schreiben Sie uns über das Kontaktformular, und wir nehmen die Quelle von Hand heraus. Wir antworten Menschen, nicht Robotern.