Samstag, 25. Juli 2026
Crawler-Richtlinie

NaduBerlinBot.

Diese Seite dokumentiert unser automatisiertes Lese-Verhalten — was wir lesen, wie höflich, und wie du uns ausschließen kannst.


User-Agent

NaduBerlinBot/1.0 (+https://nadu-berlin.de/bot; contact@nadu-berlin.de)

Was wir lesen

  • §5 UrhGPressemitteilungen von Polizei Berlin, Berliner Feuerwehr, den 12 Bezirksämtern und 11 Senatsverwaltungen via berlin.de RSS.
  • DL-DE/by-2.0Offene Datensätze von daten.berlin.de und dem Geoportal Berlin (Spielplätze, Kitas, Schulen, Einschulungsbereiche).
  • CC-BY 4.0Berlin Bühnen API (Kindertheater) und visitBerlin Partner-Feed (Familien-Veranstaltungen).
  • LSR ≤150 ZeichenHeadline + kurzer Teaser + Deep-Link von privaten Verlagen (Tagesspiegel, Berliner Zeitung, BZ, Morgenpost, taz Berlin).

Wie höflich wir sind

  • ≤ 1 Anfrage pro Sekunde pro Origin, mit 2 s Jitter.
  • Keine parallelen Verbindungen zur selben Domain.
  • If-Modified-Since + ETag wo immer der Server sie unterstützt.
  • Wir parsen /robots.txt bei jedem Crawl-Lauf und respektieren Disallow für unseren UA und für *.
  • Bei 429, 403 oder CAPTCHA: sofort zurück und manuelle Prüfung.
  • Wir crawlen ausschließlich aus europe-west3 (Frankfurt) — keine wechselnden IPs, kein Tor, keine Proxy-Rotation.

Was wir nie tun

  • Kein Scraping personenbezogener Daten (Erzieher:innen-Namen, Verein-Mitglieder, etc.).
  • Kein Login, kein Captcha-Lösen, keine Authentifizierungs-Bypässe.
  • Kein RAG-Training, kein Modell-Training, kein Re-Hosting kompletter Artikel.
  • Keine Verschleierung von User-Agent oder Herkunft.

Ausschließen

Du willst nicht, dass wir deine Seite lesen? Trag uns in deine /robots.txt ein:

User-agent: NaduBerlinBot Disallow: /

Wir lesen die Datei bei jedem Crawl-Lauf. Effekt innerhalb von 24 h.

Kontakt

Fragen, Probleme, Take-Down-Anfragen: contact@nadu-berlin.de — Antwort innerhalb 48 h (werktags).

Letzte Änderung: 25.7.2026