Crawler-Richtlinie
NaduBerlinBot.
Diese Seite dokumentiert unser automatisiertes Lese-Verhalten — was wir lesen, wie höflich, und wie du uns ausschließen kannst.
User-Agent
NaduBerlinBot/1.0 (+https://nadu-berlin.de/bot; contact@nadu-berlin.de)Was wir lesen
- §5 UrhGPressemitteilungen von Polizei Berlin, Berliner Feuerwehr, den 12 Bezirksämtern und 11 Senatsverwaltungen via berlin.de RSS.
- DL-DE/by-2.0Offene Datensätze von daten.berlin.de und dem Geoportal Berlin (Spielplätze, Kitas, Schulen, Einschulungsbereiche).
- CC-BY 4.0Berlin Bühnen API (Kindertheater) und visitBerlin Partner-Feed (Familien-Veranstaltungen).
- LSR ≤150 ZeichenHeadline + kurzer Teaser + Deep-Link von privaten Verlagen (Tagesspiegel, Berliner Zeitung, BZ, Morgenpost, taz Berlin).
Wie höflich wir sind
- ≤ 1 Anfrage pro Sekunde pro Origin, mit 2 s Jitter.
- Keine parallelen Verbindungen zur selben Domain.
If-Modified-Since+ETagwo immer der Server sie unterstützt.- Wir parsen
/robots.txtbei jedem Crawl-Lauf und respektieren Disallow für unseren UA und für*. - Bei
429,403oder CAPTCHA: sofort zurück und manuelle Prüfung. - Wir crawlen ausschließlich aus europe-west3 (Frankfurt) — keine wechselnden IPs, kein Tor, keine Proxy-Rotation.
Was wir nie tun
- Kein Scraping personenbezogener Daten (Erzieher:innen-Namen, Verein-Mitglieder, etc.).
- Kein Login, kein Captcha-Lösen, keine Authentifizierungs-Bypässe.
- Kein RAG-Training, kein Modell-Training, kein Re-Hosting kompletter Artikel.
- Keine Verschleierung von User-Agent oder Herkunft.
Ausschließen
Du willst nicht, dass wir deine Seite lesen? Trag uns in deine /robots.txt ein:
User-agent: NaduBerlinBot
Disallow: /Wir lesen die Datei bei jedem Crawl-Lauf. Effekt innerhalb von 24 h.
Kontakt
Fragen, Probleme, Take-Down-Anfragen: contact@nadu-berlin.de — Antwort innerhalb 48 h (werktags).