TASIOMIND.DEV — OPERATIONAL▸▸▸FULL STACK DEVELOPER @ GWQ SERVICEPLUS AG▸▸▸FOUNDER — K8SGPT.AI▸▸▸OPEN SOURCE: ACTIVE▸▸▸DISTRIBUTED SYSTEMS / KUBERNETES / AI▸▸▸RUST + GO + PYTHON▸▸▸FIELD TESTED / STATUS — NOMINAL▸▸▸LOCATION: EUROPE/BERLIN▸▸▸TASIOMIND.DEV — OPERATIONAL▸▸▸FULL STACK DEVELOPER @ GWQ SERVICEPLUS AG▸▸▸FOUNDER — K8SGPT.AI▸▸▸OPEN SOURCE: ACTIVE▸▸▸DISTRIBUTED SYSTEMS / KUBERNETES / AI▸▸▸RUST + GO + PYTHON▸▸▸FIELD TESTED / STATUS — NOMINAL▸▸▸LOCATION: EUROPE/BERLIN▸▸▸

web scraping

February 23, 2017

Was ist Web Scraping?

Automatisches Auslesen von Webseiteninhalten, um Daten zu strukturieren. Oft als Alternative, wenn es keine API gibt.

Typischer Ablauf

  • Zielseite analysieren (HTML Struktur, IDs, Klassen)
  • HTTP Requests senden
  • HTML parsen
  • Daten speichern (CSV, JSON, DB)
  • Rate Limiting und Fehlerbehandlung

Tools (Python)

  • requests + BeautifulSoup fuer einfache Seiten
  • Scrapy fuer groessere Crawler
  • Playwright/Selenium fuer Seiten mit viel JavaScript

Rechtliches und Ethik

  • Nutzungsbedingungen pruefen
  • robots.txt respektieren (kein Gesetz, aber guter Stil)
  • Nicht zu schnell oder zu oft anfragen
  • Keine persoenlichen Daten sammeln

Wenn moeglich: API nutzen

APIs sind stabiler, schneller und oft offiziell erlaubt. Scraping ist die "Plan B" Variante.

Weiterfuehrende Links