Eine Website crawlen

Geben Sie Minaya eine Start-URL, und es folgt den Links von dieser Seite aus, bleibt dabei aber auf demselben Ursprung.

Standardwerte

EinstellungStandardBedeutung
Tiefe2Die Startseite, Seiten, auf die sie verlinkt, und Seiten, auf die jene wiederum verlinken.
Max. Seiten100Feste Obergrenze, damit eine große Website nicht unbegrenzt gecrawlt werden kann.
Timeout10sPro Seite. Eine langsame Seite wird übersprungen, statt den Crawl zu blockieren.

Tiefe 1 erreicht nur Seiten, die direkt von der Start-URL aus verlinkt sind. Hub-Seiten wie /portfolio listen ihre untergeordneten Seiten eine Ebene tiefer auf — deshalb ist 2 der Standardwert.

Was übersprungen wird

  • Andere Ursprünge. Nur Links zum selben Ursprung werden verfolgt.
  • Assets. Bilder, CSS, JS, Schriftarten, Archive, Medien und JSON.
  • Framework-Interna. Pfade wie /_next/, /cdn-cgi/ und /api/.
  • Anmelde- und Commerce-Seiten. Login, Registrierung, Warenkorb, Checkout und Suche.
  • Nicht-HTTP-Schemata. mailto:, tel:, javascript:.

URL-Fragmente werden vor dem Einreihen entfernt, sodass /about#team und /about als eine Seite behandelt und nur einmal abgerufen werden.

Was extrahiert wird

Von jeder Seite behält Minaya den Titel, die Überschriften, die Meta-Beschreibung und den Fließtext. Navigation, Fußzeilen, Skripte und Formatierung werden entfernt.

Zwei Details, die es zu kennen lohnt:

  • Kontaktdaten werden erfasst, bevor Fußzeilen entfernt werden, sodass Ihre E-Mail-Adresse und Telefonnummer erhalten bleiben, auch wenn die Fußzeile selbst verworfen wird.
  • Von Cloudflare verschleierte E-Mail-Adressen werden entschlüsselt. Websites hinter Cloudflare ersetzen Adressen häufig durch einen Platzhalter, den nur JavaScript entschlüsseln kann; Minaya stellt die tatsächliche Adresse wieder her.

JavaScript-gerenderte Websites

Der Crawler liest serverseitig gerendertes HTML und führt kein JavaScript aus. Die meisten Frameworks — Next.js, Nuxt, Astro — rendern ihre Inhalte serverseitig, daher ist dies in der Regel unproblematisch. Eine vollständig clientseitig gerenderte SPA, die nur eine leere Hülle ausliefert, liefert wenig oder gar nichts.

Um dies zu prüfen, rufen Sie den Seitenquelltext auf und suchen Sie nach einem Satz, den Sie im Browser sehen können. Fehlt er im HTML, fügen Sie diesen Inhalt stattdessen als Textquelle ein.

Einen Crawl überprüfen

Nach Abschluss eines Crawls zeigt die Quelle an, wie viele Abschnitte erzeugt wurden. Ein Ein-Seiten-Ergebnis bei einer großen Website deutet in der Regel darauf hin, dass die Inhalte clientseitig gerendert werden oder die erwarteten Seiten nicht von der Start-URL aus verlinkt waren.