Zum Inhalt springen
Zurück zur Themenübersicht

Angewandte Informatik

Internetdienste: E-Mail, WWW und Suchmaschinen

Warum das Internet nicht das WWW ist, wie Client und Server zusammenarbeiten und wie eine Suchmaschine in Millisekunden antwortet.

Benötigte Grundlagen

Dieses Vorwissen brauchst du für das Kapitel. Schau kurz nach, wenn dir etwas davon nicht mehr präsent ist, sonst leg direkt los.

Einführung

„Ich war heute den ganzen Nachmittag im Internet.“ Gemeint ist meist: im WWW, in einem Videodienst, in einem Messenger. Das ist ungefähr so, als würde man „Ich war auf der Autobahn“ sagen und den Supermarkt meinen, zu dem man gefahren ist.

Das Internet ist der Weg. Die Dienste sind die Ziele. Wer das trennt, versteht auf einmal, warum eine E-Mail ankommt, obwohl der schläft, warum eine Webseite erst auf Anfrage geliefert wird und warum eine Suchmaschine nicht das Internet durchsucht, wenn du auf „Suchen“ klickst.

Das kannst du nach diesem Kapitel

  • Internet und Dienst unterscheiden und drei Dienste nennen.

  • das Client-Server-Modell erklären und an einem Seitenaufruf durchspielen.

  • den Weg einer E-Mail beschreiben und begründen, warum sie zwischengelagert wird.

  • die drei Schritte einer Suchmaschine benennen und erklären, warum die Antwort so schnell kommt.

  • begründen, warum Suchergebnisse eine Reihenfolge haben und was das für die eigene Recherche bedeutet.

Der Unterschied, mit dem alles anfängt

Das Internet ist ein weltweiter Verbund von Rechnernetzen. Es leistet genau eine Sache: Es transportiert Datenpakete von einem Gerät zu einem anderen. Was in den Paketen steht, ist ihm gleichgültig.

Ein Dienst benutzt diesen Transport für einen bestimmten Zweck. Die bekanntesten sind:

  • WWW: Seiten abrufen und anzeigen
  • E-Mail: zustellen und zwischenlagern
  • Dateiübertragung, Messenger, Videostreaming, Onlinespiele

Jeder Dienst hat eigene Regeln dafür, wie die Beteiligten miteinander reden. Solche Regelwerke heißen Protokolle. Man kann sich das wie Umgangsformen vorstellen: Am Telefon meldet man sich mit dem Namen, im Brief schreibt man eine Anrede. Beides überträgt Sprache, die Form ist aber verabredet und unterschiedlich.

Transport und Zweck sind zweierlei

Das InternetEin DienstWas leistet es?transportiertDatenpakete vonGerät zu Gerätbenutzt diesenTransport füreinen ZweckWas ist der Inhalt der Pakete?gleichgültig, esliest nichthineingenau daraufkommt es ihm anBeispieleder Verbund derNetze selbstWWW, E-Mail,Messenger,VideostreamingDas Internet ist nicht das WWW.Das WWW ist einer der Dienste, diedarauf laufen.

Diese beiden Spalten sind der häufigste Anfängerirrtum des Kapitels: „Internet“ und „WWW“ werden im Alltag als dasselbe Wort benutzt. Lies die mittlere Zeile: Für das Internet ist der Inhalt eines Pakets ohne Bedeutung, es bringt es einfach ans Ziel. Erst der Dienst legt fest, wozu transportiert wird, und dazu braucht er eigene Regeln: sein Protokoll. Deshalb kann derselbe Transport gleichzeitig eine Seite, eine Mail und ein Videobild tragen.

Client und Server: wer fragt, wer antwortet

Fast alle Dienste teilen die Beteiligten in zwei Rollen.

Der Client stellt Anfragen. Das ist dein Browser, dein Mailprogramm, deine Spiele-App.

Der Server wartet auf Anfragen und beantwortet sie. Er läuft rund um die Uhr und bedient viele Clients gleichzeitig.

Wichtig ist: Das sind Rollen, keine Gerätetypen. Dein Rechner ist Client, wenn du eine Seite abrufst, und kann im selben Moment Server für den Drucker im Netzwerk sein.

Wer fragt, wer antwortet

Client 1AnfrageAntwortClient 2Client 3Server

Achte auf die Pfeilrichtung: Die Anfrage geht immer vom Client aus, die Antwort kommt zurück. Der Server beginnt nie von sich aus ein Gespräch, er wartet. Und weil das eine Rolle ist und keine Bauart, kann dasselbe Gerät beides sein: Dein Rechner ist Client, während er eine Seite abruft, und im selben Moment Server für den Drucker im Netzwerk.

Was beim Aufruf einer Seite passiert

Du gibst eine Adresse ein und drückst die Eingabetaste. Danach läuft Folgendes ab:

  1. Der Browser muss wissen, welcher Rechner gemeint ist. Der Name in der Adresse ist für Menschen gemacht; das Netz braucht eine Nummer. Also fragt er beim Namensdienst nach, der Namen in Adressen übersetzt.
  2. Er schickt eine Anfrage an diesen Rechner: „Gib mir die Seite mit diesem Pfad.“
  3. Der Server sucht die Seite heraus und schickt sie als Antwort zurück, zusammen mit einer Statusangabe. Die Zahl 404 kennst du: Sie heißt „so eine Seite gibt es hier nicht“.
  4. Der Browser liest die Seite und stellt fest, dass Bilder, Schriften und Gestaltungsdateien fehlen. Für jede davon stellt er eine weitere Anfrage.
  5. Erst wenn alles da ist, ist die Seite vollständig aufgebaut.

Aus Schritt 4 folgt etwas Praktisches: Eine Seite mit 60 Bildern verursacht mindestens 61 Anfragen. Genau deshalb lädt eine bildlastige Seite spürbar länger als eine schlichte, selbst bei gleicher Dateigröße.

Ein Seitenaufruf, Schritt für Schritt

Namen auflösenDer Namensdienst liefert dieNummer zum Namen.Name ist jetzt eine NummerAnfrageGib mir die Seite mit diesemPfad.die Anfrage ist unterwegsAntwortDie Seite, dazu eineStatusangabe, etwa 404.Browser liest und stellt fest:es fehlt etwasNachladenje Bild, Schrift undGestaltungsdatei eine weitereAnfragesobald die letzte Antwort daistSeite stehterst, wenn alles davonangekommen ist

Die vierte Station ist die, die man selten mitdenkt, und die erklärt, warum manche Seiten so lange laden. Rechne es nach: Eine Seite mit 60 Bildern braucht die eine Anfrage für die Seite selbst plus 60 weitere, also mindestens 61. Deshalb kann eine bildlastige Seite spürbar langsamer sein als eine schlichte, selbst wenn beide gleich viele übertragen: Es ist nicht die Menge, es ist die Anzahl der Runden.

Warum die E-Mail anders funktioniert

Beim WWW sind Client und Server gleichzeitig aktiv: Du fragst, der Server antwortet sofort. Bei der E-Mail geht das nicht, denn der schläft vielleicht.

Deshalb schiebt sich zwischen beide ein Lager:

  1. Dein Programm übergibt die an den Postausgangsserver deines Anbieters.
  2. Dieser reicht sie an den Eingangsserver des Empfängeranbieters weiter, oft über Zwischenstationen.
  3. Dort liegt sie im Postfach.
  4. Irgendwann holt das Programm des Empfängers sie ab.

Diese Zwischenlagerung ist der Grund, warum E-Mail auch dann funktioniert, wenn beide nie gleichzeitig online sind. Sie ist zugleich der Grund, warum eine abgeschickte Mail nicht mehr zurückgeholt werden kann: Sie liegt bereits auf einem fremden Rechner.

Wie eine Suchmaschine antwortet

Wenn du suchst, durchsucht die Suchmaschine nicht das Internet. Das wäre unmöglich schnell. Sie hat lange vorher gearbeitet, in drei Schritten:

Sammeln. Programme, sogenannte Crawler, rufen Seiten ab, folgen allen Verweisen darauf, rufen die nächsten Seiten ab und so fort. So entsteht nach und nach eine riesige Sammlung.

Aufbereiten. Aus jeder Seite wird ein Index gebaut: eine Liste, die zu jedem Wort vermerkt, auf welchen Seiten es vorkommt. Das ist dasselbe Prinzip wie das Stichwortverzeichnis am Ende eines Sachbuchs. Und aus demselben Grund ist es schnell: Man liest nicht das Buch, man schlägt im Verzeichnis nach.

Antworten. Deine Suchanfrage wird im Index nachgeschlagen. Weil dort steht, wo das Wort vorkommt, findet die Maschine die Treffer in Millisekunden.

Daraus folgen zwei Dinge, die du kennen solltest:

  • Was der Crawler nicht erreicht hat, kann nicht gefunden werden. Seiten hinter einer Anmeldung stehen in keinem Index.
  • Der Index enthält meist Millionen Treffer. Also muss die Maschine sie sortieren, und dafür braucht sie Regeln: Wie oft kommt das Wort vor? Wie viele andere Seiten verweisen auf diese Seite? Passt der Inhalt zur vermuteten Absicht? Bezahlte Anzeigen kommen zusätzlich hinzu und sind gekennzeichnet.

Die Reihenfolge ist damit eine Bewertung, keine Rangliste der Wahrheit. Für die eigene Recherche heißt das: Der erste Treffer ist der von der Maschine bestbewertete, nicht der richtigste.

Warum eine Antwort so schnell kommt

SammelnCrawler rufen Seiten ab undfolgen deren Verweisen.läuft ständig, lange vor deinerSucheAufbereitenIndex: zu jedem Wort dieSeiten, auf denen es stehterst jetzt, in MillisekundenAntwortenim Index nachschlagen, Treffersortieren

Der ganze Trick steckt in den beiden Pfeilbeschriftungen. Die ersten beiden Stationen sind längst gelaufen, bevor du überhaupt getippt hast; nur die dritte passiert jetzt. Deine Suche durchsucht also nicht das Internet, sondern schlägt in einem fertigen Verzeichnis nach, genau wie du am Ende eines Sachbuchs im Stichwortverzeichnis nachschlägst, statt das Buch zu lesen. Daraus folgt aber auch: Was der Crawler nie erreicht hat, etwa alles hinter einer Anmeldung, steht in keinem Index und ist deshalb nicht findbar.

Ein Seitenaufruf, Schritt für Schritt

Du rufst eine Schulhomepage auf, die aus einer Seite, einer Gestaltungsdatei und 8 Bildern besteht. Beschreibe, was abläuft, und gib die Anzahl der Anfragen an.

  1. 1

    Der Browser lässt den Namen der Adresse in eine Netzadresse übersetzen. Erst danach weiß er, an welchen Rechner er sich wenden soll.

  2. 2

    Er sendet die erste Anfrage und erhält das Grundgerüst der Seite zurück.

  3. 3

    Beim Lesen findet er die Verweise auf die Gestaltungsdatei und die 8 Bilder. Keine dieser war Teil der ersten Antwort.

  4. 4

    Für jede stellt er eine weitere Anfrage: 1+8=91 + 8 = 9 zusätzliche.

  5. 5

    Insgesamt sind es 1+9=101 + 9 = 10 Anfragen. Erst wenn alle beantwortet sind, ist die Seite vollständig.

10 Anfragen. Deshalb wirkt eine Seite mit vielen Einzelteilen langsam, auch wenn die Teile klein sind.

Warum Suchen so schnell geht

Vergleiche zwei Wege, in einem Buch mit 400 Seiten alle Stellen zum Wort „Photosynthese“ zu finden.

  1. 1

    Weg 1: durchlesen. Du gehst Seite für Seite durch. Bei 400 Seiten und einer halben Minute je Seite sind das über drei Stunden.

  2. 2

    Weg 2: Stichwortverzeichnis. Du schlägst hinten unter P nach und findest „Photosynthese: 112, 118, 245“. Das dauert zehn Sekunden.

  3. 3

    Der Unterschied liegt nicht an der Lesegeschwindigkeit, sondern daran, dass die Arbeit schon getan war: Jemand hat das Verzeichnis vorher erstellt.

  4. 4

    Genau so arbeitet eine Suchmaschine. Der Crawler und die Indexerstellung sind das Anlegen des Verzeichnisses; deine Suche ist das Nachschlagen.

  5. 5

    Der Preis ist ebenfalls derselbe: Ein Verzeichnis kann veraltet sein. Eine Seite, die vor einer Stunde entstanden ist, steht vielleicht noch in keinem Index.

Schnell ist das Nachschlagen, nicht das Suchen. Die eigentliche Arbeit passiert vorher.

Typischer Fehler

„Wenn ich etwas suche, durchsucht die Suchmaschine gerade jetzt das ganze Internet für mich.“

Ein einfacher Größenvergleich zeigt, dass das nicht sein kann. Das WWW umfasst Milliarden Seiten; sie alle abzurufen dauert selbst mit riesigen Rechenzentren Wochen. Deine Antwort kommt aber nach Bruchteilen einer Sekunde. Beides zusammen ist unmöglich.

Was tatsächlich passiert: Die Maschine schlägt in einem vorher aufgebauten Index nach. Der wird laufend aktualisiert, ist aber immer ein Stand von gestern oder von vorhin.

Diese Einsicht hat praktische Folgen. Erstens erklärt sie, warum ganz frische Seiten manchmal nicht auffindbar sind. Zweitens erklärt sie, warum ein Treffer manchmal auf eine Seite führt, die inzwischen gelöscht wurde: Im Index steht sie noch. Und drittens macht sie klar, dass Inhalte hinter einer Anmeldung grundsätzlich nicht auffindbar sind, weil der Crawler dort nie hineingekommen ist.

Übung 1

leicht

a) Nenne drei Internetdienste außer dem WWW. b) Wer ist beim Abruf einer Webseite Client, wer Server? c) Was bedeutet die Antwort mit der Zahl 404?

Tipp anzeigen

Zu b): Wer fragt zuerst?

Lösung anzeigen

a) Zum Beispiel E-Mail, Dateiübertragung, Messenger, Videostreaming, Onlinespiele.

b) Der Browser ist der Client, weil er die Anfrage stellt. Der Rechner, der die Seite bereithält, ist der Server.

c) Der Server hat die Anfrage verstanden, hat aber unter diesem Pfad nichts. Die Adresse ist also erreichbar, die gesuchte Seite existiert dort nicht.

Detaillierte Schritterklärung anzeigen

Hier wird jeder Schritt einzeln erklärt, vor allem, warum er gemacht wird.

Erklärungstiefe

✦ Empfohlen: Standard – Die normale Erklärungstiefe passt zum Einstieg.

  1. 1

    a) Internet und WWW auseinanderhalten

    Das Internet ist das Netz, das WWW nur einer der Dienste, die darauf laufen. Andere Dienste sind E-Mail, Dateiübertragung, Messenger, Videostreaming und Onlinespiele, sie benutzen dasselbe Netz, aber eigene Regeln.

  2. 2

    b) Client und Server über die Frage bestimmen, nicht über das Gerät

    Client ist, wer fragt; Server ist, wer antwortet. Der Browser stellt die Anfrage, also ist er der Client. Der Rechner, der die Seite bereithält und ausliefert, ist der Server.

  3. 3

    c) 404 lesen: Was die Antwort über den Fehlerort verrät

    Die Zahl 404 bedeutet: Der Server hat die Anfrage verstanden, findet unter diesem Pfad aber nichts. Die Adresse ist also erreichbar, nur die gesuchte Seite existiert dort nicht.

Übung 2

mittel

Eine Schülerin schickt um 23 Uhr eine E-Mail an ihre Lehrerin, deren Rechner ausgeschaltet ist. Am nächsten Morgen ist die Mail da.

a) Erkläre, wie das möglich ist. b) Warum funktioniert ein Videoanruf unter denselben Bedingungen nicht? c) Die Schülerin merkt, dass ein Fehler in der Mail steckt, und möchte sie zurückholen. Warum geht das nicht?

Tipp anzeigen

Zu b): Was müssen beide Seiten bei einem Anruf gleichzeitig tun?

Lösung anzeigen

a) Die Mail wird nicht direkt an den Rechner der Lehrerin geschickt, sondern über den Postausgangsserver an den Eingangsserver ihres Anbieters. Dieser Server läuft ständig und lagert die im Postfach. Am Morgen holt das Programm der Lehrerin sie dort ab.

b) Ein Videoanruf überträgt Bild und Ton in dem Moment, in dem sie entstehen. Es gibt nichts zwischenzulagern, denn ein Gespräch mit zwölf Stunden Verzögerung ist kein Gespräch. Beide Seiten müssen also gleichzeitig erreichbar sein.

c) Weil die Nachricht bereits auf einem fremden Rechner liegt, nämlich beim Anbieter der Empfängerin. Die Absenderin hat dort keinerlei Zugriff. Was manche Programme als „Zurückrufen“ anbieten, ist nur eine Bitte an den Empfängerserver, die Mail zu löschen, und die kann abgelehnt werden oder zu spät kommen.

Detaillierte Schritterklärung anzeigen

Hier wird jeder Schritt einzeln erklärt, vor allem, warum er gemacht wird.

Erklärungstiefe

✦ Empfohlen: Standard – Die normale Erklärungstiefe passt zum Einstieg.

  1. 1

    Erst klären: Wohin geht die Mail wirklich?

    Der häufigste Denkfehler ist, sich eine E-Mail wie einen direkten Draht zwischen zwei Rechnern vorzustellen. Tatsächlich geht sie zuerst an einen Server des eigenen Anbieters und von dort an einen Server des Empfängeranbieters.

    Zwischenergebnis

    Zwischen Absender und Empfänger liegen mindestens zwei ständig laufende Server.

    Diese Server sind der Grund, warum eine Mailadresse aus zwei Teilen besteht: Der Teil hinter dem At-Zeichen benennt den zuständigen Server.

  2. 2

    Teil a): Warum der ausgeschaltete Rechner egal ist

    Der Rechner der Lehrerin ist gar nicht das Ziel der Übertragung. Ziel ist das Postfach auf dem Server. Ihr Programm holt die Nachricht später von dort ab, und dieses Abholen ist ein eigener, späterer Vorgang.

    Zwischenergebnis

    Zustellung und Abholung sind zwei getrennte Schritte. Nur der erste passiert um 23 Uhr.

  3. 3

    Teil b): Was ein Videoanruf zusätzlich verlangt

    Bei der Mail darf zwischen Absenden und Lesen beliebig viel Zeit vergehen. Beim Videoanruf nicht: Bild und Ton sind nur in dem Moment sinnvoll, in dem sie entstehen. Ein Zwischenlager würde die Aufnahme aufbewahren, aber kein Gespräch ermöglichen.

    Zwischenergebnis

    Der Videoanruf braucht Gleichzeitigkeit, die E-Mail nicht.

  4. 4

    Teil c): Wem die Nachricht jetzt gehört

    Sobald der Empfängerserver die Nachricht angenommen hat, liegt sie in einem Bereich, auf den die Absenderin keinen Zugriff hat. Löschen könnte nur, wer diesen Server betreibt.

    Zwischenergebnis

    Ein echtes Zurückholen ist ausgeschlossen; möglich ist nur eine Bitte um Löschung.

    Dieselbe Überlegung gilt für jede Nachricht, die man abschickt, auch im Messenger. Wer sie schon gelesen oder abgespeichert hat, ist nicht mehr erreichbar.

Übung 3

schwer

Ein Schüler sucht Material für ein Referat über Bienensterben.

a) Erkläre, warum die Suchmaschine in weniger als einer Sekunde antwortet, obwohl das WWW Milliarden Seiten hat. b) Der erste Treffer ist ein Blogbeitrag ohne Datum und Autor. Wie bewertest du ihn und warum? c) Eine wissenschaftliche Datenbank hinter einer Anmeldung enthält bessere Quellen, taucht aber nicht auf. Erkläre den Grund technisch. d) Formuliere zwei Suchanfragen zum selben Thema, die unterschiedlich gute Treffer liefern dürften, und begründe den Unterschied.

Tipp anzeigen

Zu d): Der Index enthält Wörter. Welche Wörter kommen in guten Quellen vor, welche nur in Alltagstexten?

Lösung anzeigen

a) Weil sie nicht das WWW durchsucht, sondern einen vorher aufgebauten Index. Crawler haben die Seiten eingesammelt, danach wurde zu jedem Wort vermerkt, auf welchen Seiten es vorkommt. Die Suche ist ein Nachschlagen in dieser Liste.

b) Zurückhaltend. Die Position sagt nur, dass die Bewertungsregeln der Maschine diese Seite vorn einsortiert haben, etwa weil viele Seiten darauf verweisen. Ohne Autor und Datum lässt sich weder die Sachkenntnis noch die Aktualität prüfen, und beides ist bei einem naturwissenschaftlichen Thema entscheidend.

c) Der Crawler hat sich nie angemeldet, kann die Seiten also nie abgerufen haben. Was nie abgerufen wurde, steht in keinem Index, und was in keinem Index steht, kann nicht als Treffer erscheinen.

d) Beispiel 1: „warum sterben bienen“ liefert viele Alltagstexte und Meinungsbeiträge. Beispiel 2: „Ursachen Bienensterben Neonicotinoide Studie“ liefert eher Fachtexte. Der Grund: Der Index findet Wörter. Fachwörter kommen fast nur in fachlichen Quellen vor, umgangssprachliche Formulierungen fast überall. Wer die Sprache der gesuchten Quelle verwendet, filtert schon durch die Anfrage.

Detaillierte Schritterklärung anzeigen

Hier wird jeder Schritt einzeln erklärt, vor allem, warum er gemacht wird.

Erklärungstiefe

✦ Empfohlen: Standard – Die normale Erklärungstiefe passt zum Einstieg.

  1. 1

    a) Die Suchmaschine durchsucht nicht das Netz, sondern einen Index

    Sie antwortet so schnell, weil sie nicht das WWW durchsucht, sondern einen vorher aufgebauten Index. Crawler haben die Seiten eingesammelt; danach wurde zu jedem Wort vermerkt, auf welchen Seiten es vorkommt. Die Suche selbst ist nur ein Nachschlagen in dieser Liste.

  2. 2

    b) Was die Trefferposition aussagt und was nicht

    Der erste Platz sagt nur, dass die Bewertungsregeln der Maschine diese Seite vorn einsortiert haben, etwa weil viele Seiten darauf verweisen. Ohne Autor und Datum lässt sich weder Sachkenntnis noch Aktualität prüfen, bei einem naturwissenschaftlichen Thema ist beides entscheidend. Also: zurückhaltend bewerten.

  3. 3

    c) Warum die bessere Quelle unsichtbar bleibt

    Der Crawler hat sich nie angemeldet, konnte die Seiten also nie abrufen. Was nie abgerufen wurde, steht in keinem Index; was in keinem Index steht, kann nicht als Treffer erscheinen. Die Kette ist lückenlos und rein technisch.

  4. 4

    d) Die Anfrage in der Sprache der gesuchten Quelle stellen

    „warum sterben bienen“ liefert vor allem Alltagstexte und Meinungsbeiträge. „Ursachen Bienensterben Neonicotinoide Studie“ liefert eher Fachtexte. Der Grund: Der Index findet Wörter. Fachwörter kommen fast nur in fachlichen Quellen vor, umgangssprachliche Formulierungen fast überall.

Zusammenfassung

Das Internet transportiert Datenpakete, die Dienste geben diesem Transport einen Zweck; WWW und E-Mail sind zwei davon, und jeder Dienst hat sein eigenes Protokoll. In fast allen Diensten fragt ein Client und antwortet ein Server, wobei beides Rollen sind und keine Geräte. Ein Seitenaufruf beginnt mit der Namensauflösung und braucht für jede eingebundene eine eigene Anfrage. E-Mail unterscheidet sich vom WWW durch die Zwischenlagerung im Postfach: Deshalb funktioniert sie ohne Gleichzeitigkeit, und deshalb lässt sich eine abgeschickte nicht zurückholen. Suchmaschinen durchsuchen nicht das Internet, sondern einen vorher aufgebauten Index; ihre Trefferreihenfolge ist eine Bewertung nach Regeln und kein Urteil über Richtigkeit.