Zum Inhalt springen

Korrelations- und Kovarianzrechner

Pearson-Korrelation sowie Stichproben- und Populationskovarianz zweier Listen mit Streudiagramm berechnen.

Gepaarte Daten

Verarbeitung im Browser.

2–200 Werte. Mit Leerzeichen, Komma oder Semikolon trennen. Dezimalpunkt: 1.5.

2–200 Werte. Mit Leerzeichen, Komma oder Semikolon trennen. Dezimalpunkt: 1.5.

Ergebnis

Zwei Listen eingeben und berechnen.

So funktioniert es

  1. Beide Listen in derselben Reihenfolge eingeben: Der erste Wert der einen gehört zum ersten Wert der anderen. Pro Liste eine einheitliche Maßeinheit verwenden und Überschriften sowie Einheitensymbole entfernen.
  2. Zahlen durch Leerzeichen, Kommas oder Semikolons trennen. Dezimalzahlen mit Punkt schreiben, etwa 1.5. Ein Komma trennt immer zwei Werte, auch bei deutscher Ergebnisausgabe. Wissenschaftliche Schreibweise wie 2e-3 ist möglich.
  3. Ergebnisse und Diagramme aktualisieren sich, sobald beide Listen gültig sind. Bei unvollständigen oder unterschiedlich langen Listen bleibt das Ergebnis leer. Berechnen zeigt bei Bedarf die Eingabefehler an.
  4. Ergebnisse kopieren übernimmt die numerische Zusammenfassung als Text. Leeren entfernt Eingaben und Ergebnisse. Das Diagramm erklärt die Rechnung auf dem Bildschirm; ein Bild- oder Datenexport ist nicht enthalten.

Beispiel

Verändern sich X und Y gemeinsam? Jeder Punkt ist ein Wertepaar. Hier steigt Y mit X: Die Korrelation ist positiv.

YX0214263

cov(X,Y) = Σ[(X − X̄)(Y − Ȳ)] / (n − 1)

X: 1 2 3 · Y: 2 4 6

r = 1 · Stichprobenkovarianz = 2

Beim Öffnen stehen diese Beispieldaten in den Feldern. Für eigene Daten ändern und anschließend berechnen.

Ergebnisse verstehen

Dieser Rechner beschreibt, wie zwei gemessene Größen gemeinsam variieren. Er eignet sich zum Nachrechnen von Aufgaben, für die erste Betrachtung gepaarter Messungen und zur Prüfung der Zusammenhangsrichtung vor einer Modellanpassung. Jeder Punkt steht für ein ursprüngliches Paar (X, Y).

Mit dx = X − Mittelwert(X) und dy = Y − Mittelwert(Y) gilt r = Σ(dx × dy) / √[Σ(dx²) × Σ(dy²)]. Die Stichprobenkovarianz teilt Σ(dx × dy) durch n − 1, die Populationskovarianz durch n. Beide Ergebnisse werden angezeigt, damit die passende Konvention gewählt werden kann.

Wenn beide Listen streuen, liegt r zwischen −1 und 1. Ein positives Vorzeichen beschreibt einen aufwärtsgerichteten linearen Trend, ein negatives einen abwärtsgerichteten. Nahe null kann dennoch ein gekrümmter Zusammenhang vorliegen. Das Streudiagramm deshalb vor einer pauschalen Stärkezuordnung ansehen.

Die Einheit der Kovarianz ist das Produkt der Eingabeeinheiten. Eine Umrechnung von Metern in Zentimeter ändert ihren Betrag. Die einheitenlose Korrelation bleibt bei positiver Skalierung unverändert. Die Populationsform beschreibt den vollständigen betrachteten Bestand; die Stichprobenform behandelt die Beobachtungen als Stichprobe.

Rechenbeispiele

X = 1, 2, 3 und Y = 2, 4, 6 ergeben n = 3, r = 1, Stichprobenkovarianz = 2 und Populationskovarianz ≈ 1,33. Alle Punkte liegen auf einer steigenden Geraden. Die Kovarianzen unterscheiden sich wegen der Teiler 2 und 3.

X = 1, 2, 3 und Y = 3, 2, 1 ergeben r = −1, Stichprobenkovarianz = −1 und Populationskovarianz ≈ −0,67. Mit Y = 5, 5, 5 ist die Kovarianz null und r nicht definiert, weil Y keine Streuung besitzt.

Eingabe, Genauigkeit und Ausgabe

Die ursprüngliche Paarzuordnung ist entscheidend. Getrenntes Sortieren der Listen erzeugt neue Paare und kann einen Zusammenhang künstlich herstellen. Auch ein einzelner Ausreißer oder das Zusammenlegen verschiedener Gruppen kann das Ergebnis bestimmen. Die Kennzahlen beweisen weder Kausalität noch Unabhängigkeit, statistische Signifikanz oder Vorhersagetauglichkeit.

Beide Listen benötigen gleich viele Werte, mindestens 2 und höchstens 200. Fehlende Einträge, Text, NaN und Unendlich werden abgewiesen. Null, negative und wiederholte Werte sind erlaubt. Bei fehlenden Beobachtungen das vollständige Paar entfernen, damit die Zuordnung erhalten bleibt.

Der Betrag eines von null verschiedenen Eingabewerts muss zwischen 1e-100 und 1e100 liegen. Der Browser rechnet mit etwa 15–16 signifikanten Stellen. Unterschiedliche Einträge, die dieselbe gespeicherte Zahl ergeben, werden abgewiesen; einen gemeinsamen Ausgangswert abziehen oder passendere Einheiten wählen.

Die Anzeige nutzt gewöhnlich höchstens zwei Nachkommastellen. Kleine Werte ungleich null erscheinen wissenschaftlich; Zwischenergebnisse bleiben ungerundet. Verschobene oder skalierte Achsen erklären ausdrücklich die Rückrechnung, damit kleine Unterschiede neben großen Ausgangswerten sichtbar bleiben.

Häufige Fragen

Warum ist r bei einer konstanten Liste nicht definiert?

Die Summe der quadrierten Abweichungen ist null und damit auch der Nenner. Kovarianz null ist weiterhin sinnvoll; r = 0 würde hingegen fälschlich einen gemessenen fehlenden linearen Zusammenhang ausdrücken.

Kann trotz r = 0 ein Zusammenhang bestehen?

Ja. Ein U-förmiges Muster kann kaum lineare Korrelation aufweisen. Im Diagramm lassen sich Krümmungen, Gruppen und Ausreißer erkennen, die ein einzelner Koeffizient nicht beschreibt.

Welche Kovarianz soll ich verwenden?

Beide verwenden dieselbe zentrierte Produktsumme. Für eine Stichprobe ist der Teiler n − 1 vorgesehen, für den vollständig beschriebenen Bestand n. Der Rechner kann die Bedeutung Ihrer Datenauswahl nicht bestimmen.

Belegt r nahe 1 eine Ursache?

Nein. Gemeinsame Ursachen, Auswahl der Beobachtungen oder Zufall können Zusammenhänge erzeugen. Bei nur zwei variierenden Paaren ist r immer +1 oder −1; zusätzliche Evidenz bleibt erforderlich.