
Ein Muster zu finden ist leicht - wann eine Abweichung wirklich ein Signal ist
Ein Muster zu finden ist leicht. Zu wissen, ob es echt ist, ist die Arbeit.
Zwei Kurven laufen ähnlich, und schon steht eine Massnahme im Raum. Ein Tag sieht auffällig aus, und schon sucht jemand die Ursache. Eine Prognose zeigt nach oben, und schon wird Personal eingeplant. In allen drei Fällen fehlt derselbe Schritt: die Prüfung, ob das Gefundene einem zweiten Blick standhält.
Dieser Beitrag geht durch, wie man Zusammenhänge, Ausreisser, Prognosen und Einflussfaktoren so rechnet, dass sie eine Entscheidung tragen können. Er baut auf Der halbe Ausfall auf, wo es um beschädigte Tage ging, und auf 800 Besucher sind keine Antwort, wo die Wetterkorrelation und der exakte p-Wert stehen.
Fünfzehn Paare, ein Zufallstreffer
Wer sechs Kennzahlen eines Standorts auf Zusammenhänge prüft - Besucher, Kunden, Fahrgäste, Verweildauer, Geschlechterverteilung, Gruppenanteil -, prüft 15 Paare. Bei der üblichen Schwelle von fünf Prozent je Einzeltest ist ein Zufallstreffer dabei nicht die Ausnahme, sondern zu erwarten - auch in Daten, die aus reinem Rauschen bestehen.
Der übliche Weg macht daraus einen Befund. Jedes Paar wird geprüft, als wäre es der einzige Test gewesen. Der Bericht zeigt den einen Treffer, die 14 unauffälligen Paare erwähnt niemand. Aus dem Zufall wird ein Umbau, eine Kampagne, ein geänderter Dienstplan.
Dagegen hilft eine Korrektur für die Zahl der gleichzeitig geprüften Paare. Die gebräuchlichste ist das Verfahren nach Benjamini und Hochberg: Alle berechenbaren Paare werden gemeinsam betrachtet, nach ihrem p-Wert sortiert und so angepasst, dass der Anteil falscher Entdeckungen unter allen Treffern kontrolliert bleibt. Signifikant ist danach, was den angepassten Wert q unter 0,05 hält - nicht, was p unter 0,05 hat.
Das Ergebnis sind weniger Treffer. Aber solche, auf die man eine Investition stützen kann.
Für die Stärke gelten feste Bänder: ab einem Betrag von 0,7 stark, ab 0,4 moderat, ab 0,2 schwach. Die Liste der stärksten positiven und negativen Zusammenhänge enthält ausschliesslich Paare, die die Korrektur überstanden haben.
Sechs Schutzmechanismen vor dem ersten Koeffizienten
Die meisten falschen Zusammenhänge entstehen nicht in der Formel, sondern in den Daten davor. Deshalb laufen sechs Prüfungen, bevor gerechnet wird:
- Beschädigte Tage fallen heraus, wie in Der halbe Ausfall beschrieben.
- Eine Kennzahl nimmt nur teil, wenn sie an mindestens der Hälfte der Tage definiert ist - und je Paar an mindestens sieben.
- Eine Kennzahl ohne Streuung fällt heraus. Eine Konstante kann mit nichts zusammenhängen, wohl aber eine Zahl erzeugen.
- Identitäten stehen gar nicht erst in der Matrix. Der Frauenanteil korreliert per Definition mit −1,0 gegen den Männeranteil; das ist Arithmetik, kein Befund.
- Fehlwerte bleiben leer. Kein Auffüllen mit null oder einem Mittelwert.
- Eine Tagesliste für alle Reihen, damit derselbe Index überall derselbe Tag ist.
Kennzahlen, die an einer dieser Prüfungen scheitern, verschwinden nicht still. Sie stehen in einer eigenen Liste „ohne nutzbare Daten“ auf derselben Seite.
Welcher Tag verlangt eine Erklärung?
Ein auffälliger Tag fällt im Liniendiagramm meist erst auf, wenn ihn jemand sucht. Die naheliegende Automatisierung - alles, was mehr als zwei oder drei Standardabweichungen vom Mittel abweicht - hat einen eingebauten Fehler: Der Ausreisser verzerrt genau die Kennzahlen, an denen er gemessen wird. Ein extremer Tag hebt das Mittel und vergrössert die Standardabweichung, und beides zusammen macht ihn weniger auffällig.
Robuste Statistik umgeht das, indem sie Grössen verwendet, die ein einzelner Ausreisser kaum bewegt:
- Der modifizierte z-Wert misst die Abweichung vom Median, geteilt durch den Median der absoluten Abweichungen (MAD), mit dem Faktor 0,6745. Median und MAD bleiben stabil, auch wenn ein Tag völlig aus dem Rahmen fällt.
- Der Interquartilszaun reicht vom unteren Quartil minus dem 1,5-Fachen des Quartilsabstands bis zum oberen Quartil plus demselben Abstand.
Anomal ist ein Tag ab einem modifizierten z-Wert von 2,5 im Betrag oder ausserhalb des Zauns, kritisch ab 3,5. Treffer, die nur der Zaun meldet, gelten als Information.
Ein zweites Detail macht die Erkennung im Betrieb brauchbar. Werktage und Wochenenden haben an den meisten Standorten verschiedene Niveaus, und ein gewöhnlicher Samstag ist gegen ein Werktagsprofil immer auffällig. Deshalb werden beide Segmente getrennt bewertet, sobald jedes mindestens acht Beobachtungen hat.
Die Erkennung beginnt ab 14 Tagen mit Daten. Kennzahlen mit zu wenigen Beobachtungen erscheinen ausdrücklich als übersprungen. Und die Empfindlichkeit ist bewusst fest: Eine Schwelle, die sich nach Belieben herunterdrehen lässt, findet am Ende immer die Anomalie, die jemand sucht.
Eine Anomalie ist dabei eine Aufforderung, nicht eine Antwort. Sie sagt, welcher Tag eine Erklärung verlangt. Die Erklärung steht meistens im Kalender oder in einer Notiz am Tag.
Die Prognose: das eigene Wochenmuster, fortgeschrieben
Personal, Warenannahme und Öffnungszeiten werden für die kommenden Wochen geplant - meist aus der Erinnerung an die letzte. Ein Wochenmuster über Monate hat niemand im Kopf, und ein einzelner Feiertag verschiebt die Erinnerung dauerhaft in die falsche Richtung.
Das Verfahren dafür heisst Holt-Winters, eine dreifache exponentielle Glättung. Es schätzt drei Dinge und schreibt sie fort: das Niveau, den Trend und die Wochensaisonalität - also wie viel ein Dienstag im Verhältnis zur Woche bringt. Multiplikativ heisst dabei: Der Dienstag ist nicht „200 Besucher weniger“, sondern „15 Prozent unter dem Wochenmittel“, und das bleibt auch dann richtig, wenn das Niveau steigt.
Wie stark jede der drei Komponenten auf neue Daten reagiert, legen drei Glättungsparameter fest. Sie werden nicht geraten, sondern über 80 Kombinationen gesucht, und die beste gewinnt. Drei Eigenschaften machen daraus eine belastbare Prognose statt einer, die gut aussieht:
- Lücken treiben die Rechnung an, zählen aber nicht. Fehlende Tage werden nur interpoliert, damit die Rekursion weiterläuft, und bleiben aus jeder Fehlerkennzahl ausgeschlossen. Die Reihe wird auf echte Kalendertage aufgespannt, damit ein fehlender Tag den Wochentag nicht verschiebt.
- Divergierende Kombinationen fallen heraus. Eine Parameterwahl, die unmögliche Werte erzeugt, wird verworfen.
- Das Ersatzmodell wird benannt. Trägt keine Kombination, fällt die Prognose auf den Median je Wochentag zurück - mit eigenem Grund im Ergebnis und sichtbarer Kennzeichnung. Kein stilles Verschlechtern.
Geschlossene Wochentage werden als geschlossen ausgewiesen, nicht als sehr kleine Zahl. Der Horizont reicht von einem bis 30 Tagen, Wochensummen kennzeichnen angebrochene Wochen. Und die Diagnostik liegt offen: die drei Glättungsparameter, die Saisonperiode, der mittlere absolute Fehler und die Wurzel aus dem mittleren quadratischen Fehler - nicht versteckt hinter einer Ampel.
Die Einführungskurve
Eine Prognose ist nur so gut wie die Geschichte, die sie fortschreibt. Gerechnet wird auf Tagen mit tatsächlichen Daten, nicht auf dem gewählten Kalenderbereich:
| Ab Tag | Was die Prognose kann |
|---|---|
| 14 | Minimum. Ein Wochenmuster braucht zwei vollständige Zyklen; vorher bleibt das Ergebnis bewusst leer |
| 28 | Das Wochenmuster ist stabil genug, um Planungsgespräche zu tragen |
| 60 | Einzelne Ausreissertage dominieren die Saisonfaktoren nicht mehr. Erst hier lohnt eine Aussage über den Trend |
Diese Kurve gehört in jede Einführungsplanung. Ein Standort, der heute in Betrieb geht, hat in vier Wochen ein brauchbares und in zwei Monaten ein gutes Prognosesignal.
Treiber oder Begleiter
Hier liegt die Unterscheidung, die in den meisten Auswertungen fehlt, und sie ist der eigentliche Wert dieses Teils.
Diagramme mit „Einflussfaktoren“ sind leicht zu erzeugen und leicht misszuverstehen. Der häufigste Fehler: Grössen, die am selben Tag gemessen werden wie die Zielgrösse, landen ganz oben und „erklären“ sie. Die Fahrgastzahl etwa korreliert mit r ≈ 0,999 gegen die Besucherzahl - beide kommen von derselben Zähllinie am selben Tag. Als Balken wäre sie der stärkste Treiber der Seite, und vollständig ohne Planungswert.
| Begleiter - am selben Tag gemessen | Treiber - vor dem Tag bekannt |
|---|---|
| Fahrgastzahl derselben Zähllinie | Wochenende ja oder nein |
| Verweildauer | Besucherzahl des Vortags |
| Geschlechterverteilung | Besucherzahl desselben Wochentags der Vorwoche |
| Gruppenanteil | Temperatur und Niederschlag |
Die linke Spalte entsteht erst mit dem Besuch selbst. Sie beschreibt den Tag, sie sagt ihn nicht voraus. Deshalb steht sie in einer eigenen Tabelle, nie im Ranking der Einflussfaktoren und nie im Modell. Nur was vor dem Tag bekannt ist, kann den Tag erklären.
Für die rechte Spalte gibt es zwei Rechenwege. Numerische Faktoren werden je Faktor über eine einfache Regression bewertet. Kategoriale Faktoren wie der Wochentag über ein bias-korrigiertes Epsilon-Quadrat - sonst erzeugt schon die reine Zahl der Gruppen eine scheinbare Stärke. Die Kopfzahl ist ein echtes multivariates adjustiertes R²; ist das Modell kollinear oder singulär, liefert es ausdrücklich kein Ergebnis statt einer beruhigenden Zahl.
Zeitverzögerte Faktoren - Vortag, gleicher Wochentag der Vorwoche - werden über das Kalenderdatum gesucht, nicht über die Position in einer Liste. Fehlt ein Tag, wäre sonst „der Vortag“ plötzlich vorgestern.
Was wäre, wenn: ein Rechenweg, kein Orakel
„Was wäre, wenn wir eine Stunde länger öffnen?“ wird in vielen Sitzungen geschätzt, meist von der Person, die am überzeugendsten schätzt. Was fehlt, ist kein Orakel, sondern ein nachvollziehbarer Rechenweg, der für alle derselbe ist und dessen Annahmen offen daneben stehen.
Die Basislinie kommt aus den eigenen Daten: der historische Mittelwert je Wochentag und Stunde. Darauf wirken vier Hebel, und jeder steht mit seinem Wert sichtbar im Szenario:
| Hebel | Wirkung auf die Basislinie | Herkunft |
|---|---|---|
| Wetter | sonnig ×1,12, Regen ×0,83, kalt ×0,88, heiss ×0,93 | Branchenannahme |
| Feiertag | Besucher ×1,38 | Branchenannahme |
| Personal | Elastizität 0,28 auf die Kundenzählung | Branchenannahme |
| Neue Öffnungsstunde | 30 Prozent des benachbarten Stundenniveaus | aus den eigenen Daten |
Dass drei der vier Hebel Branchenannahmen sind, steht nicht im Kleingedruckten, sondern sichtbar im Szenario. Das ist der Punkt: Ein Szenario ist ein strukturiertes Gedankenexperiment, und jeder im Raum sieht, mit welchen Annahmen es rechnet. Wer eine andere Annahme für seinen Standort für richtig hält, kann darüber diskutieren - statt über das Ergebnis.
Die Beiträge der einzelnen Hebel werden schrittweise zugerechnet und ergeben zusammen genau die Kopfzahl. Unter 100 Gruppen aus Datum und Stunde bleibt das Szenario leer statt einer Reihe von Nullen.
Die erste und die letzte Stunde
Öffnungszeiten sind meist historisch gewachsen. Ob die erste Stunde ihren Betrieb trägt, ob vor der Öffnung schon Menschen da sind, ob die letzte Stunde noch Verkehr hat - das vermutet ein Standort, oft über Jahre.
Die Auswertung dafür ist bewusst beschreibend, mit offengelegten Schwellen: später öffnen, wenn die erste Stunde unter 2 Prozent des Tagesverkehrs trägt; früher öffnen, wenn vor der Öffnung mehr als 2 Prozent da sind; später schliessen, wenn die letzte Stunde über 5 Prozent trägt. Werktag und Wochenende werden getrennt betrachtet.
Ein Rechendetail entscheidet über die Brauchbarkeit: Das Mittel je Stunde wird durch die Zahl der analysierten Tage geteilt, nicht durch die Tage, an denen diese Stunde Daten hatte. Sonst summieren sich die Stundenanteile auf mehr als 100 Prozent des Tagesmittels - und eine Empfehlung beruht auf einer Stunde, die es so nie gab. Unter drei analysierten Tagen je Wochentag bleibt der Wert leer.
Wie wir das machen
Das ANALYSIT Counting System rechnet Korrelationen zwischen sechs Kennzahlen mit exaktem p-Wert und einer Korrektur nach Benjamini-Hochberg; Temperatur, Luftfeuchte und Niederschlag kommen hinzu, sobald Wetterdaten mehr als die Hälfte der Tage abdecken. Die Anomalieerkennung arbeitet mit modifiziertem z-Wert und Interquartilszaun, Werktag und Wochenende getrennt, ab 14 Tagen.
Die Besucherprognose nach Holt-Winters reicht ein bis 30 Tage, mit Suche über 80 Parameterkombinationen, benanntem Ersatzmodell und offener Diagnostik. Die Einflussfaktoren trennen Treiber von Begleitern und weisen ein adjustiertes R² aus.
Szenarien rechnen auf der eigenen Basislinie mit vier offen ausgewiesenen Hebeln. Die Öffnungszeiten-Analyse zeigt die Verteilung über und vor den Handelsstunden mit festen Schwellen, und die Personalbedarfs-Heatmap stellt geplant gegen empfohlen, Stunde für Stunde.
Wenn in deinem Haus gerade eine Massnahme auf einer einzelnen Korrelation steht, sprich mit uns. Die Frage, wie viele Paare dafür geprüft wurden, ist meistens die aufschlussreichste.
