Laufschuh-Studie · Version 1.0 · Stand 02.08.2026

Der bestbewertete Schuh im Labor ist bei Käufern Mittelmaß.

Ich habe 503 Laufschuhe aus zwei unabhängigen Quellen zusammengeführt: einer Laborwertung und 30 Modellen mit echten Käuferbewertungen. Die interessante Zahl ist nicht, wer gewinnt — sondern wie weit beide auseinanderliegen. Im Median sind das 24 Perzentilpunkte.

Was hier nicht steht: eine Bestenliste. Mit zwei Quellen sind die Unsicherheitsintervalle zu breit, um Platz 4 von Platz 9 zu unterscheiden — und eine abgeschriebene Rangfolge wäre keine eigene Auswertung. Was hier steht, ist die Differenz zwischen zwei Urteilen. Die ist belastbar, und sie ist interessanter.

Tester begeistert, Käufer nicht

Perzentilrang innerhalb der jeweiligen Quelle. 100 = bestbewertet, 0 = schlechtestbewertet. Ein großer Abstand heißt: Das Labor mag den Schuh deutlich mehr als die Menschen, die ihn gekauft haben.

ModellLaborKäuferAbstandBewertungen
Adidas Adizero EVO SL1004158
41
Nike Vomero 18934350
20
Nike Vomero Plus914646
8
ASICS Noosa Tri 16754134
48
Brooks Ghost 16755916
5
Brooks Ghost 17604615
8
Nike Pegasus 40534310
20
Nike Pegasus 4175696
15

Käufer begeistert, Labor nüchtern

Die andere Richtung — und die mit den mit Abstand größten Fallzahlen.

ModellLaborKäuferAbstandBewertungen
Adidas Runfalcon14039
92
Adidas Runfalcon 513938
469
Adidas Ultrarun 574236
27
Adidas Galaxy 763933
424
Nike Downshifter 14174629
9
On Cloudrunner 3204727
6
ASICS Gel Contend 9143925
308
Nike Downshifter 13204424
17

Vorsicht bei der Deutung. Beide Seiten messen etwas anderes. Das Labor misst Schaum, Sohle und Aufbau eines Schuhs. Käufer bewerten, ob der Schuh zu ihnen passt, was sie bezahlt haben und was sie erwartet hatten. Ein Einsteigerschuh für 60 € kann seine Käufer glücklich machen und trotzdem im Labor auf dem letzten Platz landen — beides ist wahr, und genau das ist der Punkt dieser Auswertung.

Was Preis wirklich bringt

Über 437 Modelle mit Listenpreis: Rangkorrelation ρ = 0.46, monoton steigend, ohne erkennbare Sättigung.

ListenpreisModelleMedian-Perzentil im Labor
0–100 €2911
100–140 €6034
140–170 €14853
170–200 €11260
200–250 €4768
250 € und mehr4189

Gelesen wird das so: Teurere Schuhe schneiden im Labor systematisch besser ab. Ob sie ihre Träger zufriedener machen, sagt diese Zahl nicht. Zum Teil ist der Zusammenhang bauartbedingt — eine Karbonplatte kostet Geld und wird zugleich gemessen. Eine Kausalaussage über den Nutzen ist das ausdrücklich nicht.

Marken im Median

Nur Marken mit mindestens acht ausgewerteten Modellen. Laborperzentil, nicht Käuferurteil.

MarkeModelleMedian-Perzentil
Saucony4568
PUMA1768
ASICS5560
HOKA3660
Mizuno1960
New Balance3953
Brooks5253
Topo1153
Nike5146
Salomon1846
On3037
Altra3134
Under Armour1027
Adidas5524
Merrell822

Methode

Alles Folgende stand fest, bevor die erste Zahl gezogen wurde (Präregistrierung im Projekt: ideen/schuhstudie-design.md).

Warum nicht einfach Bewertungen mitteln?

Weil eine 4,6 von 5 Sternen und eine 86 von 100 nicht dieselbe Größe sind. Sternebewertungen im Handel sind stark linkssteil — fast alles liegt zwischen 4,3 und 4,8. Laborwerte streuen ganz anders. Ein Mittelwert daraus wäre eine Zahl ohne Bedeutung. Deshalb wird jeder Wert zuerst in einen Perzentilrang innerhalb seiner eigenen Quelle übersetzt.

Wie kleine Fallzahlen behandelt werden

Ein Schuh mit 3 Bewertungen darf nicht neben einem mit 469 stehen, als wäre beides gleich sicher. Deshalb werden die Werte zum Quellenmittel gezogen (empirisches Bayes), und zwar umso stärker, je weniger Bewertungen vorliegen. Das Gewicht m ist der Median der Bewertungsanzahl in dieser Quelle — aus den Daten abgeleitet, nicht gewählt.

Gewichte und Unsicherheit

Quellengewichte standen vorab fest: Labor 1,0 · Redaktion mit selbst gekauften Schuhen 0,8 · Redaktion mit Testmustern 0,5 · Händlerbewertungen 0,5 · Foren 0,3. Die ungewichtete Variante wird immer mitgerechnet. Unsicherheit über 2000 Bootstrap-Durchgänge über die Quellen, feste Zufallssaat 20260801 — dieselbe Rechnung ergibt dieselben Zahlen.

Quellen, Ausschlüsse und Grenzen

Genutzte Quellen: otto, runrepeat. Von 16 geprüften Quellen sind zwei rechtlich ausgeschlossen (robots.txt bzw. Nutzungsbedingungen) und dreizehn technisch nicht auslesbar, weil Bewertungen erst im Browser nachgeladen werden.