Ich habe 503 Laufschuhe aus zwei unabhängigen Quellen zusammengeführt: einer Laborwertung und 30 Modellen mit echten Käuferbewertungen. Die interessante Zahl ist nicht, wer gewinnt — sondern wie weit beide auseinanderliegen. Im Median sind das 24 Perzentilpunkte.
Was hier nicht steht: eine Bestenliste. Mit zwei Quellen sind die Unsicherheitsintervalle zu breit, um Platz 4 von Platz 9 zu unterscheiden — und eine abgeschriebene Rangfolge wäre keine eigene Auswertung. Was hier steht, ist die Differenz zwischen zwei Urteilen. Die ist belastbar, und sie ist interessanter.
Perzentilrang innerhalb der jeweiligen Quelle. 100 = bestbewertet, 0 = schlechtestbewertet. Ein großer Abstand heißt: Das Labor mag den Schuh deutlich mehr als die Menschen, die ihn gekauft haben.
| Modell | Labor | Käufer | Abstand | Bewertungen |
|---|---|---|---|---|
| Adidas Adizero EVO SL | 100 | 41 | 58 | 41 |
| Nike Vomero 18 | 93 | 43 | 50 | 20 |
| Nike Vomero Plus | 91 | 46 | 46 | 8 |
| ASICS Noosa Tri 16 | 75 | 41 | 34 | 48 |
| Brooks Ghost 16 | 75 | 59 | 16 | 5 |
| Brooks Ghost 17 | 60 | 46 | 15 | 8 |
| Nike Pegasus 40 | 53 | 43 | 10 | 20 |
| Nike Pegasus 41 | 75 | 69 | 6 | 15 |
Die andere Richtung — und die mit den mit Abstand größten Fallzahlen.
| Modell | Labor | Käufer | Abstand | Bewertungen |
|---|---|---|---|---|
| Adidas Runfalcon | 1 | 40 | 39 | 92 |
| Adidas Runfalcon 5 | 1 | 39 | 38 | 469 |
| Adidas Ultrarun 5 | 7 | 42 | 36 | 27 |
| Adidas Galaxy 7 | 6 | 39 | 33 | 424 |
| Nike Downshifter 14 | 17 | 46 | 29 | 9 |
| On Cloudrunner 3 | 20 | 47 | 27 | 6 |
| ASICS Gel Contend 9 | 14 | 39 | 25 | 308 |
| Nike Downshifter 13 | 20 | 44 | 24 | 17 |
Vorsicht bei der Deutung. Beide Seiten messen etwas anderes. Das Labor misst Schaum, Sohle und Aufbau eines Schuhs. Käufer bewerten, ob der Schuh zu ihnen passt, was sie bezahlt haben und was sie erwartet hatten. Ein Einsteigerschuh für 60 € kann seine Käufer glücklich machen und trotzdem im Labor auf dem letzten Platz landen — beides ist wahr, und genau das ist der Punkt dieser Auswertung.
Über 437 Modelle mit Listenpreis: Rangkorrelation ρ = 0.46, monoton steigend, ohne erkennbare Sättigung.
| Listenpreis | Modelle | Median-Perzentil im Labor |
|---|---|---|
| 0–100 € | 29 | 11 |
| 100–140 € | 60 | 34 |
| 140–170 € | 148 | 53 |
| 170–200 € | 112 | 60 |
| 200–250 € | 47 | 68 |
| 250 € und mehr | 41 | 89 |
Gelesen wird das so: Teurere Schuhe schneiden im Labor systematisch besser ab. Ob sie ihre Träger zufriedener machen, sagt diese Zahl nicht. Zum Teil ist der Zusammenhang bauartbedingt — eine Karbonplatte kostet Geld und wird zugleich gemessen. Eine Kausalaussage über den Nutzen ist das ausdrücklich nicht.
Nur Marken mit mindestens acht ausgewerteten Modellen. Laborperzentil, nicht Käuferurteil.
| Marke | Modelle | Median-Perzentil |
|---|---|---|
| Saucony | 45 | 68 |
| PUMA | 17 | 68 |
| ASICS | 55 | 60 |
| HOKA | 36 | 60 |
| Mizuno | 19 | 60 |
| New Balance | 39 | 53 |
| Brooks | 52 | 53 |
| Topo | 11 | 53 |
| Nike | 51 | 46 |
| Salomon | 18 | 46 |
| On | 30 | 37 |
| Altra | 31 | 34 |
| Under Armour | 10 | 27 |
| Adidas | 55 | 24 |
| Merrell | 8 | 22 |
Alles Folgende stand fest, bevor die erste Zahl gezogen wurde
(Präregistrierung im Projekt: ideen/schuhstudie-design.md).
Weil eine 4,6 von 5 Sternen und eine 86 von 100 nicht dieselbe Größe sind. Sternebewertungen im Handel sind stark linkssteil — fast alles liegt zwischen 4,3 und 4,8. Laborwerte streuen ganz anders. Ein Mittelwert daraus wäre eine Zahl ohne Bedeutung. Deshalb wird jeder Wert zuerst in einen Perzentilrang innerhalb seiner eigenen Quelle übersetzt.
Ein Schuh mit 3 Bewertungen darf nicht neben einem mit 469 stehen, als wäre beides
gleich sicher. Deshalb werden die Werte zum Quellenmittel gezogen (empirisches Bayes),
und zwar umso stärker, je weniger Bewertungen vorliegen. Das Gewicht m ist
der Median der Bewertungsanzahl in dieser Quelle — aus den Daten abgeleitet, nicht
gewählt.
Quellengewichte standen vorab fest: Labor 1,0 · Redaktion mit selbst gekauften
Schuhen 0,8 · Redaktion mit Testmustern 0,5 · Händlerbewertungen 0,5 · Foren 0,3.
Die ungewichtete Variante wird immer mitgerechnet. Unsicherheit über
2000 Bootstrap-Durchgänge über die Quellen, feste Zufallssaat
20260801 — dieselbe Rechnung ergibt dieselben Zahlen.
Genutzte Quellen: otto, runrepeat. Von 16 geprüften Quellen sind zwei rechtlich ausgeschlossen (robots.txt bzw. Nutzungsbedingungen) und dreizehn technisch nicht auslesbar, weil Bewertungen erst im Browser nachgeladen werden.