Warum Jurys blind bewerten sollten
Wer die Note des Kollegen sieht, bewertet wie der Kollege. Wie Ankereffekt, Reihenfolge und Namen eine Auswahlrunde verzerren, und wie du mit unabhängiger Bewertung, Abweichungsregel und Kalibrierung gegensteuerst.

In fast jeder Auswahlrunde, die ich gesehen habe, passiert dasselbe: Die Tabelle mit den Bewertungen ist für alle offen, die erste Jurorin trägt ihre Zahlen ein, und die Zahlen der zweiten liegen danach verdächtig nah bei den ersten. Niemand hat abgeschrieben. Es ist einfach so, dass eine Zahl, die man gesehen hat, die eigene Zahl zieht. Das nennt sich Ankereffekt, ist seit den siebziger Jahren gut belegt, und trifft Fachleute genauso wie Laien. Eine Jury, die gemeinsam in einer Tabelle bewertet, produziert deshalb nicht fünf Urteile, sondern ein Urteil und vier Echos.
Was eine Runde verzerrt
Der Anker. Die erste sichtbare Zahl setzt den Maßstab. Sieht die zweite Jurorin eine 4, ist ihre 2 plötzlich eine 3. Das gilt auch für Kommentare: „Starkes Team“ in der Spalte daneben, und das Team wird stark.
Zwei Stufen Abweichung sind kein Fehler. Sie sind die Tagesordnung für die Diskussion.
Die Reihenfolge. Die ersten drei Bewerbungen werden anders bewertet als die letzten drei, weil die Jury ihren Maßstab erst beim Lesen entwickelt. Wer als Erster kommt, wird am inneren Ideal gemessen; wer als Zehnter kommt, an den neun davor. Bei dreißig Bewerbungen an einem Nachmittag kommt Ermüdung dazu, und müde Juroren geben Mittelwerte.
Die Namen. Hochschule, bekannter Investor im Deck, ein Name, den man aus der Presse kennt: Das alles bewertet mit, bevor die erste Folie gelesen ist. Der Effekt ist nicht böse, er ist schnell. Genau deshalb ist er schwer zu kontrollieren.
Die Gruppe. In der Diskussion setzt sich nicht das beste Argument durch, sondern das lauteste oder das des Ranghöchsten. Wenn die Diskussion vor der Bewertung stattfindet, gibt es danach keine unabhängigen Urteile mehr, die man vergleichen könnte.
Was dagegen hilft
Das Gegenmittel ist nicht, die Jury zu belehren. Es ist der Ablauf.
Erst allein, dann zusammen. Jede Jurorin bewertet jede Einreichung für sich, ohne die Werte der anderen zu sehen. Erst wenn alle fertig sind, werden die Bewertungen aufgedeckt. Accelerators machen das so, weil sie Hunderte Bewerbungen sichten und wissen, dass die Diskussion sonst die Daten frisst.
Reden nur über den Abstand. Nach dem Aufdecken schaut die Runde nicht auf die Mittelwerte, sondern auf die Kriterien, bei denen zwei Personen um zwei Stufen oder mehr auseinanderliegen. Nur dort wird gesprochen, und zwar über das Kriterium: Was hast du gesehen, was ich nicht gesehen habe? Wer seine Meinung als überprüfbare Behauptung formuliert („Das Team hat nie verkauft, das steht auf Folie 8“), macht die Diskussion kurz. Danach bleibt jeder bei seiner Note oder ändert sie. Niemand muss sich einigen; der Mittelwert ist das Ergebnis, die Abweichung die Information.
Zwei Stufen sind kein Fehler. Ein Bogen, bei dem alle immer übereinstimmen, misst nichts. Die Abweichung ist der Ort, an dem die Jury etwas lernt, über das Team oder über den eigenen Bogen. Wenn dieselben zwei Juroren bei jedem Team auseinanderliegen, ist der Ankertext des Kriteriums unklar, nicht die Jury.
Ohne Namen, wenn es geht. Für die erste Sichtung einer Businessplan-Phase lassen sich Namen, Fotos und Hochschulen schwärzen. Beim Pitch geht das nicht, und da hilft nur, dass die schriftliche Bewertung vor dem Pitch feststeht und der Pitch getrennt bewertet wird.
Gemischte Reihenfolge. Nicht alle Juroren lesen in derselben Reihenfolge. Wenn jede Einreichung bei einem Juror früh und bei einem anderen spät kommt, hebt sich der Reihenfolgeeffekt im Mittel auf.
Kalibrieren, bevor es zählt. Drei Einreichungen vom letzten Jahr, jeder bewertet allein, dann vergleichen. Das kostet eine Stunde und zeigt vor der Runde, welche Anker unklar sind und welcher Juror grundsätzlich eine Stufe strenger ist. Beides lässt sich vorher beheben; nachher nicht mehr.
Zwei je Einreichung. Der Businessplan-Wettbewerb Berlin-Brandenburg lässt jedes Konzept von zwei Juroren unabhängig bewerten. Das ist der Mindeststandard. Eine Bewertung ist eine Meinung, zwei sind ein Maß.
Wie das praktisch geht
In einer Tabelle: ein Blatt je Jurorin, das nur sie und die Organisation sehen, und ein Blatt, das die Organisation nach der Frist zusammenführt. Das funktioniert, solange niemand aus Versehen das falsche Blatt teilt.
In einem Formular: jede Jurorin bekommt ihren eigenen Formularlink; die Antworten laufen in eine Tabelle, die nur die Organisation sieht. Aufdecken heißt dann: Die Organisation schickt nach der Frist die Übersicht herum. Das ist sauber, aber die Abweichungsregel muss die Organisation von Hand anwenden.
In einem Werkzeug: Die Bewertung der anderen ist verdeckt, bis die eigene gespeichert ist, die Abweichung steht automatisch am Kriterium, und die Runde sieht auf einen Blick, wo sie reden muss. Das ist der Grund, warum wir Deal Chamber so gebaut haben: Blind ist die Voreinstellung, nicht die Disziplin.
Quellen
- Tversky und Kahneman, „Judgment under Uncertainty: Heuristics and Biases“ (1974), zum Ankereffekt
- AcceleratorApp, „How Top Accelerators Score Applications“ (unabhängige Bewertung, Abweichung ab zwei Punkten, blinde Erstsichtung, Kalibrierung)
- Businessplan-Wettbewerb Berlin-Brandenburg, Handbuch 2025 (zwei unabhängige Bewertungen je Konzept)
Warum der Pitch nicht mit dem Konzept-Bogen bewertet werden darf, welche vier Kriterien ein Pitch-Bogen braucht, wie die Mischung aus schriftlicher Bewertung und Pitch festgelegt wird und was Juroren in fünf Minuten wirklich beurteilen können.