KI-gestützte Verfahren können in großen Datenmengen Zusammenhänge finden, die ein Mensch kaum überschauen würde. Gerade diese Stärke ist in Anlagemodellen eine Gefahr: Finanzdaten sind verrauscht, nicht-stationär und stark von wenigen Ausnahmeereignissen geprägt. Wer die Grenzen der Mustererkennung nicht kennt, überschätzt schnell, was ein Modell vermag.
Überanpassung an die Vergangenheit
Ein flexibles Modell lernt im Training fast jede Regelmäßigkeit — auch solche, die nur im betrachteten Zeitraum bestanden. Je mehr Freiheitsgrade das Modell hat, desto eher passt es sich Zufall an. Im Training sinkt der Fehler, auf neuen Daten steigt er. Das Modell erklärt die Vergangenheit gut, sagt die Zukunft aber nicht besser als ein einfacheres Verfahren. In der Praxis zeigt sich Überanpassung oft erst im Rückblick: Was im Test überzeugend aussah, bricht, sobald neue Daten hinzukommen.
Nicht-Stationarität: Regeln wandeln sich
Viele statistische Verfahren setzen voraus, dass Zusammenhänge über die Zeit stabil bleiben. Finanzmärkte erfüllen diese Annahme kaum: Zinsniveaus, Regulierungen, Handelsteilnehmer und Informationsflüsse verändern sich. Ein Faktor, der in den 1990er Jahren trug, kann in den 2010er Jahren bedeutungslos geworden sein. Wer ein Modell auf Jahrzehnten schätzt, mischt daher verschiedene Regelsysteme. Die Folge sind Gewichte, die einen Durchschnitt über nicht vergleichbare Epochen darstellen — keine gültige Aussage über die Gegenwart.
Seltene Ereignisse und dünne Daten
Die wichtigsten Marktbewegungen sind oft gerade die seltenen: Krisen, Platzungen, Regimewechsel. Im Datenmaterial tauchen sie nur wenige Male auf, manchmal gar nicht im Trainingszeitraum. Ein Modell, das auf ruhigen Phasen gelernt wurde, kann in einem solchen Ereignis versagen, ohne dass die Trainingsgüte das vorher anzeigte. Umgekehrt kann ein Verfahren, das eine Krise stark gewichtet, in normalen Zeiten unterlegen sein. Darauf gibt es keine allgemeingültige Antwort — nur die Kenntnis, dass die Frage besteht.
Die Illusion der Vorhersage
Ein Modell, das in der Vergangenheit gut abgeschnitten hat, sagt nicht zwangsläufig die Zukunft voraus. Hohe Trainingsgüte kann auf Überanpassung beruhen; eine scheinbar gefundene Regel kann auf Datensichtungseffekten — der Auswahl vieler Kandidaten, von denen einige per Zufall gut aussehen. Wer viele Modelle testet und nur das beste veröffentlicht, überschätzt dessen Leistung systematisch. Eine ehrliche Ausweisung muss berichten, wie viele Ansätze geprüft wurden und auf welchen Daten die Wahl getroffen wurde.
Was bleibt
Die Grenzen bedeuten nicht, dass Mustererkennung wertlos wäre. Sie bedeuten, dass Ergebnisse mit Maß zu betrachten sind: mit Kreuzvalidierung, mit Stabilitätsprüfungen, mit ökonomischer Plausibilität und mit dem Wissen, dass jedes Modell nur so gut ist wie die Daten und Annahmen, auf denen es ruht. Die Redaktion folgt dieser Haltung: Beiträge benennen, was ein Modell zeigt — und genauso, wo es aufhört, etwas zu zeigen.