Ein multifaktorielles Modell muss entscheiden, welche Faktoren es berücksichtigt und wie stark es sie gewichtet. Klassische Verfahren tun das mit festen Regeln oder einfacher Regression. Maschinelle Lernverfahren nehmen der Formulierung viel Freiheit: Sie suchen im Datenmaterial selbst nach Zusammenhängen und lernen Gewichte, die ein vorgegebenes Ziel — etwa eine Rendite-Vorhersage — möglichst gut erfüllen. Das eröffnet Möglichkeiten, birgt aber auch neue Fehlerquellen.
Vom festen Modell zum gelernten Modell
Ein klassischer Ansatz legt die Faktoren vorab fest und schätzt ihre Gewichtung mit einer Regression. Ein lernendes Modell hingegen wählt aus einem Vorrat an Faktoren und Kombinationen jene aus, die im Trainingszeitraum die beste Erklärung liefern. Baum-basierte Verfahren, lineare Modelle mit Regularisierung und neuronale Netze unterscheiden sich darin, wie flexibel sie Zusammenhänge darstellen — von starr bis nahezu beliebig.
Auswahl: was ein Modell behält
Die Auswahl folgt meist einer Kosten-Nutzen-Abwägung: Ein Faktor kommt in das Modell, wenn er im Training einen messbaren Beitrag zur Vorhersage leistet. Dabei können Verfahren auch nichtlineare Kombinationen erkennen — etwa dass Momentum nur in bestimmten Marktphasasen, oder Quality nur in Kombination mit niedriger Verschuldung trägt. Solche bedingten Zusammenhänge sind ein Vorteil des Lernens, weil sie die Wirklichkeit genauer abbilden als eine feste Formel.
Gewichtung: wie stark ein Faktor zählt
Die Gewichtung entscheidet, wie viel Einfluss einem Faktor eingeräumt wird. Lernverfahren passen Gewichte so an, dass Vorhersagefehler im Training sinken. Damit entsteht eine Gefahr: Ein flexibles Modell kann Zufall in den Trainingsdaten als Muster lernen und so die Gewichte auf Rauschen statt auf echte Zusammenhänge abstimmen. Dagegen helfen drei Maßnahmen:
- Regularisierung — ein Strafterm, der große Gewichte zurückhaltend behandelt und so zu sparsameren Modellen zwingt.
- Kreuzvalidierung — Aufteilung in Trainings- und Prüfdaten, damit Gewichtung nur angenommen wird, wenn sie auf ungesehenen Daten Bestand hat.
- Frühes Abbrechen — Beendigung des Lernens, sobald die Güte auf den Prüfdaten nicht mehr steigt, statt weiter zu passen.
Stabilität als Prüfstein
Ein gewählter Faktor sollte sich nicht nur im Training bewähren, sondern auch, wenn sich der Zeitraum oder die Zusammensetzung ändert. Eine wiederholte Schätzung auf rollierenden Fenstern zeigt, ob die Gewichtung stabil bleibt oder bei jeder neuen Periode springt. Sprungende Gewichte sind ein Warnzeichen: Sie deuten darauf, dass das Modell Muster verfolgt, die im nächsten Abschnitt möglicherweise nicht mehr gelten.
Was KI nicht ersetzt
Ein lernendes Modell kann Zusammenhänge erkennen, aber nicht beurteilen, ob sie ökonomisch sinnvoll sind. Eine starke Gewichtung eines scheinbar neuen Faktors kann auf einer Dateneigentümlichkeit beruhen, die außerhalb des Trainings nicht fortbesteht. Die Aufgabe der Redaktion besteht darin, solche Ergebnisse einzuordnen — und nicht jede gefundene Regel als neue Wahrheit zu verkaufen. Der dritte Beitrag behandelt, an welchen Grenzen die Mustererkennung insgesamt stößt.