Lernen durch Versuchen
Das meiste maschinelle Lernen beginnt mit Beispielen. Jemand sammelt Fälle, deren Antwort bereits bekannt ist, das System studiert sie und lernt, auf ungesehenen Fällen ähnliche Antworten zu geben. Bestärkendes Lernen beginnt ganz woanders. Es gibt keine gesammelten Antworten. Es gibt eine Lage, mögliche Züge und eine Bewertung.
Das System versucht etwas. Das Ergebnis wird bewertet. Eine bessere Bewertung macht diese Wahl beim nächsten Mal ein wenig wahrscheinlicher, eine schlechtere ein wenig unwahrscheinlicher, und die Schleife wiederholt sich, bis die Wahl sich nicht mehr verschiebt. Das ist die ganze Idee. Alles Übrige ist Detail darüber, wie das Versuchen geordnet und die Bewertung errechnet wird.
Die vertraute Fassung geschieht außerhalb von Rechnern ständig. Eine Köchin, die abschmeckt und nachwürzt, ein Kind, das lernt, auf dem Rad oben zu bleiben, ein Lehrling, dem gesagt wird, die Naht sei schief, und der es noch einmal versucht: keinem wurde die Antwort gereicht, und alle hatten sie am Ende.
Die Bewertung ist der schwierige Teil
Wenn die Idee einfach ist, lässt sich die Schwierigkeit leicht verorten. Fast alles hängt davon ab, was belohnt wird, denn ein System, das aus einer Bewertung lernt, verfolgt diese Bewertung treu, auch auf Wegen, die niemand vorgesehen hat.
Deshalb liegt die interessante Arbeit selten im Versuchen und fast immer in der Bewertung. Einige Merkmale trennen eine Bewertung, aus der zu lernen lohnt, von einer, die in die Irre führt.
- Sie belohnt das Ergebnis, das wirklich gewollt ist, und nicht einen bequemen Ersatz dafür.
- Sie kommt oft genug, um zu nützen, denn eine Bewertung erst ganz am Schluss lehrt langsam.
- Sie lässt sich nicht durch eine Abkürzung heben, die die eigentliche Aufgabe unerledigt lässt.
- Sie hält es aus, dass jemand anderes sie liest und zustimmt, dass eine höhere Zahl wirklich ein besseres Ergebnis bedeutet.
Was es nicht leistet
Einfache Worte heißen auch, über die Grenzen einfach zu sprechen. Auf diese Weise zu lernen kostet sehr viele Versuche, was gut geht, wo Versuche billig sind, und schlecht, wo sie es nicht sind. Es passt zu Lagen, die sich wiederholen und bewerten lassen, und hat wenig zu bieten, wo beides fehlt.
Es trägt auch keine eigene Meinung. Ein so trainiertes System hat einen Weg gefunden, eine Zahl in dem Rahmen zu heben, den man ihm gegeben hat. Ob diese Zahl gehoben werden sollte, ist eine menschliche Frage, gestellt vor dem Training und wert, danach erneut gestellt zu werden.
Auf dieses Maß gebracht, wird die Idee nützlich statt geheimnisvoll. Etwas versucht, etwas bewertet, und das Versuchen neigt sich dorthin, wohin die Bewertung zeigt. Die meiste Sorgfalt gehört in die Entscheidung, was belohnt wird.
Häufige Fragen
Was ist bestärkendes Lernen in einem Satz?
Etwas versucht eine Handlung, das Ergebnis wird bewertet, und eine bessere Bewertung macht diese Wahl beim nächsten Mal wahrscheinlicher, so lange, bis die Wahl sich setzt.
Wie unterscheidet es sich vom Lernen aus Beispielen?
Lernen aus Beispielen beginnt mit Fällen, deren Antwort bereits bekannt ist. Bestärkendes Lernen beginnt ohne jede Antwort, nur mit einer Lage, möglichen Zügen und einer Bewertung.
Warum wiegt die Belohnung so schwer?
Weil die Bewertung treu verfolgt wird. Lässt sie sich durch eine Abkürzung heben, die die eigentliche Aufgabe unerledigt lässt, dann wird die Abkürzung gelernt.
