Aprender probando
Casi todo el aprendizaje automático empieza con ejemplos. Alguien reúne casos cuya respuesta ya se conoce, el sistema los estudia y aprende a dar respuestas parecidas en casos que nunca ha visto. El aprendizaje por refuerzo empieza en otro sitio. No hay respuestas reunidas. Hay una situación, unos movimientos posibles y una puntuación.
El sistema prueba algo. El resultado recibe una puntuación. Una puntuación mejor hace esa elección un poco más probable la vez siguiente, una peor la hace un poco menos probable, y el bucle se repite hasta que las elecciones dejan de moverse. Esa es la idea entera. Lo demás es detalle sobre cómo se ordenan los intentos y cómo se calcula la puntuación.
La versión conocida ocurre fuera de los ordenadores continuamente. Un cocinero que prueba y rectifica, un niño que aprende a mantenerse en la bicicleta, un aprendiz al que le dicen que la costura está torcida y vuelve a intentarlo: a ninguno le dieron la respuesta, y todos acabaron teniéndola.
La puntuación es lo difícil
Si la idea es sencilla, la dificultad se localiza deprisa. Casi todo depende de lo que se recompensa, porque un sistema que aprende de una puntuación la perseguirá con fidelidad, también por caminos que nadie había previsto.
Por eso el trabajo interesante está rara vez en el intento y casi siempre en la puntuación. Unos pocos rasgos separan una puntuación de la que merece aprender de otra que despista.
- Recompensa el resultado que de verdad se quiere y no un sustituto cómodo.
- Llega con bastante frecuencia como para ser útil, porque una puntuación que solo aparece al final enseña despacio.
- No puede subir mediante un atajo que deje la tarea real sin hacer.
- Aguanta que otra persona la lea y coincida en que un número más alto significa de verdad un resultado mejor.
Lo que no hace
Hablar sencillo también es ser claro sobre los límites. Aprender así exige muchísimos intentos, lo cual va bien cuando los intentos cuestan poco y mal cuando cuestan caro. Encaja en situaciones que pueden repetirse y puntuarse, y ofrece poco allí donde no se da ninguna de las dos cosas.
Tampoco trae opinión propia. Un sistema entrenado así ha encontrado la manera de subir un número dentro del marco que se le dio. Si ese número merecía subir es una pregunta humana, hecha antes de empezar el entrenamiento y que conviene repetir después.
Sostenida a ese tamaño, la idea resulta útil en lugar de misteriosa. Algo prueba, algo puntúa, y los intentos se inclinan hacia lo que la puntuación recompensa. Casi todo el cuidado corresponde a decidir qué se recompensa.
Preguntas frecuentes
¿Qué es el aprendizaje por refuerzo en una frase?
Algo prueba una acción, el resultado recibe una puntuación y una puntuación mejor hace esa elección más probable la vez siguiente, hasta que las elecciones se asientan.
¿En qué se diferencia del aprendizaje con ejemplos?
El aprendizaje con ejemplos parte de casos cuya respuesta ya se conoce. El aprendizaje por refuerzo parte sin respuesta alguna: una situación, unos movimientos posibles y una puntuación.
¿Por qué pesa tanto la recompensa?
Porque la puntuación se persigue con fidelidad. Si puede subir mediante un atajo que deja la tarea real sin hacer, el atajo es lo que se aprende.
