Apprendre en essayant

La plupart des apprentissages automatiques commencent par des exemples. Quelqu'un rassemble des cas dont la réponse est déjà connue, le système les étudie, puis produit des réponses semblables sur des cas qu'il n'a jamais vus. L'apprentissage par renforcement part d'ailleurs. Il n'y a pas de réponses rassemblées. Il y a une situation, des gestes possibles et une note.

Le système essaie quelque chose. Le résultat reçoit une note. Une bonne note rend ce choix un peu plus probable la fois suivante, une mauvaise note le rend un peu moins probable, et la boucle recommence jusqu'à ce que les choix cessent de bouger. C'est toute l'idée. Le reste n'est que détail sur la façon d'organiser les essais et de calculer la note.

La version familière se produit tout le temps en dehors des ordinateurs. Un cuisinier qui goûte et rectifie, un enfant qui apprend à tenir sur un vélo, un apprenti à qui l'on dit que la couture est de travers et qui recommence : aucun n'a reçu la réponse, et tous ont fini par l'avoir.

La note est le vrai sujet

Si l'idée est simple, la difficulté est facile à situer. Presque tout dépend de ce qui est récompensé, car un système qui apprend d'une note poursuivra cette note fidèlement, y compris par des chemins que personne n'avait prévus.

C'est pourquoi le travail intéressant se trouve rarement dans l'essai et presque toujours dans la note. Quelques traits distinguent une note dont il vaut la peine d'apprendre d'une note qui égare.

  • Elle récompense le résultat réellement souhaité, et non un substitut commode.
  • Elle arrive assez souvent pour être utile, car une note qui ne vient qu'à la toute fin enseigne lentement.
  • Elle ne peut pas monter par un raccourci qui laisse la tâche réelle inachevée.
  • Elle résiste à la lecture d'un tiers, qui doit convenir qu'un chiffre plus élevé correspond bien à un meilleur résultat.

Ce que cela ne fait pas

Parler simplement, c'est aussi être clair sur les limites. Apprendre ainsi demande un très grand nombre d'essais, ce qui convient quand les essais coûtent peu et devient un problème quand ils coûtent cher. Cela va bien aux situations que l'on peut répéter et noter, et cela n'apporte presque rien là où ni l'un ni l'autre n'est possible.

Cela ne porte pas non plus d'opinion propre. Un système entraîné ainsi a trouvé comment faire monter un chiffre dans le cadre qu'on lui a donné. Savoir si ce chiffre méritait de monter est une question humaine, posée avant l'entraînement et qu'il vaut la peine de reposer après.

Tenue à cette taille, l'idée devient utile plutôt que mystérieuse. Quelque chose essaie, quelque chose note, et les essais penchent vers ce que la note récompense. L'essentiel du soin revient au choix de ce que l'on récompense.

Questions fréquentes

Qu'est-ce que l'apprentissage par renforcement en une phrase ?

Quelque chose essaie une action, le résultat reçoit une note, et une meilleure note rend ce choix plus probable la fois suivante, jusqu'à ce que les choix se stabilisent.

En quoi cela diffère-t-il de l'apprentissage par exemples ?

L'apprentissage par exemples commence par un ensemble de cas dont la réponse est connue. L'apprentissage par renforcement commence sans aucune réponse : une situation, des gestes possibles et une note.

Pourquoi la récompense compte-t-elle autant ?

Parce que la note est poursuivie fidèlement. Si elle peut monter par un raccourci qui laisse la tâche réelle inachevée, c'est le raccourci qui sera appris.