ce serait plus simple de generer ca via la voix que via la video
"ok google, pion blanc en D5" , transformer le son en texte est surement bien faisable avec des lib ouverte, puis apres parser le texte et generer l'image,
surtout qu'il semble deja enoncer chacun des coups dans sa video,
il faudrait donc juste qu'il dise un token unique avant chaque coup pour savoir quand ecouter
comme ca, il aura en plus la date de la video ou inserer chaque image