Teaching objectives
¿Cómo puede una máquina aprender a jugar sin que nadie le enseñe la estrategia? Este lab de secundaria y bachillerato responde a esa pregunta con la idea más bonita y concreta de la inteligencia artificial: el aprendizaje por refuerzo. Reconstruimos, paso a paso, la máquina de cajas de cerillas de Donald Michie (MENACE) y el robot Hexapawn de Martin Gardner: cajones llenos de fichas que, premiando las jugadas que llevan a victoria y penalizando las que llevan a derrota, acaban descubriendo por sí solos la jugada perfecta. Al final damos un salto: un juego donde no existe una jugada óptima fija porque lo mejor depende de lo que haga el otro.
Qué se aprende
La intuición de que una máquina puede aprender de la experiencia ajustando probabilidades, sin programarle la estrategia: solo premio y castigo repetidos.
- Bloque A — El juego de las piedras (salas 1-9): se juega primero contra un rival aleatorio (se gana con facilidad), luego contra una IA de juego perfecto para descubrir que existe una estrategia ganadora (dejar al rival en un múltiplo de 4: 4 y 8). Después se desmonta paso a paso el mecanismo: cómo elige la IA un cajón (suma de fichas → número al azar → contar cajón por cajón) en una posición y en las seis; el peligro de restar 1 (penalizar jugadas buenas por errores posteriores vacía cajones) que motiva multiplicar por un coeficiente; el alumno juega contra la IA que aprende; y finalmente la IA jugando contra sí misma con la animación temporal de convergencia, la tasa de aprendizaje y el aprendizaje por currículo.
- Bloque B — Hexapeón (salas 10-14): el mismo principio sobre el juego 3×3 de Gardner, pero añadiendo la otra cara de la moneda: el árbol de juego completo y el algoritmo minimax (maximin). La conclusión clave: las cajas aprenden por su cuenta la misma jugada que el minimax calcula directamente — aprender y buscar llegan al mismo sitio.
- Bloque C — Trabajo en equipo (salas 15-18): un juego cooperativo de 2 jugadores con 3 estrategias (esforzarse, hacer poco, no hacer nada) donde se aprueba si el esfuerzo conjunto alcanza un umbral N. Aquí no hay una jugada óptima única: dos IAs aprendiendo a la vez pueden converger a cooperación justa, a un reparto injusto del trabajo (gorroneo) o al colapso, según el umbral. Es teoría de juegos viva: del dilema del voluntario (N=2) a la caza del ciervo (N=4).
Ideas matemáticas clave
- Aprendizaje por refuerzo: premio/castigo sobre acciones para maximizar recompensa esperada, sin un modelo previo del juego.
- Selección por probabilidad (ruleta): la probabilidad de cada jugada es proporcional al número de fichas de su cajón; explorar frente a explotar.
- Refuerzo multiplicativo y tasa de aprendizaje: multiplicar el contenido del cajón por un coeficiente (>1 premia, <1 castiga) nunca lo vacía del todo; el coeficiente es la tasa de aprendizaje, y su mal ajuste rompe la convergencia.
- El juego de las piedras y la estrategia de los múltiplos de 4: las posiciones perdedoras del juego de 10 (coger 1-3, gana quien coge la última) son los múltiplos de 4.
- Árbol de juego y minimax: cada jugador maximiza su resultado suponiendo que el rival minimiza el suyo; se propaga el valor desde las hojas para conocer el resultado con juego perfecto.
- Juegos cooperativos con umbral: el dilema del voluntario y la caza del ciervo, equilibrios múltiples (justo vs. injusto, cooperación vs. colapso) y el problema del gorrón (free-rider).
- Autojuego (self-play) multiagente: varios aprendices que se entrenan unos contra otros; el comportamiento (puro o mixto) emerge y puede visualizarse como evolución temporal de probabilidades.
Room-by-room contents
Sala 1 · El juego de las 10 piedras
Se presentan las reglas: hay 10 piedras y, por turnos, cada jugador coge 1, 2 o 3; gana quien coge la última. El alumno juega contra un rival que decide al azar y comprueba que gana con mucha facilidad.
Student tasks
- Jugar varias partidas contra el rival aleatorio.
- Observar que ganar al azar es casi siempre fácil.
Sala 2 · ¿Hay estrategia ganadora?
Ahora el rival es una IA de juego perfecto; a veces empieza ella y a veces el alumno. Tras 4 partidas aparece el mensaje "Ya no es tan fácil ganar a la IA, ¿verdad?" y se pide detectar con cuántas piedras hay que dejar al adversario para ganar (botones del 1 al 10).
Student tasks
- Jugar 4 partidas contra la IA perfecta y fijarse en sus jugadas.
- Marcar las posiciones perdedoras: 4 y 8 (dejar al rival en un múltiplo de 4).
Sala 3 · ¿Cómo elige la IA un cajón?
El paso que los alumnos no llegan a ver: cómo la IA elige un cajón. En una sola posición, con 3 cajones de fichas, una animación lenta suma todas las fichas (+700 ms), saca un número al azar entre 1 y la suma (+700 ms), cuenta las fichas cajón por cajón (200 ms cada una) e ilumina el cajón donde cae el número. Después el alumno resuelve 3 casos: dada una disposición de fichas y un número, elige el cajón correcto.
Student tasks
- Ver la animación de la selección por ruleta paso a paso.
- Acertar el cajón correcto en los 3 casos propuestos.
Sala 4 · Juega contra la IA, paso a paso
El alumno juega con los botones Coger 1/2/3 contra la IA-cajas (fichas enteras, 3 por cajón para que el efecto sea más drástico). La jugada de la IA se narra muy despacio —suma de fichas, número al azar, conteo cajón por cajón e iluminación del cajón— y queda en una transcripción (6 → IA coge 2 → 4 → tú coges 3 → …). Al ganar alguien se recalculan ±1 ficha los cajones que usó la IA, jugada a jugada, y quedan iluminados. Tras la primera partida se pregunta qué le ha pasado a la probabilidad de cada estrategia. En partidas sucesivas el conteo se acelera para no cansar.
Student tasks
- Jugar una partida completa siguiendo la jugada narrada de la IA.
- Observar el recálculo ±1 y responder qué pasó con las probabilidades.
Sala 5 · El peligro de restar 1
Una primera idea de aprendizaje con fichas enteras: al perder, quitar 1 ficha a cada cajón usado. La demo revela su fallo: una jugada correcta (coger 2 desde la posición 6) se penaliza por culpa de un error posterior. Aplicado 5 veces, el cajón de la jugada correcta se vacía y la IA ya nunca la juega. De ahí la idea de multiplicar por un coeficiente en vez de restar.
Student tasks
- Ver cómo el cajón correcto de la posición 6 se vacía tras 5 derrotas.
- Entender por qué conviene multiplicar en lugar de restar.
Sala 6 · Juega contra la IA que aprende
Ahora el alumno juega contra la IA-cajas y empieza siempre la IA. Tras cada partida, en vez de restar, se multiplican por un coeficiente: por más de 1 las jugadas del que ganó y por menos de 1 las del que perdió (nunca llegan a 0). La IA aprende también de las jugadas del adversario: si gana el alumno, se potencian las jugadas que hizo. Tras 6 partidas, el alumno predice qué jugará la IA al empezar (6 piedras) y con 3 piedras, y lo compara con la política real aprendida. No se puede continuar hasta jugar al menos 7 partidas.
Student tasks
- Jugar al menos 7 partidas contra la IA (empieza ella).
- Predecir la jugada más probable de la IA en 6 y en 3 piedras y comparar con lo aprendido.
Sala 7 · La IA juega contra sí misma
Con la misma vista de cajas, botones para "jugar 1 vez", "jugar 5 veces" (con 1 s entre partidas) y "jugar 20 veces". Una animación temporal muestra cómo evoluciona la probabilidad de cada estrategia en cada posición a lo largo de las partidas, hasta que converge a la jugada correcta (dejar múltiplo de 4).
Student tasks
- Lanzar tandas de autojuego de distinto tamaño.
- Seguir en el gráfico cómo cada posición converge (o no) a una estrategia.
Sala 8 · La tasa de aprendizaje
Se explica por qué conviene multiplicar por un coeficiente en vez de restar fichas: así un cajón nunca llega a 0 y nunca queda "muerto". Ese coeficiente es la tasa de aprendizaje. Con un slider se prueban valores extremos y se ven sus efectos: demasiado alto se bloquea en una estrategia precipitada, demasiado bajo no converge.
Student tasks
- Probar coeficientes altos y bajos y observar la convergencia.
- Encontrar un rango de tasa de aprendizaje razonable.
Sala 9 · Aprender por currículo
Se entrenan dos IAs por autojuego desde 30 piedras, dándoles el MISMO número total de jugadas (es lo justo, porque las partidas del currículo, con pocas piedras, son más cortas). Una entrena siempre desde 30; la otra por currículo, de pocas piedras a 30. Una franja de 30 casillas por IA muestra qué posiciones han aprendido (verde) y cuáles no (gris). Con el mismo esfuerzo el currículo aprende bastantes más posiciones (~90% frente a ~75%), porque jugar siempre desde 30 deja muchas posiciones poco entrenadas. El currículo es clave en juegos enormes (ajedrez, Go).
Student tasks
- Entrenar y comparar las franjas de posiciones aprendidas de ambas IAs.
- Razonar por qué con las mismas jugadas el currículo aprende más.
Sala 10 · El hexapeón de Gardner
Se presenta el hexapeón: tablero 3×3 con 3 peones por bando que se mueven como en el ajedrez (avanzan recto, capturan en diagonal). Gana quien corona un peón en la fila contraria o deja al rival sin movimientos. El alumno juega contra un rival aleatorio.
Student tasks
- Aprender cómo se mueven y capturan los peones.
- Jugar varias partidas contra el azar.
Sala 11 · El árbol del juego
Se explica con detalle qué es el árbol del juego: todas las partidas posibles dibujadas juntas, donde cada flecha es una jugada y cada rama, de arriba abajo, una partida completa. El tablero inicial parpadea y el alumno despliega los nodos pulsando. Cada hoja indica quién gana ("Rojas sin jugadas: ganan las blancas"). Tarea: encontrar la partida más corta y la más larga (3 y 7 jugadas).
Student tasks
- Desplegar el árbol y recorrer ramas completas.
- Encontrar la partida más corta (3) y la más larga (7) y escribir cuántas jugadas tiene cada una.
Sala 12 · Minimax
Se explica en palabras sencillas la estrategia minimax: cada jugador elige lo mejor para sí suponiendo que el rival también juega perfecto. Se muestra un ramal de juego perfecto (tableros en fila, coloreados verde=gana quien mueve / rojo=pierde) con una estrella en la jugada clave que las rojas deben acertar. Dos tareas de opción múltiple: quién hace la jugada clave y quién gana con juego perfecto (las rojas, 2º jugador).
Student tasks
- Identificar en el ramal quién hace la jugada clave marcada con estrella.
- Deducir quién gana el hexapeón con juego perfecto leyendo el color del tablero inicial.
Sala 13 · Las cajas aprenden hexapeón
La IA de las cajas juega de rojas (2º jugador) contra blancas al azar y aprende con refuerzo multiplicativo (×1,3 al ganar, ×0,75 al perder). Se entrena por tandas; se DIBUJAN todas las jugadas posibles de las rojas en la posición clave con su PESO en vivo (cambian al entrenar) y una gráfica muestra cómo sube el % de victorias. Un spoiler "Para curiosos" guarda la matemática completa del refuerzo (E[Δln w]: el peso crece si se gana más del ~52% de las veces).
Student tasks
- Entrenar por tandas y ver cómo cambian los pesos de cada jugada en la posición clave.
- Comprobar que la jugada óptima acaba dominando y sube la tasa de victorias.
Sala 14 · ¿Puedes ganar a la IA entrenada?
El alumno juega con las blancas contra la IA que ha aprendido a jugar (mueve las rojas con juego perfecto, el minimax). Como las rojas (2º jugador) ganan con juego perfecto, no hay forma de ganarles: la sala lo deja experimentar y, al perder, lo explica. Botón de otra partida para reintentar.
Student tasks
- Jugar contra la IA perfecta e intentar ganar con las blancas.
- Entender que con juego perfecto el 2º jugador (rojas) siempre gana.
Sala 15 · Aprender es buscar (cierre del bloque)
Cierre del bloque del hexapeón. Primero un test de 3 preguntas capciosas (qué cambió DENTRO de la IA al aprender, por qué la entrenada y el minimax juegan igual, qué le pasa a una jugada buena que esa vez perdió). Al resolverlas se revela "Lo que hemos aprendido" y el puente clave: TODAS las redes neuronales aprenden ajustando pesos, con un enlace al lab Redes Neuronales.
Student tasks
- Responder las 3 preguntas del test inicial.
- Leer el resumen y seguir, si se quiere, al lab de redes neuronales.
Sala 16 · El juego del equipo
Dos jugadores eligen a la vez su esfuerzo: esforzarse (2), hacer poco (1) o no hacer nada (0). Aprueban si la suma de esfuerzos alcanza el umbral N. Cada uno gana 3 por aprobar (o pierde 1 por suspender) menos su propio esfuerzo. Con N=2 se explora la matriz 3×3 de pagos y aparece la tentación de gorronear.
Student tasks
- Explorar la matriz de pagos y encontrar las combinaciones que aprueban.
- Ver por qué cada jugador preferiría que el otro cargara con el trabajo.
Sala 17 · Dos IAs aprendiendo (N=2)
Cada puesto tiene su propio cajón con las 3 estrategias y elige por probabilidad; las dos IAs juegan contra sí mismas y se refuerzan multiplicando. Un diagrama de franjas apiladas (un píxel por ronda) muestra cómo evolucionan las probabilidades de cada puesto. Botones de jugar una vez o continuamente (muy rápido). Tras suficientes rondas aparece una conclusión que diagnostica el resultado: cooperación justa, reparto injusto (gorroneo) o colapso.
Student tasks
- Lanzar el autojuego (una vez o continuo) y observar las franjas.
- Leer la conclusión: ¿a qué equilibrio llega el equipo?
Sala 18 · Sube el listón (N=3, N=4)
Se repite el entrenamiento con umbrales más altos y no se puede continuar hasta probar N=3 Y N=4. Con N=3 el reparto suele volverse injusto: una IA ve que la otra siempre se esfuerza y se aprovecha (gorroneo). Con N=4 (profesor que pide la perfección) solo se aprueba si ambos hacen (2,2); como cuesta tanto coincidir, las IAs se desesperan porque su esfuerzo se frustra demasiadas veces y el equipo se hunde. Se compara el comportamiento emergente según el umbral.
Student tasks
- Entrenar las IAs con N=3 y con N=4 (obligatorio ambos) y leer la conclusión de cada caso.
- Comparar si emerge cooperación, reparto injusto (gorroneo) o desesperación/colapso según N.
Sala 19 · Estrategias mixtas (¿teatro o fútbol?)
Juego de coordinación (batalla de los sexos) en primera persona. El alumno elige su ocio favorito (la IA prefiere el otro) y con qué probabilidad irá al suyo. 1) "Jugar contra la IA": la IA COPIA su nivel de insistencia, así el reparto siempre es justo (ser cabezota no hace ganar; los extremos dan 0). 2) Autojuego animado: dos IAs ajustan su estrategia para no ser explotables y convergen de forma estable a ≈2/3 (equilibrio de Nash). 3) El alumno adivina la estrategia mixta óptima con la pista de Nash (a la pareja le da igual cambiar) y gana puntos: 15 por 66-67, 10 por 60-72, 5 por 50-80.
Student tasks
- Elegir favorito y probabilidad y jugar contra la IA (comprobar que el reparto es justo).
- Ver el autojuego y adivinar la probabilidad óptima (≈67%).
Sala 20 · Aprender es ajustar los pesos
Cierre del lab: aprender por su cuenta no es magia, es ajustar los pesos de las estrategias con premios y castigos. Muestra solo las conclusiones (estrategia única: un peso domina, como el juego de las piedras o el hexapeón; estrategia mixta: pesos repartidos; o depende del otro), una frase final que conecta con las redes neuronales y un enlace al lab Redes Neuronales. Sin pregunta.
Student tasks
- Leer las conclusiones del lab.
- Seguir, si se quiere, al lab Redes Neuronales.
Rooms to project
The most striking ones to show and discuss in class.