AJEDREZ E INTELIGENCIA ARTIFICIAL (V)
Con la presente entrega finalizamos el tema mencionado. En esta entrega viajaremos a los primeros enfrentamientos de programas de ajedrez contra Grandes Maestros de ajedrez.
DEEP THOUGHT
«DeepThought» vence al GM Antony Miles en una partida de definición del torneo Software Tools de 1988
Fh., Anantharaman, T.S., Campbell, M.S., Nowatzyk, A. (1990). Deep
Thought. In: Marsland, T.A., Schaeffer, J. (eds) Computers, Chess, and
Cognition. Springer, New York, NY.
https://doi.org/10.1007/978-1-4613-9080-0_5
![]() |
| IBM’s Deep Blue Team (de izquierda a derecha): Joe Hoane, Joel Benjamin,Jerry Brody, F.H. Hsu, C.J. Tan y Murray Campbell. |
![]() |
| Claude Shannon concede a Feng-Hsiung Hsu el primer premio al Pensamiento Profundo (DEPP THOUGHT) en el Campeonato Mundial de Ajedrez por Ordenador celebrado en Edmonton (Alberta). 1989 |
octubre de 1988, una versión experimental de seis procesadores de Deep
Thought jugó un encuentro de exhibición de dos partidas contra Kasparov
en Nueva York. Aunque la nueva versión era capaz de buscar más de dos
millones de posiciones por segundo, Kasparov se deshizo de ella con
bastante facilidad. El resultado no fue inesperado, pero el juego de
Deep Thought fue bastante decepcionante.
![]() |
| Garry Kasparov and Feng-hsiung Hsu during Game 1 |
Fue
un enfrentamiento a cuatro partidas entre David Levy y el campeón
mundial de informática Deep Thought los días 12 y 13 de diciembre de
1989 en la sala del quinto piso de las oficinas de la British Computer
Society, Londres, Reino Unido. Mientras que el Maestro Internacional
David Levy no había competido seriamente en ajedrez desde hacía más de
diez años, Deep Thought tenía alguna experiencia reciente al haber
jugado contra Kasparov y la ACM 1989. DT estaba representado y operado
por Peter Jansen, que más tarde le dijo a David que se habían añadido 30
nuevos términos de evaluación al programa antes de su partida
2 de Febrero. Partida de exhibición entre «DeepThougth» y Anatoly
Karpov. Vence Anatoly Karpov. El 25 de abril, el ex campeón mundial
Anatoly Karpov perdió en una simulación con la computadora de ajedrez
Mephisto Portorose M68030 de Hegener & Glaser.
CHESSBASE
![]() |
| https://es.chessbase.com/ |
Sagar Shah: Frederic, ¿nos podrías contar cómo comenzó con Kasparov y ChessBase?
CHESS ASSISTANT
Chess Assistant crea una vista en árbol de todas las partidas en la base de datos actual, hasta la última jugada. El árbol puede almacenarse en disco. Cuando usted mira una posición particular del árbol, puede recuperar inmediatamente las partidas relevantes. No es necesario buscar partidas, aunque también es posible buscar partidas, posiciones, material, etc. Los formatos de partida PGN, ChessBase (Cbf), NIC y Chess Assistant pueden importarse y exportarse utilizando utilidades DOS. Chess Assistant para DOS hace tiempo que se abandonó, pero sigue siendo muy adecuado para la investigación rápida de grandes colecciones de partidas. Aunque el programa no es muy práctico si desea almacenar su propio repertorio, y también a pesar de sus limitaciones relacionadas con DOS, fue un producto muy apreciado en su época. Sus diferentes funciones están bien integradas y son rápidas. Los colores no son configurables. CA también tiene funciones para la edición de ajedrez, es decir, fuentes de ajedrez, etc. Las siguientes capturas de pantalla han sido tomadas en WinXP,
ejecutando DOSBox.
DEEP BLUE
1996 10 al 17 de Febrero. Primer match entre Kasparov y «DeepBlue» realizado en Nueva York. Vence Kasparov por +3 -1 =2.
Deep Blue fue una supercomputadora desarrollada por el fabricante estadounidense IBM para jugar al ajedrez. Fue la primera que venció a un campeón del mundo vigente, Gary Kaspárov, con un ritmo de juego lento. Esto ocurrió el 10 de febrero de 1996, en una memorable partida. Sin embargo, Kaspárov ganó 3 y empató 2 de las siguientes partidas, derrotando a Deep Blue por 4-2. El encuentro concluyó el 17 de febrero de 1996. (WIKI)
Kaspárov vs. Deep Blue
La partida de creatividad contra perfección
Por Juan Raúl Casal el 7 mayo, 2022
Una persona no puede calcular cien millones de jugadas por segundo ni puede correr más rápido que un tren bala. Lo que sí puede hacer es construir esas cosas.
![]() |
| Garry Kaspárov contra Deep Blue |
Si Kaspárov no cambiaba de estrategia se arriesgaba a perder su imperio de sesenta y cuatro casillas. En la sala estaba sentado Garry Kaspárov, el campeón mundial de aquel entonces, al otro lado de la mesa había un ingeniero y el monitor que le daba instrucciones. En 1996 el mundo pudo ver en vivo el duelo entre hombre y máquina. El encuentro fue en Filadelfia, Pensilvania, y se jugó en un tablero de cuadros blancos y negros. Una partida de ajedrez por el destino de la humanidad, como creían los que apuntaban cada movimiento.
Un equipo de ingenieros de IBM liderado por Feng–hsiung Hsu crearon a Deep Blue, un software que podía calcular alrededor de cien millones movimientos por segundo. Desafiaron a Garry Kaspárov para ver si la capacidad de no cometer errores de esa supercomputadora era suficiente para ganarle a uno de los mejores ajedrecistas de todos los tiempos.
Toda la atención estaba en el choque de piezas blancas contra negras. La prensa repudiaba a la tecnología mientras transmitía las partidas con la ayuda de cámaras y antenas satelitales.
Todos los medios cubrieron este hecho desde el ángulo de la confrontación y no del gran paso que Deep Blue fue para la inteligencia artificial. Toda la atención estaba en el choque de piezas blancas contra negras. La prensa repudiaba a la tecnología mientras transmitía las partidas con la ayuda de cámaras y antenas satelitales.
![]() |
| Portada de NewsWeek del 5 de mayo de 1997 |
No se puede jugar así contra una computadora. Un software que puede calcular millones de posibilidades por segundo hace cada movimiento con el objetivo de no cometer errores, aunque la partida no vaya a ninguna parte; mientras que una persona busca ganarle a su contrincante, sin importar que eso implique hacer perder piezas.
A veces se sacrifica a la reina para ganar con la torre.
Faltaron elementos clave en esas primeras cuatro partidas: orgullo, frustración, miradas que se cruzan como jugadas en el tablero. Creatividad. Eran cosas a las que Kaspárov estaba acostumbrado en un rival, Deep Blue no tenía nada de eso. Si continuaba con la misma estrategia se arriesgaba a empatar con la máquina de nuevo, o a perder en el juego al que le dedicó una buena parte de su vida. Debía jugar como humano.
Kaspárov gano el quinto juego casi por accidente, no fue nada impresionante. La sexta partida marcó toda la contienda, el ajedrecista ruso —quien jugó con las blancas— hizo movimientos que serían terribles en una partida común. Sólo que esta partida no era común y el oponente tampoco. El hombre abrió con un gambito de dama para controlar en centro con peones, Deep Blue respondió con una defensa eslava, para que su rival de carne y hueso no pudiera hacer más movimientos sin sacrificar piezas.
Desde que Garry puso su caballo en la casilla b2 comenzó a hacer movimientos que un software de ajedrez tacharía de errores, incluso estupideces. Kaspárov atacó a la computadora por los dos lados del tablero, no le importó dejar al rey descubierto. Cada que Deep Blue intentaba hacer un ataque el ruso se movía a las mejores posiciones, aun si eso significaba perder al caballo para controlar más espacio.
El bando de las negras comenzaba a quedarse sin espacio para respirar. Las piezas blancas fuera del juego pudieron ver cómo su sacrificio no fue en vano. La reina negra solamente podía moverse a casillas sin importancia, la torre y el alfil de la supercomputadora estaban acorralados en una esquina.
Kaspárov comenzó a tomar la delantera a pesar de tener menos material que Deep Blue. El bando de las negras comenzaba a quedarse sin espacio para respirar. Las piezas blancas fuera del juego pudieron ver cómo su sacrificio no fue en vano. La reina negra solamente podía moverse a casillas sin importancia, la torre y el alfil de la supercomputadora estaban acorralados en una esquina. El tablero le pertenecía al ruso.
Deep Blue se rindió, sus dos torres, alfil y reina no pudieron hacer nada mientras que su rey estaba en la mira de Kaspárov. Los medios y la comunidad de ajedrez celebraron la victoria del hombre. La creatividad y el caos de un humano le ganó a la perfección de una máquina. Estas partidas sólo alimentaron la idea, presente desde la mitología hasta Matrix, de que las personas y las máquinas son enemigos. Nada más lejos de la verdad.
Deep Blue fue uno de los precursores para mejorar los softwares para monitorear fenómenos climatológicos y financieros, así lo explicó en una entrevista el doctor Murray Campbell, pionero de la inteligencia artificial y uno de los ingenieros que prepararon esta máquina para las partidas. Resulta que el enemigo jurado del hombre le puede avisar si se aproxima un huracán o si la Bolsa de Valores está por desplomarse.
El mismo Garry Kaspárov ha dicho en varias entrevistas y charlas TED que una persona no puede ganarle a una computadora en su propio juego. “No les temas a las máquinas inteligentes, trabajen con ellas”, dijo el ajedrecista en la charla. Una persona no puede calcular cien millones de jugadas por segundo ni puede correr más rápido que un tren bala. Lo que sí puede hacer es construir esas cosas.
Al año siguiente —1997— el jugador ruso perdió la revancha contra la computadora. Cuando la competencia se hizo oficial el titular en la portada de la revista NewsWeek fue “The Brain’s Last stand” (La última defensa del cerebro). Luego de las partidas del noventa y seis el equipo de ingenieros de IBM se dedicó a mejorar el software que destronó a uno de los mejores ajedrecistas de la historia. En ese segundo encuentro no fue Deep Blue quien venció a Garry Kaspárov, fueron Feng–hsiung Hsu, Murray Campbell, Joe Hoane y Thomas Anantharaman. La humanidad prevalece. ®
![]() |
|
| Tomado de FaceBook de Antonio Gude
KASPAROV parece pedir explicaciones a DEEP BLUE. |
supercomputadora de IBM Deep Blue fue un punto de inflexión en la
historia de la tecnología. Era el comienzo de una nueva era en
inteligencia artificial: una máquina capaz de batir al actual campeón
humano en el juego más intelectual. En este libro innovador, Kasparov
revela su asombroso lado de la historia por primera vez. Describe cómo
se sintió al diseñar una estrategia contra un oponente implacable e
infatigable con todo el mundo mirando, y relata la historia de la
inteligencia artificial a través del microcosmos del ajedrez. Kasparov
utiliza su experiencia inigualable para mirar el futuro de las máquinas
inteligentes y lo ve con brillantes posibilidades. Deep Thinking es un
caso bien argumentado a favor del progreso tecnológico, del hombre que
estaba frente al precipicio con su propia carrera en juego.» AMAZON
REDES NEURONALES
El modelo de redes neuronales
Última actualización: 2021-08-17
Las redes neuronales son modelos simples del funcionamiento del sistema nervioso. Las unidades básicas son las neuronas, que generalmente se organizan en capas, como se muestra en la siguiente ilustración.
Una red neuronal es un modelo simplificado que emula el modo en que el cerebro humano procesa la información: Funciona simultaneando un número elevado de unidades de procesamiento interconectadas que parecen versiones abstractas de neuronas.
Las unidades de procesamiento se organizan en capas. Hay tres partes normalmente en una red neuronal : una capa de entrada, con unidades que representan los campos de entrada; una o varias capas ocultas; y una capa de salida, con una unidad o unidades que representa el campo o los campos de destino. Las unidades se conectan con fuerzas de conexión variables (o ponderaciones). Los datos de entrada se presentan en la primera capa, y los valores se propagan desde cada neurona hasta cada neurona de la capa siguiente. al final, se envía un resultado desde la capa de salida.
La red aprende examinando los registros individuales, generando una predicción para cada registro y realizando ajustes a las ponderaciones cuando realiza una predicción incorrecta. Este proceso se repite muchas veces y la red sigue mejorando sus predicciones hasta haber alcanzado uno o varios criterios de parada.
Al principio, todas las ponderaciones son aleatorias y las respuestas que resultan de la red son, posiblemente, disparatadas. La red aprende a través del entrenamiento. Continuamente se presentan a la red ejemplos para los que se conoce el resultado, y las respuestas que proporciona se comparan con los resultados conocidos. La información procedente de esta comparación se pasa hacia atrás a través de la red, cambiando las ponderaciones gradualmente. A medida que progresa el entrenamiento, la red se va haciendo cada vez más precisa en la replicación de resultados conocidos. Una vez entrenada, la red se puede aplicar a casos futuros en los que se desconoce el resultado.
ALPHAZERO
AlphaZero: jugador creativo
AlphaZero sustituye la heurística artesanal por una red neuronal profunda y algoritmos a los que no se les da nada más allá de las reglas básicas del juego. Enseñándose a sí mismo, AlphaZero desarrolló su propio estilo de juego, único y creativo, en los tres juegos.
En sus partidas de ajedrez, por ejemplo, los jugadores vieron que había desarrollado un estilo de juego muy dinámico y «poco convencional» que difería de cualquier otro motor de ajedrez anterior. Muchas de sus ideas «que cambian el juego» han sido adoptadas desde entonces al más alto nivel de juego.
![]() |
| «No puedo disimular mi satisfacción porque juega con un estilo muy dinámico, ¡muy parecido al mío!». Garry Kasparov Ex Campeón del Mundo de Ajedrez |
AlphaZero revoluciona la ciencia
Ajedrez/El Rincón de los Inmortales
Leontxo García 21 nov 2022
programa que introdujo conceptos rompedores en 2017 sacrifica una pieza
a muy largo plazo a cambio de actividad, armonía y dinamismo.
La
revolucionaria irrupción de AlphaZero en 2017, ganando por una goleada
de escándalo (28 victorias, 72 empates, ninguna derrota) a Stockfish, el
mejor jugador inhumano hasta entonces, marca uno de los grandes hitos
en la historia del ajedrez. Pero no solo del ajedrez porque, como ya
ocurrió cuando Deep Blue (IBM) derrotó a Kaspárov en 1997, lo aprendido
en el deporte mental (también en el go), ha sido muy útil poco después
en campos muy importantes de la ciencia. La empresa Deep Mind, creadora
de AlphaZero y perteneciente a Google, logró en 2020 el mayor adelanto
en la historia de la biología: descifrar el comportamiento de las
proteínas, un elemento esencial para la vida.
Volviendo al
ajedrez, AlphaZero no dispone de una base de datos con más diez millones
de partidas (jugadas desde el siglo XVI hasta hoy) como sí tienen otros
jugadores de silicio. A AlphaZero solo le programaron las reglas
básicas para que luego disputase millones de partidas contra sí mismo y
aprendiese de ellas. Por eso, su estilo es muy rompedor. Por ejemplo,
con asombrosos sacrificios de pieza a muy largo plazo, como el de la
magnífica partida de este vídeo.
AlphaZero: la revolución del Machine Learning
Por Rodrigo Díaz López
En un artículo anterior reflexionamos sobre la Inteligencia Artificial aplicada al mundo del ajedrez. Hoy nos centraremos en el nuevo actor que ha venido a revolucionar los mundos del ajedrez y del Machine Learning: AlphaZero.
Deep Blue, el pionero
Deep Blue, desarrollado por el gigante estadounidense IBM, fue el primer ordenador capaz de ganarle una partida al campeón del mundo de ajedrez. Fue, asimismo, el primer ordenador en derrotar al campeón del mundo de ajedrez en un torneo de partidas jugadas a un ritmo de juego normal.
![]() |
| atsistemas.com |
El software de Deep Blue, además de tener acceso a extensas bases de datos de aperturas y tablas de finales, utilizaba el algoritmo minimax, y una técnica de poda alfa-beta, especialmente diseñado por un equipo de programadores y grandes maestros de ajedrez. Este algoritmo fue mejorado usando técnicas de machine learning. Se preparaba una primera versión del algoritmo y se le proponían una batería de cientos de miles de las mejores partidas de ajedrez de la historia, jugadas por humanos, de forma que Deep Blue podía aprender las técnicas utilizadas en ellas para poder aplicarlas en los enfrentamientos futuros. Pero este aprendizaje era supervisado por los desarrolladores. Cuando Deep Blue realizaba una jugada “errónea”, es decir un bug, se revisaba el código y se modificaba hasta que Deep Blue realizaba la jugada “correcta”. De este modo, el software se iba perfeccionando poco a poco.
No obstante, Deep Blue no estaba realmente diseñado para jugar al ajedrez, sino para jugar al ajedrez contra Gary Kaspárov. Deep Blue conocía todas las partidas jugadas por el campeón y los grandes maestros del ajedrez que lo entrenaron, entre los que se encontraba el español Miguel Illescas, consiguieron que su estilo de juego se opusiese perfectamente al estilo de juego agresivo de Kaspárov.
Por otra parte, en aquellos enfrentamientos contra Kaspárov hubo acusaciones de comportamiento poco ético por parte de IBM. Uno de los empleados de seguridad asignados a Kaspárov hablaba ruso y, presuntamente, espiaba las conversaciones con su entrenador para que el equipo de IBM pudiera obtener pistas sobre cómo preparar la siguiente partida. Además, aunque IBM no podía manipular el software de Deep Blue en medio de una partida, en ocasiones Deep Blue se “bloqueaba” y necesitaba reiniciarse lo que permitiría, presuntamente, realizar modificaciones en su software.
Nunca sabremos hasta donde podría haber llegado Deep Blue en un torneo convencional, contra otros humanos o contra otras máquinas. IBM nunca ha publicado el código de su algoritmo y desmanteló Deep Blue poco después del torneo de 1997, así que desde entonces no ha vuelto a jugar al ajedrez. Los dos racks que lo formaban se encuentran actualmente en el Museo Nacional de Historia Estadounidense y en el Museo Histórico de Ordenadores, ambos en Estados Unidos.
Stockfish, el sucesor
El que ha demostrado ser el mejor sucesor de Deep Blue es, sin lugar a duda, el motor de ajedrez de código abierto denominado Stockfish.
![]() |
| atsistemas.com |
Stockfish fue desarrollado en 2008 por Tord Romstad, Joona Kiiski, Marco Costalba y Gary Linscott, con la colaboración de una comunidad de desarrolladores de código abierto. Está desarrollado en C++, el código se publica bajo la licencia GPL y está disponible para Windows, Linux, Mac, Android e iOS.
Stockfish puede usar hasta 512 hilos de CPU en sistemas multiprocesador, que le permiten examinar 70 millones de posiciones por segundo, e implementa una poda alfa-beta avanzada que se caracteriza por su gran profundidad de búsqueda. El software de Stockfish está en constante mejora. Cada uno de los cambios en el código, propuestos por la comunidad de desarrolladores, se acepta o rechaza en función de los resultados de jugar decenas de miles de partidas contra una versión «de referencia» más antigua del programa utilizando pruebas de razón de probabilidad secuencial. Las pruebas se verifican mediante la prueba de χ² y solo si los resultados son estadísticamente significativos se consideran fiables y se utilizan para revisar el código.
Todas estas características han llevado a Stockfish a ocupar varias veces el primer lugar en el campeonato mundial (no oficial) de ajedrez para ordenadores. Desde 2013 a 2019, de los 12 títulos que se han disputado, ha ganado 6 y ha quedado segundo en otras 5 ocasiones.
En definitiva, Stockfish es un motor de ajedrez, con un ELO superior al del campeón del mundo de ajedrez Magnus Carlsen, que puedes llevar en el bolsillo instalado en tu teléfono móvil.
Y en esto llegó… AlphaZero
En los últimos años, todos los módulos de ajedrez populares se habían basado en el algoritmo minimax, mejorado con una poda alfa-beta, habían usado una estructura de árbol para calcular las diferentes variantes y una compleja función de evaluación para asignar a la posición al final de una variante un valor como +1,5 (la ventaja de las blancas equivale a un peón y medio) o -9,0 (la ventaja de las negras equivale a una dama).
Sin embargo, en 2017 DeepMind (una compañía propiedad de Google) desarrolló AlphaZero para especializarse en aprender a jugar juegos de dos jugadores y movimientos alternos (como el ajedrez, el shogi o el go), basándose en técnicas de aprendizaje reforzado y aprendizaje profundo con redes neuronales.
La mejora continua de la función de evaluación se consigue por medio de una red neuronal.
La posición actual sobre el tablero se introduce en la capa de entrada de la red, a continuación es procesada por la primera capa de neuronas, cada una de las cuales envía el resultado a las neuronas de la siguiente capa, y así sucesivamente hasta llegar a la capa de salida que obtiene el resultado final.
En AlphaZero este resultado tiene dos partes:
Una evaluación de la posición de ajedrez que se le había planteado.
Una evaluación de cada jugada legal en la posición.
En realidad, cada neurona es una unidad de procesamiento muy simple que acepta una serie de aportaciones, multiplica cada una por una cantidad de peso, suma las respuestas y luego aplica una función de activación que da un resultado, típicamente en el rango de 0 a 1. Es importante tener en cuenta que el resultado de una neurona puede depender de todas las neuronas que hay en la capa anterior, lo cual permite a la red captar muchas sutilezas.
La red neuronal de AlphaZero tiene 80 capas y cientos de miles de neuronas. Los pesos son muy importantes, porque entrenar a la red es una cuestión de dar valores a los pesos para que la red aprenda a “jugar bien” al ajedrez.
Como hemos visto en un artículo anterior, el gran problema del ajedrez son las variantes. Teniendo en cuenta todos los posibles movimientos, las posibles respuestas del adversario, nuestros posibles movimientos siguientes, etc. al cabo de solo 4 jugadas tendríamos unas 650.000.000.000 posiciones distintas que tendríamos que evaluar. Y esa cifra sigue creciendo exponencialmente. AlphaZero reduce el número de variantes considerando solo los movimientos que le recomienda su red neuronal, una media de tres posibles movimientos. De ese modo, una modesta cantidad de 80.000 posiciones evaluadas por segundo (como hemos visto, Stockfish examina 70 millones de posiciones por segundo) le permiten ver unos siete movimientos por delante en menos de un minuto.
En cuando al hardware, AlphaZero se ejecuta en un hardware especializado: las unidades de procesamiento por tensores (TPU) de Google. AlphaZero usa 5.000 TPUs de primera generación para generar partidas de juego autónomo, las cuales se usan para entrenar a la red, y 64 TPUs de segunda generación para realizar el entrenamiento como tal. No obstante, para jugar al ajedrez solo necesita 4 TPUs.
Por todo lo que hemos visto hasta el momento, se podría decir que AlphaZero es como un bebé recién nacido, está tremendamente equipado para aprender pero tiene muy pocos conocimientos. En el caso del ajedrez, a AlphaZero simplemente le enseñaron las leyes del ajedrez. No sabe nada de teoría de aperturas, ni tiene conocimientos estratégicos o tácticos. Por no conocer, ni siquiera conoce el valor relativo de las piezas de ajedrez. Su función de evaluación solo mide la probabilidad de victoria o derrota, entre -1 y 1. Es decir, le enseñaron a mover las piezas, que el objetivo del juego es dar jaque mate al rey contrario… y nada más.
En diciembre de 2017, con estos conocimientos tan exiguos, AlphaZero se puso a jugar al ajedrez consigo mismo. Los desarrolladores de DeepMind podrían haberle dado partidas de grandes maestros de las que aprender (aprendizaje supervisado). Sin embargo, esto habría dado como resultado que AlphaZero aprendería a jugar ajedrez como lo hacen los humanos, con sus mismos errores. Así que el equipo de DeepMind optó por usar un enfoque más ambicioso denominado aprendizaje de refuerzo. Al principio AlphaZero jugaba contra si mismo moviendo aleatoriamente las piezas pero si, eventualmente, uno de los dos bandos ganaba, sería debido a que las jugadas que había realizado debían ser mejores que las del bando que perdió, así que se reajustaban los pesos en la red neuronal. Tras un lote de ejecuciones (4.096 partidas) se consolidaba la mejor red neuronal obtenida hasta el momento, que se catalogaba como “Mejor jugador”, y en el siguiente lote se jugaba siempre contra este “Mejor jugador”. Si tras otro lote de ejecuciones el nuevo jugador había demostrado ser mejor que él, entonces ocupaba su puesto y vuelta a empezar. Esto es, AlphaZero aprende de sus propios errores y toma sus propias decisiones sin intervención humana.
Durante este período de aprendizaje, el progreso de AlphaZero se medía jugando partidas de un segundo por movimiento contra Stockfish. Cuando AlphaZero llevaba 300.000 iteraciones en los gigantescos servidores de Google (unas cuatro horas de entrenamiento) los desarrolladores comprobaron que ya tenía un nivel superior a Stockfish. No obstante, el entrenamiento de la red continuó hasta completar unas 700.000 iteraciones, proceso que duró 9 horas, y a continuación AlphaZero se enfrentó a Stockfish en una serie de 100 partidas, jugando la mitad con blancas y la mitad con negras. El resultado fue espectacular: +28 -0 =72. AlphaZero ganó 28 partidas, no perdió ninguna e hizo tablas en las otras 72.
Muchos consideraron que el encuentro no había sido justo porque no se utilizó la última versión disponible de Stockfish, no se le permitió utilizar su libro de aperturas y el hardware utilizado favorecía claramente a AlphaZero, así que a principios de 2018 se repitió el encuentro con un resultado muy similar. AlphaZero vapuleó a Stockfish en una nueva serie de 1.000 partidas, con un marcador de +155 -6 =839. AlphaZero ganó 155 partidas, sólo perdió 6 e hizo tablas en las otras 839.
Algunas de estas partidas han sido publicadas recientemente y muestran un estilo de juego revolucionario. Por ejemplo, como AlphaZero no conoce el concepto de “valor material de las piezas” realiza espectaculares sacrificios de peones o piezas en la apertura, solo porque maximizan sus posibilidades de ganar la partida a largo plazo.
Pero lo más sorprendente de AlphaZero no es que tras unas pocas horas de aprendizaje autodidacta haya sido capaz de aprender a jugar al ajedrez a un nivel sobrehumano. Lo más extraordinario es que el algoritmo de AlphaZero es idéntico para los juegos de ajedrez, shogi y go… y también ha logrado vencer a los mejores módulos informáticos de estos dos juegos, partiendo tan solo de las normas básicas de los mismos y unas pocas horas de entrenamiento. Esto supone un importante avance para la Inteligencia Artificial, y abre las puertas a crear en el futuro un sistema capaz de aprender cualquier juego… con las implicaciones que esto podría tener.
Como corolario comentaré que, debido al hardware tan especializado en el que corre, no es posible instalar AlphaZero en un dispositivo doméstico. No obstante, en 2018 se ha creado un motor de ajedrez de código abierto denominado Leela Chess Zero (Lc0), basado en el proyecto de AlphaZero. Lc0 ha ganado recientemente el campeonato mundial (no oficial) de ajedrez para ordenadores (TCEC 15), tras derrotar en la final precisamente a Stockfish, y dispone de una interfaz gráfica de usuario para Windows y para Linux.
La siguiente generación de motores de ajedrez basados en redes neuronales ya está aquí… y ha venido para quedarse.
Rodrigo Díaz López
https://www.atsistemas.com/es/blog/alphazero-la-revolucin-del-machine-learning
Pamplona, febrero de 2023
Categorías: Historia del ajedrez
.jpg)

.jpg)












Deja una respuesta