
Midiendo la capacidad de los LLM para realizar criptoanálisis.
POR
Bruce Schneier
FUENTE
Schneier on Security
DATE
READ
2 min de lectura
Un nuevo referente, CryptanalysisBench, desafía a los grandes modelos de lenguaje a descubrir ataques sobre primitivas criptográficas históricas. Sus 191 tareas abarcan cifrados de bloque, funciones hash y otros, …
Hay un nuevo estándar que mide la capacidad de la IA para realizar criptoanálisis matemático. El modelo de vanguardia de Anthropic realmente encontró nuevos ataques. El estándar: “CryptanalysisBench: ¿Pueden los LLM hacer criptoanálisis?” La idea es evaluar la habilidad de los LLM para descubrir nuevos ataques matemáticos criptanalíticos contra una serie de algoritmos históricos. Resumen: El criptoanálisis—la tarea de encontrar ataques contra esquemas criptográficos—se sitúa en la intersección del razonamiento matemático y la ciberseguridad, dos áreas donde los LLM han avanzado más rápidamente. El criptoanálisis representa tanto un banco de pruebas limpio para el razonamiento de vanguardia (ya que los ataques prácticos pueden ser verificados automáticamente) como un dominio con apuestas inusualmente altas, dado que los primitivos en estudio sustentan nuestra seguridad digital. En este artículo, nos preguntamos si los LLM pueden hacer criptoanálisis y encontramos que la respuesta es cada vez más afirmativa. Introducimos CryptanalysisBench, 191 tareas a través de seis familias de primitivos criptográficos (cifrados de bloque, funciones hash, etc.) extraídas principalmente de cuatro competencias de estandarización del NIST. Nuestra evaluación consiste en tres niveles: (i) primitivos con quiebras prácticas conocidas; (ii) primitivos sin quiebras prácticas conocidas, evaluados tanto a plena capacidad como en variantes reducidas; y (iii) un conjunto de desafíos de primitivos de producción en la frontera del criptoanálisis. Cinco modelos de vanguardia (Claude Opus 4.8, Sonnet 5, Mythos 5, GPT-5.5, y el GLM-5.2 de pesos abiertos) rompen el 65%86% de los esquemas de nivel 1, 612 esquemas de nivel 2 a plena capacidad, y 2461 en todas las variantes reducidas. Más allá de derivar resultados conocidos, los modelos producen criptoanálisis novedoso, como un ataque de recuperación de clave que explota un defecto de diseño en el AEAD de SpoC y un error en la prueba de seguridad CCA publicada de KINDI, ambos hasta donde sabemos no previamente conocidos.