🧮 Las GPU más avanzadas de hoy se diseñan pensando en la inteligencia artificial y son cada vez más rápidas en cálculos toscos. La predicción meteorológica o el diseño de nuevos materiales, en cambio, suelen exigir números largos y precisos. Katsuhisa Ozaki, profesor del Instituto de Tecnología de Shibaura, en Japón, y sus colegas idearon una forma de combinar muchos cálculos toscos para obtener una respuesta fina. Desde septiembre de 2026, ese método viene integrado en CUDA Toolkit 13.4, la plataforma de desarrollo de NVIDIA.
La IA y la ciencia piden precisiones distintas
En simulaciones científicas como la predicción del tiempo, el diseño sísmico o la química cuántica se ha usado ampliamente la doble precisión (FP64) para garantizar la exactitud. Este formato representa cada número con 64 bits. El entrenamiento y la inferencia de IA, en cambio, se arreglan casi siempre con formatos de 8 bits como FP8 e INT8. En los últimos años, los fabricantes de GPU han dedicado cada vez más superficie del chip a acelerar esos formatos de baja precisión.
El resultado es una inversión incómoda. Según el Instituto de Tecnología de Shibaura, la B200 de NVIDIA ofrece unos 40 TFLOPS en doble precisión (un TFLOPS equivale a un billón de cálculos por segundo). Su sucesora, Blackwell Ultra (B300), se queda entre 1,2 y 1,3 TFLOPS, menos de una trigésima parte.
Cálculos toscos, apilados con restos
El esquema Ozaki nació con un artículo de 2012. Parte los números grandes en trozos pequeños que el hardware de baja precisión puede multiplicar sin error y luego suma esos productos parciales, más o menos como la multiplicación a mano, cifra por cifra. Esa primera versión, Ozaki Scheme I, llegó a CUDA 13.0 Update 2 en octubre de 2025 como una función opcional que los desarrolladores deben activar.
El punto débil de la versión I es el coste: cuanto más finos son los trozos para ganar precisión, más multiplicaciones hacen falta, y su número crece aproximadamente con el cuadrado de la precisión.
Ozaki Scheme II, que Ozaki presentó en 2025 junto a Yuki Uchino y Toshiyuki Imamura, de RIKEN, funciona con otro principio: el teorema chino del resto. Por ejemplo, si se conocen los restos de dividir un número entre 7, 11 y 13, y el número es menor que 1.001, solo hay una posibilidad. El esquema II convierte los valores de las matrices en enteros, deja que las unidades pensadas para IA multipliquen solo los restos que quedan al dividir entre unos pocos números pequeños y, al final, reconstruye el resultado verdadero a partir de esos restos. El número de multiplicaciones solo crece en proporción al número de restos. El esquema II se difundió como preprint en abril de 2025 y se publicó en una revista científica en julio de 2026. Llegó a CUDA con la versión preliminar para desarrolladores de la 13.4, en julio, y con la versión publicada en septiembre.
Según las notas de versión de NVIDIA, CUDA 13.4 elige automáticamente Ozaki II cuando supera a Ozaki I. En una B200, la multiplicación de matrices en doble precisión (DGEMM) llega hasta 175 TFLOPS, y la de números complejos (ZGEMM), hasta 295 TFLOPS. Comparando pico con pico, es algo más de cuatro veces lo que dan los circuitos de doble precisión de la propia B200. Para la próxima generación, Rubin, NVIDIA indica hasta 212 TFLOPS en DGEMM, aunque, según la universidad, el soporte para Rubin en CUDA 13.4 es una versión preliminar para desarrolladores.
Sin comprar GPU nuevas
El esquema II no necesita circuitos nuevos. Según NVIDIA, funciona en GPU de la generación Ampere y posteriores. Cuando un cálculo solo usa doble precisión, las unidades pensadas para IA quedan ociosas, y el esquema II las pone a trabajar. Incluso la RTX PRO 6000 Blackwell Server Edition, que no es el modelo tope de gama para centros de datos, alcanza hasta 45 TFLOPS en DGEMM.
Los programas públicos ya se mueven. Según la universidad, RIKEN señaló en un documento de marzo de 2026 que prevé aprovechar esta emulación en las bibliotecas numéricas de FugakuNEXT, el sucesor del superordenador japonés Fugaku. La universidad recoge además una información de la revista especializada HPCwire, de febrero de 2026, según la cual la Genesis Mission del Departamento de Energía de EE. UU. prevé apoyarse mucho en el esquema Ozaki para cubrir sus necesidades de doble precisión.
No lo resuelve todo
Para empezar, el alcance es limitado. La propia universidad explica que, por ahora, se aplica a la multiplicación de matrices, y que NVIDIA apenas empieza a llevarlo a bibliotecas de sistemas de ecuaciones y valores propios.
AMD lo ve con escepticismo. Nick Malaya, AMD Fellow, enumeró sus objeciones en marzo de 2026 en declaraciones a HPCwire. El esquema Ozaki no cumple la norma IEEE y no da el mismo resultado que el hardware FP64. Las matrices con elementos que difieren en varios órdenes de magnitud dan problemas de precisión. Con matrices no cuadradas, rinde por debajo del FP64 nativo. Y menos del 10% de las aplicaciones HPC reales se han reescrito en torno a la multiplicación de matrices de forma que puedan beneficiarse. AMD apuesta por el camino contrario con su Instinct MI430X, orientada a la ciencia. Según publicó HPCwire en agosto de 2026, se espera que ofrezca 288 TFLOPS en FP64 nativo cuando salga a principios de 2027, casi nueve veces los 33 TFLOPS de Rubin.
NVIDIA ha incorporado algunas salvaguardas. Según la documentación de cuBLAS, la biblioteca de matrices de CUDA, el sistema calcula los bits necesarios y recurre al FP64 nativo cuando esa cifra supera un límite fijado. Pero en un chip como la B300, esa vía de escape es precisamente la lenta. La misma documentación advierte de que la emulación puede usar hasta 8 GB de memoria de trabajo y de que los infinitos y los NaN pueden tratarse de forma distinta a la aritmética estándar.
Satoshi Matsuoka, director del Centro de Ciencias Computacionales de RIKEN, defendió en un artículo publicado en mayo de 2026 que hay que dejar de considerar los circuitos FP64 dedicados como un requisito de la computación científica. Sin embargo, el texto no ha pasado revisión por pares y el propio autor reconoce que muchas de sus cifras de rendimiento son proyecciones de un modelo, no mediciones. Todavía no se puede decir que el hardware de doble precisión sobre.
Cuando las matemáticas de una universidad entran en la caja de herramientas global
CUDA, una de las plataformas más usadas para computación con GPU, incorpora ahora un algoritmo nacido en una universidad japonesa. Pero el método no creció dentro de un solo país. El artículo original de 2012 lo firmaron tres investigadores en Japón y uno en Alemania: Siegfried Rump, de la Universidad Tecnológica de Hamburgo. En noviembre de 2025, ingenieros de NVIDIA publicaron su propia extensión del esquema Ozaki, que garantiza la precisión de forma automática. Hasta Malaya, el crítico, afirmó que AMD también dará soporte al esquema Ozaki en sus chips. Una vez publicadas, esas matemáticas se han mejorado y criticado desde distintos países y empresas.
Las bibliotecas de cálculo de tu laboratorio o tu empresa probablemente también llevan dentro las ecuaciones de alguien de un país lejano. ¿Alguna vez has buscado de quién son?
Referencias
- https://www.shibaura-it.ac.jp/headline/detail/20260930_7070_51_1.html
- https://docs.nvidia.com/cuda/cuda-toolkit-release-notes/index.html
- https://docs.nvidia.com/cuda/cublas/index.html
- https://arxiv.org/abs/2504.08009
- https://link.springer.com/article/10.1007/s11075-011-9478-1
- https://arxiv.org/abs/2511.13778
- https://arxiv.org/abs/2606.06510
- https://www.hpcwire.com/2026/03/13/amd-hints-at-big-fp64-increases-in-mi430x-gpu-as-ozaki-underwelms/
- https://www.hpcwire.com/2026/08/03/amds-fp64-boost-with-mi430x-is-even-bigger-than-expected/
- https://eetimes.itmedia.co.jp/ee/articles/2610/02/news019.html
- https://developer.nvidia.com/cuda-toolkit-archive
Discusión global
0 comentarios