Oracle contrata 50.000GPUs a AMD para expandir su nube

Oracle y AMD refuerzan su alianza con el lanzamiento de las GPU MI450 en Oracle Cloud Infrastructure, que incorporará 50.000 unidades desde 2026 y ampliará su oferta de cómputo para IA a gran escala.
16 de octubre, 2025
Digital-Inside_oracle_IA

Oracle prevé ofrecer en el tercer trimestre de 2026 un superclúster público de IA con 50.000 GPU AMD Instinct MI450. La iniciativa forma parte de una ampliación de la colaboración multigeneracional entre ambas compañías, anunciada el 14 de octubre de 2025; con el objetivo de aumentar de forma significativa la capacidad para entrenar y desplegar modelos de IA a gran escala. OCI será socio de lanzamiento de estas GPU y anticipa una ampliación de capacidad en 2027 y años posteriores.

La nueva fase se apoya en el trabajo previo de ambas empresas en la nube de Oracle, que comenzó con la incorporación de formas basadas en AMD Instinct MI300X en 2024. Oracle también anuncia la disponibilidad general de OCI Compute con GPU AMD Instinct MI355X, previstas para operar en el superclúster de OCI con capacidad de escalar hasta 131.072 GPU, con foco en valor, flexibilidad y soporte a código abierto.

Los superclústeres de IA proyectados por OCI se basarán en el diseño de rack “Helios” de AMD. Cada rack contempla 72GPU con refrigeración líquida y una interconexión interna UALoE alineada con Ethernet abierta conforme al Ultra Ethernet Consortium, con el objetivo de reducir la latencia y maximizar el rendimiento entre pods y racks. Esta aproximación busca optimizar densidad, coste y eficiencia energética para entrenamiento e inferencia.

En el plano de la computación, cada GPU AMD Instinct MI450 está orientada a integrar hasta 432GB de memoria HBM4 y 20TB/s de ancho de banda, una configuración que, según la descripción de producto, permitiría abordar modelos de IA un 50% más grandes que en la generación anterior manteniéndolos íntegramente en memoria. Este incremento de memoria y ancho de banda persigue acortar tiempos de entrenamiento, disminuir la necesidad de particionar modelos y tratar cargas más complejas.

El nodo principal del sistema incorpora CPU AMD EPYC de nueva generación, con nombre en clave “Venice”. Estas CPU están planteadas para coordinar tareas y procesar datos a gran escala, además de aportar capacidades de computación confidencial y funciones de seguridad integradas para proteger cargas sensibles de extremo a extremo.

La conectividad se apoya en la tecnología AMD Pensando. Cada GPU puede equiparse con hasta tres tarjetas NIC “Vulcano” de 800Gbps y las redes convergentes aceleradas por DPU buscan reforzar la ingesta de datos a alta velocidad, optimizar la comunicación colectiva y mejorar la seguridad, con soporte para RoCE y estándares UEC. El uso de DPUs programables está orientado a descargar servicios de red y seguridad desde la CPU, consolidando rendimiento y aislamiento en entornos multicliente.

En la interconexión entre aceleradores, UALink y UALoE se plantean como elementos clave para escalar cargas, reducir cuellos de botella de memoria y coordinar modelos con billones de parámetros, con tráfico coherente de memoria entre GPU dentro de cada rack sin necesidad de enrutar por las CPU. El objetivo es ofrecer escalabilidad y fiabilidad en una infraestructura basada en estándares abiertos.

El software se articula sobre ROCm, el stack de código abierto de AMD, que incluye marcos, bibliotecas, compiladores y runtimes populares. La propuesta pretende facilitar la migración de cargas de IA y HPC existentes, preservar la libertad de elección de proveedor y acelerar la innovación. Las funciones avanzadas de partición y virtualización (incluida la virtualización SR-IOV y la multitenencia) se orientan a compartir clústeres de forma segura y a asignar GPU según necesidades de cada carga de trabajo.

Mahesh Thiagarajan, executive vice president en Oracle Cloud Infrastructure explico: “Nuestros clientes están creando algunas de las aplicaciones de IA más ambiciosas del mundo, y eso requiere una infraestructura robusta, escalable y de alto rendimiento. Al combinar las últimas innovaciones en procesadores AMD con la plataforma segura y flexible de OCI y la red avanzada impulsada por Oracle Acceleron, los clientes pueden ampliar sus límites con confianza. A través de nuestra colaboración de una década con AMD, desde EPYC hasta los aceleradores AMD Instinct, seguimos ofreciendo la base de nube más rentable, abierta, segura y escalable en colaboración con AMD para satisfacer las necesidades de los clientes en esta nueva era de la IA”. 

Por último, el comunicado incorpora los avisos habituales relativos a productos futuros y declaraciones prospectivas: los planes, calendarios y características descritos pueden cambiar a discreción de las compañías y no deben emplearse como compromiso de entrega para decisiones de compra.