RTX Spark contra MacBook M5 Max: por qué el ancho de banda manda en los LLM locales

El 31 de mayo de 2026, en la keynote de NVIDIA en el GTC Taipei, la compañía presentó junto a Microsoft el RTX Spark, su primer procesador Arm para PC con Windows. Las primeras reacciones dieron por amortizado al MacBook. Para quien quiere ejecutar modelos de lenguaje en local, sin embargo, la cifra que de verdad manda sobre la velocidad es otra, y ahí el portátil de Apple sigue por delante.

Qué es el RTX Spark

Es un único paquete con tres piezas que comparten memoria, el mismo esquema que Apple popularizó con Apple Silicon:

  • CPU Grace de 20 núcleos: diez Cortex-X925 de rendimiento y diez Cortex-A725 de eficiencia, diseñada con MediaTek.
  • GPU Blackwell RTX con 6.144 núcleos CUDA, con núcleos RT y Tensor.
  • Hasta 128 GB de memoria LPDDR5X unificada, compartida y coherente entre CPU y GPU.
  • Hasta 1 petaflop de cómputo FP4, la cifra que NVIDIA usa para defender que se pueden ejecutar modelos de 120.000 millones de parámetros con contextos de un millón de tokens.

Los portátiles y sobremesas compactos llegarán en otoño de 2026 de la mano de ASUS, Dell, HP, Lenovo, Microsoft y MSI, con Acer y Gigabyte después. A fecha de hoy no hay precios definitivos ni análisis independientes con un equipo real.

La cifra que decide la velocidad: el ancho de banda

En la fase de generación, cada token obliga a leer de memoria prácticamente todos los pesos del modelo (y la caché KV cuando el contexto es largo). Las unidades de cálculo terminan enseguida y esperan los siguientes datos. La generación está limitada por memoria, no por cómputo, así que los tokens por segundo siguen de cerca al ancho de banda y poco a los FLOPS.

Comparación de los tres portátiles Arm relevantes:

Chip

Ancho de banda

Memoria máxima

Apple M5 Max (GPU de 40 núcleos)

614 GB/s

128 GB

Apple M5 Max (GPU de 32 núcleos)

460 GB/s

36 GB

NVIDIA RTX Spark

unos 300 GB/s (bus de 256 bits)

128 GB

Snapdragon X Elite

135 GB/s

64 GB

Una corrección sobre el 273 GB/s

Buena parte de la cobertura, incluido el artículo original en el que se basa esta pieza, cita 273 GB/s para el RTX Spark. Esa es la cifra del DGX Spark (el miniequipo GB10 de sobremesa), no la del chip para PC. La guía de portado de NVIDIA para RTX Spark habla de una interfaz de 256 bits con 300 GB/s de ancho de banda, y la ficha de Dell, con LPDDR5X a 9.400 MT/s, da unos 300,8 GB/s. NVIDIA no había publicado una cifra definitiva en su página principal de producto, así que conviene tomar los 300 GB/s como dato de documentación técnica y no de ficha comercial. La conclusión no cambia: la ventaja de Apple pasa de 2,25 veces a algo más de 2 veces.

Qué significa en tokens por segundo

Un modelo de 30.000 millones de parámetros cuantizado a 4 bits ocupa unos 16 GB. Dividiendo el ancho de banda entre esa lectura se obtiene un techo teórico:

  • M5 Max (614 GB/s): unos 38 tokens/s
  • RTX Spark (?300 GB/s): unos 19 tokens/s
  • Snapdragon X Elite (135 GB/s): unos 8 tokens/s

Son cálculos de servilleta: los valores reales salen más bajos por sobrecarga de software y no hay mediciones independientes del RTX Spark todavía. Lo que sí sirve es la proporción. El petaflop FP4 no rescata la generación, porque el cuello de botella no es el cálculo. Y los 128 GB permiten alojar un modelo de 120B (unos 60 GB en 4 bits) más una caché grande, pero mover todo eso por un bus de 300 GB/s en cada token sigue siendo lento. Tener un contexto de un millón de tokens en memoria no equivale a poder usarlo con rapidez.

El enlace CPU-GPU, otra cosa distinta

NVIDIA conecta la CPU Grace con la GPU Blackwell mediante NVLink-C2C a 600 GB/s bidireccionales, unas cinco veces el PCIe 5.0 x16 (en torno a 64 GB/s por sentido), con un espacio de direcciones coherente. Eso elimina las copias entre memorias en cargas que alternan CPU y GPU (preprocesado, inferencia híbrida, bucles de agentes). Apple resuelve el mismo problema quitando el puente: ambos procesadores leen los mismos bytes. Esos 600 GB/s son la velocidad del enlace interno, no la de lectura de la DRAM, así que no mejoran la generación de tokens. Algunas cifras de 600 GB/s que circulan como «ancho de banda de memoria» mezclan ambas cosas.

Dónde sí gana NVIDIA

  • Prefill y entrenamiento. Procesar un prompt largo antes del primer token depende del cómputo, igual que el ajuste fino, el servicio por lotes y la generación de imagen o vídeo.
  • CUDA nativo. NVIDIA afirma que toda su pila (CUDA, DLSS, OptiX, Reflex) funciona sin emulación. Herramientas como Blender con OptiX o ComfyUI asumen hardware NVIDIA, y nada de eso corre de forma nativa sobre Metal.
  • Juegos. Con anti-cheat nativo para Arm (Riot, KRAFTON, Denuvo), DLSS y trazado de rayos, el equipo apunta a títulos AAA. Las demos del escenario usaron DLSS y generación de fotogramas, así que son material de fabricante, no un benchmark.

Compatibilidad: el obstáculo histórico de Windows en Arm

Windows RT (2012), el Surface Pro X (2019) y el Snapdragon X Elite (2024) fallaron o se quedaron a medias por el software. Hoy el emulador Prism de Windows 11 24H2 traduce x86 a Arm64 con soporte de extensiones como AVX y AVX2, y Microsoft indica que las aplicaciones nativas Arm suponen el 90 % del tiempo de uso en Windows Arm (telemetría que excluye juegos). Persiste un impuesto de traducción en lo emulado y algún controlador o aplicación empresarial heredada que no coopera.

Qué elegir

  • LLM local en portátil, hoy, en silencio y con batería: MacBook Pro M5 Max con GPU de 40 núcleos. Más del doble de ancho de banda que cualquier chip Arm de Windows, y ya se puede comprar. Atención a la configuración: la de 32 núcleos de GPU baja a 460 GB/s y 36 GB.
  • Flujos con CUDA, 3D, agentes o juegos en la misma máquina: RTX Spark, cuando salga.
  • Prefill largo, ajuste fino o modelos de 120B que solo hay que hacer caber: el cómputo y los 128 GB del RTX Spark compensan si se acepta una generación más lenta.
  • Arm barato, ligero y con batería: un Snapdragon X sigue siendo la opción de valor.

La regla que queda

Hasta que haya análisis independientes, todas las cifras del RTX Spark son de NVIDIA, de Microsoft o aritmética; el lado de Apple es el único con producto en la calle. Para elegir hardware que ejecute modelos en local, la regla útil es mirar primero el ancho de banda y después los FLOPS, porque el primero determina la velocidad a la que salen los tokens.

Imagen: Pexels / KIEU TRUONG

COMPARTE ESTE ARTÍCULO

COMPARTIR EN FACEBOOK
COMPARTIR EN TWITTER
COMPARTIR EN LINKEDIN
COMPARTIR EN WHATSAPP