Nvidia presenta las DGX Spark: Triplica el rendimiento de modelos de lenguaje locales

Adam Conway, Lead Technical Editor de XDA Developers, ha logrado ejecutar un modelo de lenguaje de 284 mil millones de parámetros en dos máquinas Nvidia DGX Spark, alcanzando un rendimiento comparable al de la infraestructura en la nube de DeepSeek. Este logro representa un avance significativo en la capacidad de ejecutar modelos de lenguaje grandes de forma local.
El Desafío del Rendimiento Local
Anteriormente, Conway experimentó con el modelo DeepSeek V4 Flash en una sola Lenovo ThinkStation PGX. Aunque funcional, el rendimiento era limitado, alcanzando solo 10 a 14 tokens por segundo debido a la necesidad de cuantizar el modelo a 2 bits para ajustarlo a la memoria disponible. Esta cuantización comprometía la calidad del modelo y su velocidad.
La Solución Nvidia DGX Spark
La implementación de dos máquinas Nvidia DGX Spark resolvió estos problemas. Estas máquinas permiten combinar la memoria, eliminando la necesidad de cuantización a 2 bits y permitiendo la ejecución del modelo en formato FP8 (punto flotante de 8 bits). Además, cada máquina solo necesita leer la mitad de los parámetros en cada token, lo que acelera significativamente el proceso.
Resultados Impresionantes
La configuración de dos DGX Spark ofrece un rendimiento de 36 a 41 tokens por segundo en el modelo estándar, y hasta 76 tokens por segundo con la decodificación especulativa. Esto representa una mejora de aproximadamente tres veces con respecto a la configuración de una sola máquina PGX. El proceso de procesamiento de prompts, que antes era notablemente lento, ahora es prácticamente imperceptible.
Arquitectura y Funcionamiento
Cada DGX Spark está equipado con un SoC Nvidia GB10, una GPU Blackwell y 128 GB de memoria unificada. La comunicación entre las dos máquinas se realiza a través de ConnectX-7, que permite una velocidad de hasta 200 Gbps. El modelo se divide entre los dos nodos utilizando paralelismo de tensores, lo que permite que cada Spark procese la mitad de los parámetros.
La Opinión de ExploxTV
La Opinión de ExploxTV
La capacidad de ejecutar modelos de lenguaje de gran tamaño localmente, con un rendimiento comparable al de la nube, abre nuevas posibilidades para la investigación, el desarrollo y la implementación de aplicaciones de IA. Si bien la inversión inicial en hardware es considerable, el control total sobre los datos y la latencia reducida son ventajas significativas para casos de uso específicos. La iniciativa de Nvidia demuestra el potencial de la computación distribuida para superar las limitaciones de hardware individuales.
Más información sobre las Nvidia DGX Spark aquí.