Lo Último en Tecnología

Nvidia presenta las DGX Spark: Triplica el rendimiento de modelos de lenguaje locales

Nvidia presenta las DGX Spark: Triplica el rendimiento de modelos de lenguaje locales

Fuente: ExploxTV

Adam Conway, Lead Technical Editor de XDA Developers, ha logrado ejecutar un modelo de lenguaje de 284 mil millones de parámetros en dos máquinas Nvidia DGX Spark, alcanzando un rendimiento comparable al de la infraestructura en la nube de DeepSeek. Este logro representa un avance significativo en la capacidad de ejecutar modelos de lenguaje grandes de forma local.

El Desafío del Rendimiento Local

Anteriormente, Conway experimentó con el modelo DeepSeek V4 Flash en una sola Lenovo ThinkStation PGX. Aunque funcional, el rendimiento era limitado, alcanzando solo 10 a 14 tokens por segundo debido a la necesidad de cuantizar el modelo a 2 bits para ajustarlo a la memoria disponible. Esta cuantización comprometía la calidad del modelo y su velocidad.

La Solución Nvidia DGX Spark

La implementación de dos máquinas Nvidia DGX Spark resolvió estos problemas. Estas máquinas permiten combinar la memoria, eliminando la necesidad de cuantización a 2 bits y permitiendo la ejecución del modelo en formato FP8 (punto flotante de 8 bits). Además, cada máquina solo necesita leer la mitad de los parámetros en cada token, lo que acelera significativamente el proceso.

Resultados Impresionantes

La configuración de dos DGX Spark ofrece un rendimiento de 36 a 41 tokens por segundo en el modelo estándar, y hasta 76 tokens por segundo con la decodificación especulativa. Esto representa una mejora de aproximadamente tres veces con respecto a la configuración de una sola máquina PGX. El proceso de procesamiento de prompts, que antes era notablemente lento, ahora es prácticamente imperceptible.

Arquitectura y Funcionamiento

Cada DGX Spark está equipado con un SoC Nvidia GB10, una GPU Blackwell y 128 GB de memoria unificada. La comunicación entre las dos máquinas se realiza a través de ConnectX-7, que permite una velocidad de hasta 200 Gbps. El modelo se divide entre los dos nodos utilizando paralelismo de tensores, lo que permite que cada Spark procese la mitad de los parámetros.

La Opinión de ExploxTV

La Opinión de ExploxTV

La capacidad de ejecutar modelos de lenguaje de gran tamaño localmente, con un rendimiento comparable al de la nube, abre nuevas posibilidades para la investigación, el desarrollo y la implementación de aplicaciones de IA. Si bien la inversión inicial en hardware es considerable, el control total sobre los datos y la latencia reducida son ventajas significativas para casos de uso específicos. La iniciativa de Nvidia demuestra el potencial de la computación distribuida para superar las limitaciones de hardware individuales.

Más información sobre las Nvidia DGX Spark aquí.