Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

Dos DGX Spark como clúster LLM local: la guía completa

ia-local nvidia dgx-spark vllm hardware

Una caja de sobremesa que ejecuta un modelo de 400.000 millones de parámetros íntegramente en su propia red, sin ninguna API en la nube de por medio, era hasta hace poco una fantasía de sala de servidores. A finales de junio de 2026, un profesional de la comunidad de IA local compartió en X una receta completa para lograr exactamente eso: convertir dos NVIDIA DGX Spark en un clúster LLM local de escala frontera que cabe bajo una mesa.

Hemos tomado esa receta, contrastado cada paso con los playbooks oficiales de DGX Spark de NVIDIA y la hemos convertido en la guía de instalación siguiente. Para las pymes europeas que evalúan la IA local, este es el camino más compacto hacia una inferencia de modelos realmente grandes que nunca sale del edificio.

¿Qué es el DGX Spark y por qué dos?

El NVIDIA DGX Spark es una máquina de IA de sobremesa basada en el superchip GB10 Grace Blackwell. Las cifras clave:

Spec Un DGX Spark Clúster de dos
Memoria unificada 128 GB LPDDR5x 256 GB
CPU 20 núcleos Arm (10x Cortex-X925 + 10x Cortex-A725) 40 núcleos en total
Rendimiento IA hasta 1 PFLOP FP4 (con sparsity) hasta 2 PFLOP FP4
Almacenamiento hasta 4 TB NVMe hasta 8 TB
Red ConnectX-7, 2x 200GbE (QSFP) enlace directo 200GbE
Modelo práctico máx. clase ~70B clase ~405B

Un solo equipo ya es una máquina de inferencia local capaz. La razón para emparejar dos es la memoria: 256 GB de memoria unificada agrupada son el umbral a partir del cual los modelos open-weight realmente grandes, cercanos a la frontera, se vuelven utilizables en hardware que consume menos que un PC gaming. Las dos NIC ConnectX-7 hacen trivial el emparejamiento, sin switch.

Lista de materiales

  • 2x NVIDIA DGX Spark (128 GB cada uno)
  • 1x cable DAC pasivo QSFP56 de 200G, referencia NVIDIA Q56-200G-CU0-5 o un equivalente validado para DGX Spark
  • (opcional, para 4 a 8 equipos más adelante) un switch MikroTik CRS504 de 200GbE

Eso es toda la lista de compra para un clúster de dos.

Paso 1: conexión física

Conecte un extremo del cable QSFP a un puerto ConnectX-7 del primer equipo y el otro extremo al mismo puerto del segundo equipo (ambos puertos izquierdos, o ambos derechos, vistos desde atrás). Un cable da el ancho de banda completo. Un segundo cable solo sirve si asigna IP a las cuatro interfaces.

Paso 2: identificar la interfaz

En cada equipo, localice la interfaz ConnectX-7 activa:

ibdev2netdev

En el DGX Spark las dos interfaces de alta velocidad aparecen como enp1s0f0np0 y enp1s0f1np1. Anote cuál muestra el estado Up en su puerto cableado; la referenciará en los pasos de red y NCCL.

Paso 3: configuración de red (netplan)

Hay dos opciones. Link-local es la más rápida con un solo cable; las IP estáticas son necesarias si cablea las cuatro interfaces para el máximo ancho de banda.

Opción A, link-local automático. Cree /etc/netplan/40-cx7.yaml en ambos equipos:

network:
  version: 2
  renderer: networkd
  ethernets:
    enp1s0f0np0:
      dhcp4: no
      link-local: [ ipv4 ]
    enp1s0f1np1:
      dhcp4: no
      link-local: [ ipv4 ]

Esto asigna automáticamente direcciones IPv4 link-local en el rango 169.254.x.x.

Opción B, IP estáticas manuales. En el nodo 1, /etc/netplan/40-cx7.yaml:

network:
  version: 2
  renderer: networkd
  ethernets:
    enp1s0f0np0:
      dhcp4: no
      addresses: [192.168.100.10/24]

En el nodo 2, el mismo archivo con 192.168.100.11/24. Aplique en ambos:

sudo netplan apply

Confirme el enlace con un ping por la nueva interfaz antes de seguir.

Paso 4: SSH sin contraseña

La inferencia distribuida necesita SSH por clave entre los equipos. Use el mismo nombre de usuario en ambos. Genere una clave dedicada y cópiela al otro nodo:

ssh-keygen -t ed25519 -f ~/.ssh/id_ed25519_shared -N ""
ssh-copy-id -i ~/.ssh/id_ed25519_shared.pub <user>@192.168.100.11

El script discover-sparks.sh de NVIDIA lo automatiza: localiza otros Spark en el enlace con avahi-browse -r -t ssh.tcp, distribuye la clave compartida y escribe las entradas de ~/.ssh/config. Verifique que ssh 192.168.100.11 conecta sin pedir contraseña.

Paso 5: verificar NCCL sobre el enlace

Antes de arrancar un modelo real, confirme que NCCL mueve datos por el enlace de 200GbE. Defina las variables de interfaz (ponga su interfaz Up) y ejecute un benchmark all-gather de la suite nccl-tests:

export NCCL_SOCKET_IFNAME=enp1s0f1np1
export UCX_NET_DEVICES=enp1s0f1np1
export OMPI_MCA_btl_tcp_if_include=enp1s0f1np1

mpirun -np 2 -H 192.168.100.10,192.168.100.11 \
  all_gather_perf -b 8 -e 256M -f 2 -g 1

Una ejecución sana muestra un ancho de banda de bus que sube hacia la tasa del enlace a medida que crece el tamaño del mensaje. Si el ancho de banda es bajo, casi con seguridad ha puesto un NCCLSOCKETIFNAME incorrecto.

Paso 6: inferencia distribuida con vLLM y Ray

El stack de servicio habitual es vLLM con backend Ray. Arranque Ray en el nodo head y luego una el worker:

# En el nodo 1 (head):
ray start --head --port=6379

# En el nodo 2 (worker):
ray start --address=192.168.100.10:6379

Después lance vLLM en el nodo head con paralelismo de tensores sobre ambos equipos:

vllm serve Qwen/Qwen3.6-35B-A3B \
  --host 0.0.0.0 \
  --port 8000 \
  --tensor-parallel-size 2 \
  --distributed-executor-backend ray \
  --max-model-len 8192 \
  --reasoning-parser qwen3 \
  --gpu-memory-utilization 0.7

Para un modelo más grande que necesite los 256 GB completos, suba --max-model-len y --gpu-memory-utilization (0,85 es un techo habitual). La guía de origen usa además --max-num-seqs 4 para limitar la concurrencia en modelos exigentes en memoria. El endpoint compatible con OpenAI queda activo en el puerto 8000.

Modelos recomendados

Las siguientes opciones proceden de la guía original de la comunidad en X y son datos de la comunidad. Tome las cifras de rendimiento como orientativas; varían según la cuantización y la longitud del prompt.

Un solo DGX Spark (128 GB):

  • Qwen 3.6 35B (NVFP4), hasta 256K de contexto, unos 110 tokens/seg.
  • DeepSeek V4 Flash (REAP)
  • Nemotron Super (optimizado por NVIDIA)

Clúster de dos (256 GB):

  • DeepSeek V4 Flash, hasta 1M de contexto, unos 40 a 45 tokens/seg. en una sesión
  • Step-3.7-Flash con soporte de entrada de imagen

Escalar más allá de dos equipos

El enfoque de un solo cable y sin switch es específico del caso de dos equipos. Para cuatro a ocho equipos, un switch MikroTik CRS504 de 200GbE es la opción documentada, con una penalización mínima de ancho de banda. NVIDIA publica playbooks específicos para topologías de tres Spark y multi-Spark con switch (enlazados abajo).

Por qué importa para las pymes de la UE

Un clúster DGX Spark local elimina toda una categoría de riesgo de cumplimiento. La inferencia ocurre en su hardware, así que:

  • Sin obligaciones de transferencia a terceros países del art. 44 del RGPD, ningún dato sale del edificio
  • Trazabilidad completa para las obligaciones del implementador en el EU AI Act (art. 26), cada consulta se puede registrar y conservar internamente
  • Sin entrenamiento del proveedor con sus entradas, sin retención en la nube fuera de su control

Según nuestra lectura del EU AI Act, el despliegue on-premise de modelos de propósito general reduce de forma apreciable la carga documental frente a las integraciones con API en la nube. Esto no es asesoramiento legal; verifique su clasificación concreta según el Anexo III.

Freshlab actúa aquí como socio, no como proveedor, con más de 25 años de raíces en la fabricación farmacéutica por contrato y en proyectos ERP, y raíces germanoparlantes en Baviera. Sabemos qué exige a la IA local un entorno regulado y con mucha documentación.

Conclusión

Dos DGX Spark, un cable QSFP y los seis pasos anteriores le dan un clúster de inferencia local de 256 GB capaz de servir modelos open-weight de escala frontera, sin que nada salga de su red. Para una pyme europea regulada, esa combinación de capacidad y soberanía del dato es difícil de igualar con cualquier oferta en la nube.

Iniciar un proyecto piloto →, Freshlab instala y configura infraestructura de IA local, incluido el clúster DGX Spark y el despliegue de modelos, para pymes de la UE.

Fuentes

Los nombres exactos de las interfaces, los rangos de IP y la disponibilidad de modelos pueden variar según la versión de firmware. Para la instalación, siga los playbooks oficiales de NVIDIA enlazados como referencia vinculante y use esta guía como mapa de orientación.

Preguntas frecuentes

¿Cuántos DGX Spark necesito para ejecutar un modelo de gran escala en local?

Dos. Un solo DGX Spark tiene 128 GB de memoria unificada y cubre bien modelos medianos. Dos equipos, conectados por sus puertos ConnectX-7 de 200GbE, suman 256 GB. Suficiente para modelos de hasta unos 405.000 millones de parámetros, según la cuantización.

¿Necesito un switch para conectar dos DGX Spark?

No. Para un clúster de dos equipos basta con un único cable QSFP56 de 200G directamente entre los dos puertos ConnectX-7, y entrega el ancho de banda completo. Un switch (por ejemplo un MikroTik CRS504) solo hace falta al escalar a cuatro o más equipos.

¿Qué stack de inferencia funciona sobre ambos equipos?

Lo habitual es vLLM con backend Ray. NCCL gestiona las operaciones colectivas aceleradas por GPU sobre el enlace de 200GbE, y vLLM se arranca con tensor-parallel-size 2 y el ejecutor distribuido de Ray.

¿Un clúster DGX Spark local cumple el RGPD y el EU AI Act?

La inferencia local mantiene todos los datos en su propio hardware, así que no hay transferencia a terceros países según el art. 44 del RGPD y hay trazabilidad completa para las obligaciones del implementador en el EU AI Act. Por eso muchas pymes europeas eligen on-premise frente a las API en la nube. No es asesoramiento legal; verifique su clasificación concreta.

¿Freshlab puede montárnoslo?

Sí. Freshlab instala y configura infraestructura de IA local para pymes de la UE, incluido el clúster DGX Spark, el despliegue de modelos y la integración con sus sistemas. Un proyecto piloto cubre el alcance inicial sin coste.