Libro de IA para niños Libro de IA para adolescentes Libro de IA para familias Nueva colección ¿Ya conoce nuestra colección de libros? IA para niños, adolescentes y adultos Descubrir los libros

RTX 3090 para LLM Local: Modelos 32B por Menos de 1.500 €

local-llm gpu-hardware nvidia

Montar un servidor de IA local serio no exige una inversión de nivel empresarial. En la comunidad de IA local, la NVIDIA RTX 3090 de segunda mano con 24 GB de VRAM es, en 2026, la tarjeta gráfica con mejor relación calidad-precio para pymes que quieren ejecutar modelos de 32 mil millones de parámetros, como Qwen3:32B o Gemma4:26B, sin depender de APIs en la nube.

Una guía de hardware difundida esta semana en X situaba la RTX 3090 como primera recomendación para un servidor de IA local económico, con un coste total de sistema estimado entre 1.000 y 1.500 dólares (aproximadamente 1.300-1.750 € en el mercado europeo). La GPU de segunda mano representa el grueso del coste: según datos de la comunidad, ronda los 700-900 € actualmente en plataformas de reacondicionados y marketplaces especializados.

Este artículo explica por qué 24 GB de VRAM es el umbral que realmente importa, qué modelos caben en una sola tarjeta, qué rendimiento se puede esperar y cómo se compara el coste frente al uso de APIs de pago.

Por Qué 24 GB de VRAM Es el Umbral Clave

Los modelos de lenguaje funcionan a máxima velocidad cuando todos los pesos del modelo caben en la VRAM de la GPU. Si la VRAM es insuficiente, el motor de inferencia vuelca parte del modelo en la RAM del sistema, y el rendimiento cae entre 5 y 15 veces.

Las GPU de consumo en 2026 abren estas clases de modelos (cuantización Q4):

  • 8 GB (RTX 4060): modelos de 7B, 12B parámetros
  • 16 GB (RTX 3080 Ti, RTX 4070): modelos de 13B, 20B
  • 24 GB (RTX 3090, RTX 4090): modelos de 27B, 34B
  • 48 GB (RTX 6000 Ada, dual 3090): modelos de 70B

El salto de 16 a 24 GB es el más rentable: abre los modelos de 27B, 32B, que ofrecen una diferencia de calidad perceptible en razonamiento complejo, seguimiento de instrucciones y tareas multilingües respecto a los modelos de 13B, sin necesidad de hardware profesional de 3.000 € o más.

Qué Modelos Caben en una RTX 3090

Según mediciones reportadas por la comunidad en 2026:

Modelo VRAM en Q4 Características
Qwen3:32B ~20 GB Razonamiento fuerte, multilingüe ES/DE/EN
Qwen3.6-27B ~17 GB Vision-Language: entiende imágenes también
Gemma4:26B ~18 GB Licencia Apache 2.0, libre para uso comercial
Gemma4:12B ~8 GB Multimodal (texto + imágenes), contexto 256K
Llama3.3:70B ~43 GB No cabe en una tarjeta de 24 GB

Qwen3.6-27B es el modelo más comentado para uso empresarial: es el primer modelo denso de código abierto con soporte nativo de visión que funciona cómodamente en hardware de consumo, lo que permite procesar tanto texto como capturas de documentos en la misma llamada de inferencia.

Rendimiento: Qué Esperar en la Práctica

Según mediciones reportadas por la comunidad para Qwen3.6-27B Q4\K\M en una RTX 3090 (fuentes: runaihome.com, explore.n1n.ai):

  • 35-40 tok/s con Ollama (configuración estándar, sin optimización)
  • 78-85 tok/s con vLLM y decodificación especulativa usando Qwen3-0.6B como modelo auxiliar

Para los flujos de trabajo habituales en pymes, la velocidad base de Ollama suele ser suficiente: redactar un correo de 300 palabras o resumir un documento de dos páginas tarda entre 8 y 12 segundos a 35 tok/s. La configuración con vLLM es recomendable cuando tres o más personas del equipo acceden simultáneamente al modelo.

Configuración Completa Recomendada para 2026

Según las guías de la comunidad, un servidor de IA local basado en la RTX 3090 queda así:

GPU: NVIDIA RTX 3090 (segunda mano), aprox. 700-900 € 24 GB GDDR6X, 936 GB/s de ancho de banda de memoria. Disponible en Wallapop, eBay y tiendas de reacondicionados especializadas. Verificar el historial de uso y el estado del sistema de refrigeración.

CPU + Placa base, aprox. 350-550 € Cualquier procesador de escritorio moderno con PCIe 4.0 × 16 funciona: AMD Ryzen 7 7700X o Intel Core i7-13xxx. La inferencia LLM está limitada por la GPU; la CPU no es el cuello de botella.

RAM: 64 GB DDR5, aprox. 150-200 € La carga del modelo utiliza temporalmente RAM del sistema. 32 GB es técnicamente suficiente para modelos Q4 de 27B; 64 GB da margen para cargas de trabajo paralelas.

Almacenamiento: 2 TB NVMe SSD, aprox. 100 € Un archivo GGUF de 32B ocupa 20-22 GB. Con 2 TB se pueden tener 5-10 modelos disponibles sin gestión constante de espacio.

Sistema operativo: Ubuntu 24.04 LTS, gratuito NVIDIA CUDA, Ollama y vLLM tienen mejor soporte y documentación en Linux.

Coste total: aprox. 1.300-1.750 €, pago único. Sin cuotas mensuales, sin claves de API, sin datos saliendo de la empresa.

Software: Ollama para Empezar, vLLM para Producción

Arrancar con Ollama (menos de un minuto hasta el modelo en funcionamiento):

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:32b

Ollama detecta automáticamente la GPU NVIDIA y expone una API REST compatible con OpenAI en localhost:11434. Es compatible con Open WebUI, extensiones de VS Code y la mayoría de herramientas internas. Ideal para desarrollo individual y pruebas iniciales.

Escalar con vLLM (para acceso simultáneo del equipo):

Cuando tres o más usuarios acceden al modelo al mismo tiempo, el batching continuo y la PagedAttention de vLLM mantienen el rendimiento bajo carga. Consulta nuestra guía de servidores de IA local para una configuración paso a paso.

RGPD y Privacidad: La Ventaja Estructural

Cada consulta enviada a una API en la nube sale de tu organización. Aunque los proveedores firmen contratos de encargado del tratamiento, enviar documentos de clientes, datos de empleados o información estratégica a servidores de terceros no es una opción aceptable en muchos sectores.

Un LLM ejecutado localmente elimina el problema a nivel arquitectónico:

  • Sin transferencia a terceros países (art. 44 y ss. del RGPD): los datos no salen del territorio de la UE.
  • Sin necesidad de contrato de encargado de tratamiento con un proveedor cloud.
  • Control total sobre la versión del modelo, los registros de prompts y los datos de respuesta.

Esto es especialmente relevante para despachos de abogados, clínicas, asesorías fiscales y cualquier empresa con obligaciones bajo el art. 32 del RGPD o normativas sectoriales específicas.

Para una visión más profunda del marco regulatorio, consulta soberanía de datos con IA local.

Economía: Cloud API vs. Hardware Propio

Un equipo de cinco personas con un uso intensivo de una API de tipo GPT-4, pongamos 50-100 consultas diarias con 2.000 tokens cada una, puede esperar un gasto de 200-400 € al mes a precios actuales de lista. En tres años, hasta 14.000 €.

Una estación de trabajo con RTX 3090 cuesta aproximadamente 1.500 € de una sola vez, más unos 3-5 € mensuales en electricidad durante el uso. Según nuestra interpretación de los patrones de uso habituales en pymes, el retorno de la inversión suele producirse entre los seis y los catorce meses. Los resultados reales dependen de la intensidad de uso y el tipo de carga de trabajo.

Subvención Kit Digital

Las pymes españolas que quieran financiar parcialmente esta inversión pueden explorar la categoría de Inteligencia Artificial del programa Kit Digital, que en su convocatoria actual contempla soluciones de IA para automatización de procesos. Según nuestra interpretación de las bases vigentes, la implantación de un servidor de IA local puede encajar en esta categoría si se documenta el impacto en la digitalización de procesos. Te recomendamos verificar la elegibilidad con un agente digitalizador acreditado.

Más información en nuestra guía: Kit Digital e IA local para pymes.

Cuándo la RTX 3090 No Es Suficiente

  • Modelos de 70B sin compromiso de calidad: Se necesitan dos RTX 3090 en NVLink o una GPU profesional de 48 GB (NVIDIA RTX 6000 Ada, ~3.500-4.000 €).
  • Muchos usuarios simultáneos (más de 20): Conviene un servidor GPU dedicado o una solución distribuida.
  • Sin conocimientos internos de Linux: La configuración de CUDA y el mantenimiento continuo requieren experiencia técnica. Sin ella, el coste real del servidor incluye tiempo de IT externo.

Si quieres evaluar qué configuración de IA local encaja con tu empresa, selección de hardware, análisis de cumplimiento RGPD y casos de uso concretos, , cuéntanos tu situación.

Solicitar un proyecto piloto