IA local en la empresa: qué puedes montar y cuándo compensa

Estacion de trabajo con GPU en una oficina luminosa junto a servidores propios, con un tecnico revisando el uso de un modelo de IA en el portatil
Escrito por
Shakers Seguir

Shakers es infraestructura de talento potenciada por IA. Ayudamos a las empresas a cerrar el implementation gap: el hueco entre probar IA y ponerla en produccion con equipos que saben ejecutarla.

• ...

Un modelo de 125.000 millones de parámetros, de arquitectura mixture-of-experts donde cada token solo activa una fracción de la red, corriendo a unas 100 tokens por segundo combinando una RTX 4090 con la memoria del sistema. Es lo que demuestra el hilo que encabezó Hacker News el 3 de octubre de 2026 con 742 votos y 333 comentarios, sobre el repositorio público Strata. La inferencia local de calidad dejó de ser un hobby de entusiastas: para una pyme ya es una opción de arquitectura que se evalúa con números.

Directo al grano: la IA local es la que se ejecuta sobre tu propio hardware, servidores o estaciones de trabajo con GPU, en lugar de consumir un modelo por API de un proveedor. El modelo se descarga, la inferencia ocurre dentro de tu red y los datos no salen de ella. Este es el mapa del tema: qué es la IA local y qué la separa de una API, qué se puede ejecutar hoy en hardware convencional, cuándo compensa y cuándo no, cuánto cuesta de verdad, qué stack se usa y qué equipo la mantiene en producción.

TL;DR. La IA local ejecuta los modelos en tu propia infraestructura, con los datos dentro de tu red. Con técnicas de cuantización y la dispersión de los modelos mixture-of-experts, un modelo frontier como Qwen 3.8 Flash Next corre a unas 100 tokens por segundo combinando una GPU doméstica con la memoria del sistema (Hacker News, 3 de octubre de 2026). Compensa cuando mandan la privacidad, el coste predecible o la independencia del proveedor. No compensa cuando se necesita el máximo razonamiento frontier o un escalado elástico con picos.

Qué es la IA local y qué la separa de una API

Con una API, el modelo vive en el proveedor: tú envías el prompt, pagas por token y aceptas que el dato viaje y se procese fuera de tu red. Con IA local, el modelo se ejecuta en tu infraestructura y la frontera de seguridad es tu propia red. La diferencia va más allá de la privacidad. Es de control: versiones del modelo que no cambian sin avisar, cuotas que no dependen de un plan comercial y costes que no crecen con cada usuario nuevo.

A cambio, la operación es tuya: actualizaciones, seguridad del servidor, capacidad y soporte dejan de ser un servicio y pasan a ser una responsabilidad. La decisión real no es local frente a nube en abstracto: es qué parte de la carga quiere tu organización tener encima.

¿Qué se puede ejecutar hoy en hardware convencional?

Mucho más de lo que el mercado da por supuesto. La clave es la cuantización: convertir los pesos del modelo a menor precisión, 4 bits en la práctica, reduce la memoria necesaria a una fracción con una pérdida de calidad pequeña en tareas habituales. Con esa técnica, el mercado de los modelos abiertos cabe en tres tramos de hardware.

Hardware Qué corre con soltura Para qué sirve
Portátil o equipo de oficina Modelos de 7 a 8 mil millones de parámetros Borradores, clasificación, extracción de datos, asistentes personales
Estación de trabajo con GPU de gama alta Modelos de 27 a 70 mil millones cuantizados; los grandes mixture-of-experts, que solo activan una fracción de la red Chat interno con documentos propios, resumen, RAG sobre tu conocimiento
Servidor con varias GPU Modelos de 100 mil millones o más, varios usuarios en paralelo Servicio de inferencia para toda la organización

El tramo medio es el que cambió este mes. El motor detrás del hilo de Hacker News, Strata, aprovecha la dispersión de los mixture-of-experts: el modelo reparte sus 125.000 millones de parámetros en 24.576 expertos y cada token activa unos diez, de modo que la GPU guarda los expertos más usados y la memoria del sistema el resto. Los requisitos que publica el repositorio: una GPU de 12 GB o más, entre 32 y 64 GB de RAM y cuantización a 2-4 bits. Con esa combinación documenta unas 100 tokens por segundo y estima esa velocidad para una GPU de 24 GB. Los modelos densos pequeños van más rápido aún: la comunidad de modelos locales documenta un 27.000 millones a 65 tokens por segundo en la misma tarjeta (octubre de 2026). La frontera de lo que cabe en hardware convencional se movió en semanas, no en años.

¿Cuándo compensa una IA local y cuándo no?

Es la pregunta que de verdad importa, y la respuesta no es ideológica: depende de cuatro variables que cada empresa pesa distinto. Datos sensibles, volumen de uso, perfil de la carga y equipo disponible.

Criterio Local API en la nube
Datos que no pueden salir de la red (RGPD, Reglamento europeo de IA) Gana: la inferencia ocurre dentro El dato viaja al proveedor
Coste a volumen alto y estable Predecible: hardware + energía Crecen con cada token y usuario
Latencia y operación sin conexión Baja y controlada Depende de terceros
Razonamiento frontier máximo Los modelos abiertos van detrás Gana: modelos punteros
Picos de demanda imprevistos Capacidad fija, se dimensiona al máximo Elástico por diseño
Equipo de mantenimiento Necesario: infraestructura No se necesita

El patrón que se ve en empresas pequeñas y medianas: lo local para las tareas repetitivas de volumen estable sobre datos internos, clasificación, resumen de documentos, extracción, y la API para lo que exige el modelo más capaz del momento. No es un bando contra otro. Es un reparto por tipo de carga.

¿Cuánto cuesta: hardware, energía y la memoria que se encarece?

El coste de entrada es hardware. Una estación de trabajo con una GPU de gama alta sostiene el tramo medio de la tabla anterior; un servidor con varias GPU sostiene el servicio de toda la organización. El coste recurrente es energía y mantenimiento. El coste que se olvida es el coste total de propiedad a tres años: montar esto hoy cuesta más que hace un año, y seguirá subiendo.

El motivo es la memoria. La demanda de los centros de datos de IA mantiene la presión sobre la cadena: según el análisis de mercado de TrendForce publicado el 30 de septiembre de 2026, las subidas de precio de la memoria de contrato continúan en el cuarto trimestre, con la DRAM convencional entre el 10 y el 15 por ciento trimestral, y la casa revisa al alza 2027, con el precio medio del HBM previsto un 121 por ciento por encima en términos interanuales. Esa presión encarece a la vez los servidores de inferencia que alquilas en la nube y el hardware que compras para tu local.

¿Qué stack se usa hoy?

El ecosistema maduró rápido y las piezas están estandarizadas. Estas son las que se ven en las implantaciones reales.

Pieza Qué es Encaja para
Ollama Servidor de modelos local con API compatible, un comando por modelo Primer despliegue y uso por equipo
LM Studio Aplicación de escritorio para descargar y probar modelos Evaluación y uso individual
vLLM Servidor de inferencia de alto rendimiento Producción con varios usuarios
GGUF y cuantización 4 bits Formato y técnica que reducen la memoria del modelo Ajustar modelos a hardware convencional
RAG local Búsqueda sobre tus documentos que alimenta al modelo Respuestas con conocimiento interno, sin enviar datos fuera

Un matiz que evita errores caros: el modelo no sabe nada de tu empresa. Lo que lo vuelve útil es el RAG: tus documentos, indexados dentro de tu red, como contexto. Sin esa capa, un LLM local es un chatbot genérico en tu servidor; con ella, un asistente que responde con tu conocimiento. Cómo se monta esa capa: la preparación de datos que necesitan los agentes de IA.

¿Qué equipo necesita una empresa para mantenerla?

El perfil no es un data scientist. Es infraestructura: quien sabe mantener servicios, GPU, redes y seguridad, con criterio de ML suficiente para elegir modelo y cuantización. Es más cercano a un perfil de plataforma que a uno de investigación.

El mercado español lo confirma de forma indirecta. En el censo de ofertas técnicas activas en España del análisis de mercado de Shakers (búsqueda on premise con recuento literal en título, skills y descripción, corte del 5 de octubre de 2026), 41 ofertas mencionan el término, casi todas de infraestructura, cloud o consultoría. La IA local todavía no es un mercado de empleo propio: se contrata dentro de los perfiles de plataforma que ya existen. La consecuencia práctica: la habilidad rara no es el modelo, es la operación.

¿Es más segura la IA local que usar ChatGPT en la empresa?

En la dimensión de fuga de datos, sí por diseño: el contenido no sale de la red y no queda en los servidores de un tercero. En seguridad de sistema, la responsabilidad cambia de mano: parcheo del servidor, control de accesos, auditoría del modelo. La local elimina un riesgo y añade otros que hay que gestionar; no es segura por defecto, es segura si se opera bien.

Preguntas frecuentes sobre la IA local

¿Qué es la IA local?

Es el despliegue de modelos de inteligencia artificial en hardware propio. Al prescindir de una API externa, la organización asume el control total sobre la privacidad del dato, los costes fijos de inferencia y la gestión de la infraestructura, de modo que la información sensible no abandona la red corporativa.

¿Qué hardware necesito para ejecutar un LLM en local?

Depende del tamaño del modelo. Los de 7 a 8 mil millones de parámetros corren en un equipo de oficina; los de 27 a 70 mil millones cuantizados en 4 bits, en una estación con GPU de gama alta; los grandes mixture-of-experts combinan GPU de 12 GB o más con 32 a 64 GB de RAM; los densos de 100 mil millones o más, un servidor con varias GPU. La cuantización es la técnica que hace viable el tramo medio.

¿Ollama o LM Studio?

Cumplen funciones distintas. LM Studio es una aplicación de escritorio pensada para descargar, probar y comparar modelos de forma individual. Ollama es un servidor con API compatible que se integra en flujos y aplicaciones de un equipo. Para evaluar, LM Studio. Para desplegar un servicio interno, Ollama o vLLM.

¿Puede una IA local sustituir a ChatGPT en una empresa?

En tareas de volumen estable sobre datos internos, sí, con modelos actuales cuantizados. En las que exigen el máximo razonamiento frontier o picos de demanda elásticos, no, y ahí la API sigue siendo la opción racional. La implantación realista combina las dos según el tipo de carga.

¿Cuánto cuesta montar una IA local?

Tres partidas: hardware de entrada, energía y mantenimiento recurrentes, y el coste del equipo que la opera. El hardware encarece: TrendForce mantiene las subidas de la memoria de contrato en el cuarto trimestre de 2026 y revisa al alza el precio del HBM para 2027. El coste se compensa con volumen alto y estable de uso.

¿Compensa una IA local para una pyme?

Si maneja documentos sensibles con tareas repetitivas y volumen estable, el tramo medio de hardware cubre hoy la mayoría de esos casos con calidad suficiente. Si su uso es esporádico o exige el modelo más capaz del mercado, la API sale más barata y mejor. La decisión se toma por tipo de carga, no por moda.

La IA local pasó a ser una decisión de arquitectura que se toma con datos. El hardware se abarata en cómputo y se encarece en memoria, y el reparto entre local y API se decide carga a carga. El cuello de botella no es el modelo: es el equipo de plataforma que la sostiene.

Si el siguiente paso es evaluar qué carga conviene llevar a local y qué equipo la sostendría, el mapa de los agentes de IA en la empresa y el de cómo se construyen los agentes con LangGraph cubren la pieza de aplicación que suele venir después.

Recursos relacionados