La IA Generativa lleva con nosotros varios años ya. GPT-3 data del año 2020, nada menos, al tiempo que otras compañías, además de OpenAI, han desarrollado sus propios modelos de IA Generativa, tanto en Estados Unidos como en Europa y China, siendo estas tres las geografías más relevantes dentro del panorama de la IA.
A modo de resumen, decir que la IA Generativa se sustenta sobre los LLMs o Large Language Models, que son colecciones de miles de millones de parámetros calculados en la fase de entrenamiento de los modelos, en la que se procesan cantidades ingentes de texto (los modelos de imagen y vídeo funcionan de un modo similar en tanto en cuanto se entrenan a partir de colecciones de imágenes) a través de redes neuronales que calculan los parámetros de dichos modelos, de modo que, posteriormente, a través de prompts de texto introducidos por los usuarios en los chatbots o generados automáticamente por los propios chatbots o agentes de IA, es posible generar inferencias.

Es una descripción muy simple sobre el funcionamiento de los LLMs y los chatbots, por supuesto. Los modelos de IA Generativa, por ejemplo, pueden precisar de acceso a Internet para disponer de información actualizada para generar inferencias que tengan que ver con temáticas de actualidad, para lo cual emplean tecnologías como RAG, que permiten recuperar información relevante y añadirla al contexto del prompt para generar las inferencias correspondientes, sin ir más lejos.
Estamos acostumbrados a acceder a estos modelos de IA a través de las interfaces y herramientas de las propias compañías que los desarrollan, ya sean OpenAI, Anthropic, xAI, Google, Meta o Mistral, así como modelos chinos tales como DeepSeek, Kimi o Qwen (de Alibaba), aunque en el caso de modelos comerciales, especialmente los estadounidenses, la cantidad y calidad de las inferencias está limitada por el número de tokens asignados al tipo de suscripción que tengamos contratada. En las modalidades gratuitas, el uso está seriamente limitado, aunque las cuentas de pago tampoco son la panacea últimamente.

Las factorías de tokens de NVIDIA no son tan viables como podría parecer
Las empresas que basan su negocio en la IA Generativa en la nube tienen que ofrecer a los usuarios una potencia de cálculo extraordinaria para hacer frente a los proyectos de IA Generativa que abordan, especialmente en áreas como la programación o la IA agéntica. La IA agéntica, en especial, consume una cantidad de tokens muy alta, lo cual eleva el gasto en IA de forma exponencial frente a usos tradicionales de inferencias “simples”.
Estos tokens se procesan en los centros de datos dedicados a IA. Y el coste del cálculo de estos tokens sigue siendo muy superior a lo que se obtiene a través de las suscripciones o a través de las APIs. Por no hablar de tácticas más o menos discutibles por parte de las empresas de IA, como el uso de modelos inferiores para generar inferencias o los cambios en las políticas de precios o en la cantidad de tokens que entra dentro de los modelos de suscripción.

NVIDIA sigue obteniendo beneficios a partir de la venta de sus chips y sus racks para IA Generativa, tal y como se ha visto en la reciente presentación de resultados para el Q2 de su año fiscal 2027 (sí, los años fiscales no necesariamente están alineados con los años naturales), concretamente, unos 82.600 millones de euros, que equivalen aproximadamente a un 5% del PIB de España.
Las cifras que mueve la IA Generativa en Estados Unidos son espectaculares, aunque con dudas sobre la sostenibilidad financiera de parte de estas inversiones que solo tiene sentido mientras las empresas que proveen de la IA propiamente dicha no tengan que rendir cuentas. Según las estimaciones publicadas sobre sus cuentas, OpenAI habría registrado fuertes pérdidas durante 2026. Anthropic, a pesar de que ha publicado beneficios, no está claro que haya sido totalmente transparente con sus cuentas, estando bajo la sospecha de que ha omitido determinados gastos a la hora de compartir sus cifras. Google es un caso especial, al tener otras fuentes de ingresos además de su IA, por lo que no está claro su nivel de pérdidas, aunque los datos de Alphabet hablan de ingresos de 119.800 millones de dólares para el Q2 de 2026 y de gastos de unos 200.000 millones de dólares.
Los modelos abiertos y la IA en el edge: tokens a coste cero y sin comprometer la privacidad. “Solo” inviertes en el hardware
El problema —uno de ellos— de la IA Generativa en la nube radica en esta variabilidad de los precios y las condiciones de uso. El caso de OpenClaw, el asistente de IA personal basado en agentes que se instalaba en ordenadores localmente (sobre todo los Mac Mini de Apple), es reciente. Muchos entusiastas compraron uno o varios Mac Mini para instalar OpenClaw y usarlo mediante sus APIs asociadas a suscripciones ilimitadas a ChatGPT o Claude.
Rápidamente, tanto OpenAI como Anthropic cambiaron las condiciones de uso de sus suscripciones, de modo que el acceso a través de API quedaba sujeto al pago por uso dependiendo de los tokens empleados. OpenClaw, como cualquier IA agéntica, consume cantidades ingentes de tokens, por lo que el uso de OpenClaw ha caído hasta que ha dejado de ser un treding topic. Otro tanto sucedió con la programación, haciendo que el uso de los modelos de IA para programar también se tarificase a partir de los tokens empleados, lo cual hizo que algunas empresas llegaran a consumir en pocos meses una parte muy elevada de su presupuesto anual destinado a IA.

Los modelos abiertos, sin embargo, pueden descargarse libremente y usarse sin necesidad de estar sujetos a modalidades de suscripción. Si tenemos un ordenador con un rendimiento suficiente, es posible usar modelos de IA generativa de forma local sin necesidad de “salir” a la nube.
Hay modelos abiertos con mayor o menor número de parámetros. Cuantos más parámetros tenga el modelo, más capacidad de cálculo y memoria necesitaremos para ejecutarlo. Y la buena noticia es queestos modelos empiezan a acercarse a las capacidades de algunos modelos cloud de hace solo unos meses.
Entre otros modelos, encontramos estos como óptimos para ejecutar en ordenadores personales, incluyendo portátiles delgados y ligeros, dependiendo de cuántos parámetros tengan los modelos que vayamos a ejecutar localmente.
- Llama (Meta): una de las familias más populares y estables. Versiones como Llama 3 o superiores ofrecen un rendimiento excelente en tareas generales y razonamiento, con tamaños adaptados tanto para servidores como para equipos domésticos.
- Qwen (Alibaba): Destaca especialmente en programación y comprensión multilingüe. Modelos como Qwen Coder manejan contextos amplios y múltiples lenguajes de programación con gran precisión.
- DeepSeek (Coder / R1): sobresalen por su increíble capacidad de razonamiento lógico y código eficiente a un coste computacional reducido.
- Mistral / Mixtral: Modelos europeos muy eficientes que utilizan arquitecturas de mezcla de expertos (MoE), ofreciendo respuestas rápidas y de alta calidad sin consumir tanta memoria de vídeo (VRAM).
- Gemma (Google): Modelos ligeros de gran rendimiento ideales para ordenadores con recursos limitados gracias a licencias flexibles.

Lo que se procesa en el edge se queda en el edge
En el siguiente apartado, hablaremos tanto de qué hardware es más adecuado para ejecutar IA localmente (en el edge, según la nomenclatura). Quédate con la idea, además de que no hay que pagar licencias por el uso de servicios de suscripción o por el uso de tokens a través de APIs, de que los datos se quedan en nuestro equipo o nuestra red local.
Los datos que usemos en nuestras inferencias se quedan en nuestro equipo sin que tengan acceso a la nube. Podemos usar estos modelos en el edge incluso sin conexión a Internet. La clave está en ver qué rendimiento (generalmente medido en tokens por segundo) obtenemos a partir de nuestro hardware concreto y de los modelos que usemos para generar inferencias.
Además, ya hay modelos open source que pueden procesar imágenes y vídeos tanto en la ingesta como en la generación, lo cual amplía el abanico de usos que podemos dar a estos modelos.