Artículo
Limitaciones de los modelos de IA locales: por qué cambié de Ollama a Claude
He estado escribiendo sobre IA desde principios de 2023. Durante ese tiempo, he visto cómo ha cambiado mi forma de programar, de pensar sobre el contenido y de imaginar el futuro del trabajo.
Esta es una historia sobre ir un nivel más allá: pasar de usar la IA como herramienta a intentar construir algo autónomo sobre ella. No funcionó como esperaba.
POR QUÉ INTENTÉ EJECUTAR IA DE FORMA LOCAL
Antes de tener experiencia real con ello, la IA local me parecía el movimiento más interesante que podía hacer. No solo por la flexibilidad o la seguridad, aunque ambas importaban, sino porque me parecía la forma más honesta de acercarse a esta tecnología.
En medio de todo lo que está ocurriendo en torno a la IA, ejecutar realmente un modelo en local, configurarlo, conectarlo a datos y ver en qué punto falla me parecía algo fundamentalmente distinto de usar una interfaz cloud ya pulida. Me parecía la diferencia entre usar una herramienta y entender de verdad cómo funciona esa herramienta.
Al mismo tiempo, no lo estaba planteando como un experimento puramente técnico. Desde el principio tenía en mente un caso de uso claro.
La primera área en la que quise aplicar esto fue el SEO. El SEO es una disciplina documentada y relativamente exacta. Tiene estructura, reglas, patrones y resultados medibles. En teoría, eso lo convierte en algo ideal para automatizar. Un agente puede escanear cientos de subpáginas en minutos, identificar problemas estructurales, detectar elementos que faltan y, si además tiene acceso a datos sobre tendencias de búsqueda, puede generar recomendaciones de contenido realmente útiles.
No es una idea abstracta. Es un flujo de trabajo real con un valor de negocio claro.
La visión más amplia era más ambiciosa. Quería construir un agente que recuperara datos a partir de automatizaciones configuradas, propusiera pasos en función de lo que encontrara, enviara esas propuestas a algún lugar para revisión y, mediante ese bucle de feedback, mejorara gradualmente. En cierto punto, una vez que los pasos que propusiera coincidieran de forma consistente con lo que yo considero buenas decisiones, empezaría a ejecutar esas acciones de manera autónoma.
No solo asistir. Actuar.
Ese era el objetivo.
MAC MINI, OLLAMA, N8N
La configuración en sí fue sencilla. Utilicé un Mac Mini, ejecuté un modelo local a través de Ollama y gestioné la orquestación básica mediante n8n.
Poner Ollama en marcha fue sorprendentemente simple. Mucho más de lo que esperaba. En poco tiempo tenía un modelo funcionando, respondiendo y comportándose como un chatbot. Desde una perspectiva puramente técnica, la barrera de entrada era baja.
En unas pocas horas ya tenía montado un pipeline básico. El modelo era capaz de recuperar datos, realizar un análisis básico de marketing y yo ya veía con claridad el camino para automatizar alertas hacia Slack a partir de ese output. En esa fase, todo parecía prometedor. El sistema funcionaba, y funcionaba localmente.
Lo que todavía no comprendía del todo era lo rápido que iba a encontrar sus límites.
Entonces lo probé con datos de muestra representativos, diseñados para simular condiciones reales.
LA VENTANA DE CONTEXTO
Aquí es donde se hizo evidente la limitación real.
El modelo podía manejar unas pocas páginas de texto. Podía procesar una tabla pequeña o un conjunto de datos de unos pocos kilobytes. Dentro de ese rango, se comportaba de una manera que parecía funcional.
Pero en el momento en que le di datos SEO representativos, el tipo de volumen que realmente necesitas analizar si quieres obtener resultados con sentido, el sistema dejó de responder bien.
Procesaba lo que cabía dentro de su ventana de contexto e ignoraba el resto. Generaba un output que, en la superficie, parecía estructurado, pero al mirarlo de cerca, tenía muy poco valor. Captaba algún número perdido dentro de los datos y simplemente lo repetía. No combinaba señales. No priorizaba correctamente. No entendía las relaciones dentro del conjunto de datos.
Y la razón era simple. No podía ver suficiente cantidad de información.
Lo noté inmediatamente durante el primer análisis real. La calidad del output era aproximadamente comparable a la que los modelos cloud producían en 2023. No lo digo como una crítica al modelo en sí. Es un reflejo de las limitaciones.
El problema no era la configuración. No eran los prompts. No era una falta de esfuerzo.
El hardware determinaba qué modelo podía ejecutar. Y el modelo que podía ejecutar, sencillamente, no era capaz de mantener dentro del contexto la cantidad de información que requería esa tarea.
QUÉ SIGNIFICA REALMENTE “AUTÓNOMO”
En ese punto, quedó claro qué requiere realmente en la práctica algo “autónomo” y en qué parte el sistema se quedaba corto.
Un agente autónomo no es simplemente un bucle que llama repetidamente a un modelo. Requiere la capacidad de razonar sobre una gran cantidad de contexto, mantener coherencia a lo largo de múltiples pasos y producir outputs lo suficientemente precisos como para actuar sobre ellos sin supervisión constante.
Eso significa que necesita mantener no solo la entrada actual, sino el estado acumulado de todo el flujo de trabajo. Qué datos se recuperaron, qué acciones se propusieron, qué decisiones se tomaron, qué falló, qué funcionó y cuál es el objetivo general.
Aquí es donde la limitación se vuelve estructural.
Un modelo con una ventana de contexto limitada no puede mantener ese estado. No puede conectar decisiones a lo largo del tiempo. No puede evaluar sus propios outputs de una manera realmente significativa porque le falta visibilidad sobre el proceso completo.
La visión del sistema no era el problema.
Lo era la infraestructura que había debajo.
PASAR A CLAUDE CODE
En ese momento pasé a una solución basada en cloud y empecé a trabajar con Claude Code de Anthropic.
Únete a la Biblioteca
Acceso completo a mis hallazgos, historias personales y lo que me cuentan las personas con las que me encuentro.
Únete a la Biblioteca · €29,99 al año Fable 5 vs Opus 4.8: hice la misma auditoría… Una IA local y gratis reconoció lo que veía… ¿Bot o humano? Lo que… Dependientes de la IA: ¿seguimos… ¿Qué trabajo no reemplazará la IA? Por ahora… La teoría del internet muerto se vuelve realidad. ¿Volveremos…Reciba el artículo completo por correo electrónico y no dude en responder si desea seguir comentándolo.
Resumen
Preguntas frecuentes sobre el tema del artículo
¿Cuál es la diferencia entre ejecutar IA localmente y usar IA en la nube?
¿Qué es una ventana de contexto y por qué importa?
¿Qué es Ollama y qué tan fácil es configurarlo?
¿Pueden los modelos de IA locales manejar análisis de datos empresariales reales?
¿Qué es un agente de IA autónomo?
¿Deberían los desarrolladores comenzar con IA local o IA en la nube?
Artículos relacionados
La IA crea el gráfico, el newsletter y la página de producto más rápido que una persona. A quien antes lo hacía le queda una sola cosa: el criterio, saber si el resultado es bueno. Pero la mayoría tiene peor criterio que la IA. Y quien no sabe juzgar la calidad tampoco sabe delegar. ¿Cómo saber si el tuyo es el criterio en el que una empresa se apoya, o el que puede reemplazar?
En abril, en la primera parte de esta serie, escribí sobre un sistema predictivo de IA que empecé a desarrollar en mi propio ordenador. Entonces el software tenía unas pocas horas y el registro de predicciones estaba vacío. Desde entonces, los registros del sistema mostraron una cosa: el sistema todavía no entiende el mercado que se le pide predecir. Sabe encontrar el contexto macro, el valor contable de las empresas, las ganancias. Pero no sabe juntar esas cosas en algo que le ayude a entender el precio.
Estoy construyendo un sistema de IA para predecir el S&P 500. Corre en mi propia máquina, usa datos públicos gratuitos (yfinance, FRED, el dataset de Shiller) y evalúa cada pronóstico contra la realidad. Esta serie documenta la construcción en sí: las decisiones, la metodología, los errores. Lo que finalmente comparta del sistema en funcionamiento es una pregunta separada, y honesta.
Más artículos
La misma tarea, dos modelos. Fable 5 contra Opus 4.8. Sobre el papel Fable es el mejor modelo, con más contexto y mejores especificaciones. Y aun así perdió. Opus resolvió la tarea con una sola ronda de control por 721.000 tokens, mientras que Fable necesitó nueve rondas y quemó 2,78 millones de tokens. La diferencia no estaba en el modelo, sino en cómo planteé la tarea. Y lo sé porque lo medí.

Hace un tiempo escribí sobre cómo construí mi propio sistema de analítica respetuoso con la privacidad. Tenía detección de bots desde la primera versión, pero no bastó. Las visitas directas tenían un peso extrañamente alto. Cuando alguien afirma que el 20 % de sus visitas son bots y el 80 % personas, yo también lo pensaba antes. Hoy diría que la proporción inversa está más cerca de la verdad. Así llegué a esta conclusión.

Tengo a Heidegger y mi cuaderno al lado. Me pregunto hacia dónde se dirige todo esto, hacia dónde nos lleva la inteligencia artificial.
Setenta por ciento. Ahí empieza el primer resultado de la IA, incluso cuando le das todo el contexto de la empresa y los mejores ejemplos del pasado. Hablamos del tipo de resultado que no se puede definir de forma programática. Es más complejo. A menudo se trata de trabajo creativo. Con un tipo de resultado repetido llegué al ochenta por ciento en una semana. Cada punto porcentual adicional es más difícil que el anterior.
Durante mucho tiempo tratamos internet como el camino principal. El lugar donde ocurren el trabajo y las relaciones. Pero la mayoría de lo que vemos en él hoy ya es, o pronto será, generado por IA: texto, imágenes, perfiles y comentarios. Internet se está convirtiendo en un juego online lleno de bots, donde no puedes estar seguro de que al otro lado haya una persona. Así que me pregunto: ¿fue el mundo online el camino principal, o solo un desvío temporal del que parte de la gente regresará, de vuelta al offline?
Hace unos días entrevisté a un sénior del marketing. Un hombre con experiencia, años de práctica. Le pregunté por la IA. Me dijo que apenas la usa. Tuvo una mala experiencia con un resultado y decidió que era demasiado sénior para que le aportara algo cuando no es perfecta. Conozco también la otra cara: profesionales que automatizan todo lo que se puede automatizar.
Europa no tiene capacidad para hacer frente a una guerra de drones masiva y a gran escala como la que vemos en Ucrania. La debilitan tres dependencias: China suministra el material físico de los sistemas de defensa, Estados Unidos aporta las capacidades que Europa no tiene, y veintisiete Estados no logran ponerse de acuerdo sobre con qué rapidez, ni quién paga. Existen planes de rearme, pero se ejecutan con lentitud.

Cuatro días en Cataluña. Sin ordenador, sin IA, casi sin redes sociales. Me compré este cuaderno para anotar lo que pensaría y lo que encontraría y aprendería durante el viaje.

