IA sin pagar por token: por qué en un agente el contador pesa tanto
Con un chat, pagar por uso apenas se nota: preguntas, respondes, cierras. Con un agente la cuenta cambia de escala, porque una sola tarea son muchas llamadas encadenadas. El modelo decide un paso, ve el resultado, corrige y sigue, y cada llamada consume. Esa es la razón por la que en trabajo agéntico el coste por token deja de ser menor.

Por qué un agente consume distinto
El bucle es el motivo. Un encargo de seis pasos no es una llamada, son al menos seis, y cada una arrastra el contexto de lo que ya pasó: los resultados de las herramientas, los fragmentos de documentos que ha leído, el registro de lo hecho. El consumo no crece con lo que tú escribes, crece con lo que la tarea tarda en resolverse.
La consecuencia es de comportamiento, no de factura: con un contador delante, la gente automatiza menos. No lanza la comprobación diaria, no deja el informe programado cada lunes, no le pide que revise las cien facturas «por si acaso». La cifra de la factura importa menos que las automatizaciones que nunca llegaron a existir.
Qué se paga exactamente en cada modo
El software de Mycel: nada, y sin límite de tareas ni de usuarios. Eso no tiene asterisco: el cómputo lo pone tu equipo, así que no hay contador que nadie tenga que llevar.
El cómputo sí se paga, y de una de estas tres formas. Con hardware propio: una máquina capaz de mover un modelo de 30B, del orden de 24 GB entre GPU y RAM, que se paga una vez y después no tiene coste por tarea. Con tu clave de API: pagas al proveedor su tarifa por uso, y los prompts van de tu Nodo directamente a él sin pasar por nosotros. Con un Nodo Cloud: pagas el alquiler de esa máquina con GPU. No damos precios de GPU ni tarifas de tokens porque cambian cada trimestre y una cifra vieja hace un presupuesto peor que ninguna.
A partir de cuándo compensa la máquina
La cuenta que sirve no es «cuánto cuesta la GPU», sino cuántas tareas al mes vas a lanzar y cuánto te costarían pagadas por uso. Si son cuatro informes, la clave de API es más barata y más rápida de arrancar. Si es un flujo continuo, con vigilancia de carpetas, comprobaciones diarias y lotes de documentos, el hardware se amortiza y a partir de ahí el coste marginal es cero.
La forma sensata de decidirlo es no decidirlo el primer día. Empiezas con la clave de API en el portátil que ya tienes, mides lo que consumes durante un mes real y solo entonces comparas. Cambiar de modelo es cambiar una opción en el Panel, no migrar de producto: los ficheros ya estaban en tu disco y las herramientas siempre corrieron en tu máquina.
Cómo funciona, paso a paso
- Empiezas con clave de API en el equipo que ya tienes, sin comprar nada.
- Automatizas de verdad durante un mes, sin racionar, y miras el consumo real.
- Comparas ese gasto con una máquina capaz de mover un modelo de 30B.
- Si compensa, instalas Ollama y cambias el modelo desde el Panel. Nada más se mueve.
Qué necesitas
- Para coste por token cero: Ollama con un modelo de 30B (~24 GB entre GPU y RAM).
- Como alternativa, tu clave de API (pagas la tarifa del proveedor) o un Nodo Cloud alquilado.
- Un mes de uso real antes de decidir. Sin ese dato, cualquier comparación es un adorno.
Qué te llevas
- La plataforma completa sin coste, sin límite de tareas ni de usuarios.
- En modo local, coste marginal cero: puedes lanzar mil tareas sin mirar un contador.
- Los mismos entregables y la misma traza en los tres modos.
Más preguntas
¿Entonces la IA local es gratis?
El software sí; el hardware no. Hace falta una máquina que mueva un modelo de 30B, del orden de 24 GB entre GPU y RAM, más espacio en disco para los modelos de visión y embeddings. Se paga una vez, y a partir de ahí las tareas no cuestan.
¿Cuánto gasta un agente en API comparado con un chat?
Bastante más, y no por el tamaño de tu pregunta sino por el número de pasos: cada uno es una llamada que arrastra el contexto acumulado. Cuánto exactamente depende del proveedor, del modelo y de tus tareas, así que la única cifra fiable es la que midas tú un mes.
¿Puedo mezclar los dos modos?
Sí. El Panel lista los modelos que cada Nodo ve y eliges con cuál trabajar. Nada impide un Nodo local para el trabajo repetitivo y otro con API para las tareas largas y enrevesadas donde un modelo de frontera se nota.
Pruébalo con tus propios documentos
Creas la cuenta, abres el Nodo y le encargas la primera tarea. Es gratis e ilimitado: el cómputo lo pone tu equipo, así que no hay nada que racionar.