Self-hosted o API: el coste real de generar imágenes para adultos
La discusión sobre desarrollar o contratar generación de imágenes suele empezar con un precio de GPU por hora y terminar ahí. Esa cifra es real y también es la línea más pequeña del presupuesto. Todo lo caro de un pipeline self-hosted es justo lo que no aparece en una factura de alquiler.
Qué implica realmente el self-hosting
Un pipeline en funcionamiento es un grafo de modelos, nodos personalizados y pesos, y cada uno de ellos es una versión que puede moverse bajo tus pies. Se actualiza un pack de nodos y un parámetro cambia de significado. Se sustituye un modelo base y tus presets cuidadosamente ajustados cambian de carácter. Nada de esto es exótico; es el día a día. El coste de ingeniería no es construir el pipeline una vez, es mantener estable la salida mientras el ecosistema de debajo se mueve.
Luego está la capacidad. La generación es irregular por naturaleza: las tardes y los fines de semana se disparan, las mañanas entre semana están muertas. Dimensionar para el pico significa pagar silicio ocioso casi toda la semana. Dimensionar para la media significa que tus usuarios hacen cola justo cuando más les importa. Autoescalar GPUs es posible, pero un worker en frío tiene que cargar decenas de gigabytes de pesos antes de poder servir nada, así que escalar se mide en minutos, no en segundos.
Los costes que nunca llegan a la hoja de cálculo
- Guardias. Una máquina con GPU que muere a las 03:00 de un sábado es la noche de alguien, y la generación de imágenes es una carga de noches y fines de semana por naturaleza.
- Almacenamiento y retención. Entradas y salidas se acumulan en disco y se convierten en silencio en un riesgo que nadie está borrando.
- Deriva de modelos. Hacer pruebas de regresión de los presets tras una actualización es trabajo real que hay que repetir en cada actualización.
- Ingeniería de colas. Backpressure, reintentos, deduplicación y recuperación tras una caída son los mismos problemas alquiles o no la GPU.
- Seguridad. Un host con GPU y un puerto de inferencia abierto es un objetivo atractivo, y el software implicado no está escrito pensando en una exposición hostil a internet.
Dónde gana de verdad el self-hosting
No es un argumento unilateral. Monta tu propio pipeline cuando el pipeline es el producto: cuando entrenas o afinas tus propios modelos, cuando el grafo exacto es tu diferenciador o cuando la regulación te obliga a mantener el procesamiento dentro de una infraestructura que controlas. Un volumen alto, estable y predecible también cambia las cuentas: una GPU saturada funcionando las 24 horas sale más barata por imagen que un precio por llamada.
El patrón del que hay que desconfiar es el intermedio: volumen moderado, demanda irregular, equipo pequeño y un pipeline que es un medio y no un fin. Esa combinación paga todo el coste operativo del self-hosting sin capturar casi ninguno de sus beneficios.
Dónde gana una API
Una API convierte un problema de capacidad en una partida de gasto. No hay silicio ocioso, ni ingeniería de arranque en frío, ni fin de semana de actualización, ni turno de guardia por hardware. Tu integración se reduce a cuatro llamadas HTTP y la cuestión del volumen pasa a ser el problema operativo de otro.
También comprime el time to market de semanas a una tarde. Para una función que todavía estás validando, eso importa más que la economía unitaria: lanzar en un día y aprender que los usuarios no la quieren es un desenlace mucho más barato que descubrir lo mismo después de aprovisionar una flota de GPUs.
Una decisión que se toma en cinco minutos
- ¿El pipeline en sí es tu producto? Si es que sí, constrúyelo.
- ¿Tu volumen es lo bastante alto, estable y predecible como para mantener una GPU realmente saturada? Si es que sí, construir empieza a compensar.
- ¿Tienes a alguien que asuma las guardias de GPU, y lo sabe? Si no, contrata.
- ¿Todavía estás validando la función? Contrata ahora y revísalo cuando la curva de demanda sea real.
El híbrido que nadie menciona
No son opciones excluyentes. Un montaje habitual y sensato es una API para el tráfico público impredecible, con hardware propio absorbiendo una base estable interna. Además elimina el precipicio de la migración: mantener la integración detrás de una única frontera HTTP hace que pasar de una opción a otra más adelante sea un cambio de configuración, no una reescritura.
Preguntas frecuentes
¿Una API siempre sale más cara por imagen?
Por imagen, normalmente sí. Por mes, muchas veces no, porque una GPU self-hosted se paga también cuando está ociosa y una API no. Compara el coste total incluyendo capacidad ociosa y tiempo de ingeniería, no solo la cifra por imagen.
¿Puedo empezar con una API y pasar luego a self-hosting?
Sí, y es el orden de menor riesgo. Mantén la integración detrás de una única interfaz en tu código y el cambio será de configuración.
¿Cuál es el mayor coste oculto del self-hosting?
Mantener la salida estable a medida que se actualizan los modelos y los packs de nodos. Es un trabajo continuo que no termina cuando el pipeline arranca.
Desarrolla sobre uncloth.app
Un solo endpoint REST, once presets y los resultados devueltos a tu backend. Cuéntanos qué estás construyendo y te enviamos los datos de acceso.
Solicitar acceso