El coste de un LLM es invisible en el piloto y se nota de golpe en producción. La razón es simple: cien llamadas en el piloto, cien mil en producción.
01. De dónde viene el coste
Se paga por token enviado y recibido. Instrucciones largas, documentos largos y respuestas largas van directos a la factura. Dos diseños que hacen lo mismo pueden diferir cinco veces.
02. Acortar la instrucción
Las instrucciones fijas que se envían en cada llamada engordan con el tiempo. Revisarlas con regularidad y quitar frases innecesarias es ahorro directo cuando hay volumen.
03. Caché
Si se repiten preguntas iguales o parecidas, guarde la respuesta. La caché de instrucción que ofrecen los proveedores para la parte fija también reduce el coste de la entrada repetida.
04. Prefiltrado
Poner un filtro por reglas antes del modelo reduce drásticamente cuántos registros se procesan. En flujos de clasificación documental suele ser el paso de mayor retorno.
05. Limitar la salida
Limite la longitud de la respuesta y pida salida estructurada. El texto libre es caro y difícil de analizar en el paso siguiente.
06. Medir y alertar
Calcule el coste por unidad de trabajo: por documento, por solicitud. Seguir el coste unitario en lugar del total mensual permite distinguir un aumento del simple crecimiento de volumen. Ponga una alerta en el umbral de presupuesto.