Un framework de FinOps para agentes de IA
El costo de un agente de IA no se parece al costo del software tradicional: no es una licencia fija por usuario, es una función de cuántas llamadas a herramientas, cuántos tokens de contexto y cuántos reintentos consume una tarea específica. La encuesta State of AI Agents, de LangChain, muestra que esto ya duele: el 22,4% de las pequeñas empresas cita el costo como barrera de adopción - un número que probablemente crezca a medida que los agentes asuman tareas más largas y complejas.
El precio por uso ya es el modelo estándar, no la excepción
AWS Bedrock AgentCore cobra Web Search a $7 por cada 1.000 consultas - sin compromiso inicial, precio directo por unidad de uso. Eso no es una elección aislada de AWS: es el estándar que cualquier FinOps de agentes necesita asumir como punto de partida. A diferencia de una licencia de software con costo predecible mes a mes, el costo de un agente varía con el volumen real de trabajo que ejecuta - lo que hace que la medición granular, no la estimación agregada, sea la única forma de prever el gasto con confianza.
Por qué "costo por respuesta" no es la métrica correcta
Medir solo el costo de la respuesta final esconde a dónde va realmente el dinero: cuántas llamadas a herramientas exigió una tarea, cuántos tokens de contexto se procesaron en cada etapa, y cuántas veces el agente tuvo que reintentar antes de tener éxito. Una tarea que "costó poco" en la respuesta final pero exigió 5 reintentos y 10 llamadas a herramientas tiene un costo real mucho mayor de lo que aparenta.
Las diez métricas del framework
- Costo por ejecución - el total gastado del inicio al fin de una tarea, no solo la última llamada
- Costo por tool call - cada herramienta invocada tiene su propio costo, algunas mucho mayores que otras (la búsqueda externa, por ejemplo, cobra por consulta)
- Costo por PR - para coding agents, el costo real de cada pull request generado, incluyendo las iteraciones de corrección
- Costo por requisito - desde el requisito inicial hasta la entrega, cubriendo todos los intentos
- Costo por bug corregido - comparable al costo de que un humano corrija el mismo bug, para justificar la inversión
- Tokens por etapa - dónde se está gastando el contexto dentro del propio flujo, no solo el total
- Reintentos por tarea - cada intento nuevo es costo adicional; reintentos altos indican un problema de diseño, no solo mala suerte
- Latencia por flujo - el tiempo también es costo, especialmente cuando bloquea a un humano esperando
- Costo por contexto - el precio de mantener (o no) una ventana de contexto grande y costosa por llamada
- Costo evitado por automatización - la métrica que justifica todo: cuánto costaría la misma tarea sin el agente
Qué significa esto para quien aprueba el presupuesto
Sin estas diez métricas, aprobar presupuesto para agentes de IA se vuelve una decisión de fe, no de datos. Con ellas, es posible responder preguntas concretas: ¿este agente se está volviendo más caro por tarea con el tiempo (señal de degradación o de tareas más complejas)? ¿Los reintentos están subiendo (señal de que el diseño del agente, no el volumen de uso, es el problema)? ¿El costo evitado por automatización todavía supera el gasto real, o el ahorro esperado ya no se sostiene?
Fuentes
- AWS - Announcing Web Search on Amazon Bedrock AgentCore - https://aws.amazon.com/blogs/aws/announcing-web-search-on-amazon-bedrock-agentcore-ground-your-ai-agents-in-current-accurate-web-knowledge/
- LangChain - State of AI Agents - https://www.langchain.com/stateofaiagents