No hace mucho tiempo, muchas empresas comenzaron a implementar activamente agentes de IA en una amplia variedad de flujos de trabajo. En muy poco tiempo, el coste de utilizarlos se convirtió en una preocupación urgente para las empresas. Además, no es un problema que afecte únicamente al departamento financiero: junto con las preocupaciones presupuestarias también han surgido problemas de fiabilidad, estabilidad operativa e incluso seguridad de la información. Esto se debe a que el coste de automatizar un mismo proceso varía significativamente de un despliegue a otro, es impredecible y podría estar sujeto a influencias externas.
Además, para un actor malicioso que ataca a una organización, cualquier proceso automatizado mediante IA y vulnerable a la influencia externa es, en esencia, un objetivo conveniente para un “nuevo tipo de ataque DDoS”. Los informes de errores de aplicaciones, las revisiones de productos o las solicitudes de servicio de soporte técnico pueden (al igual que cualquier otro dato externo que una empresa procesa a través de IA) servir como herramienta en un ataque destinado a aumentar el consumo de tokens (fragmentos de palabras que sirven como la unidad básica de entrada y salida de un LLM).
Un año de crecimiento explosivo en las facturas
En 2026, las grandes empresas gastaron de manera significativa en los presupuestos de sus sistemas de IA por primera vez. Uber había gastado todo su presupuesto anual en abril, mientras que una empresa no identificada no estableció límites de gasto para Claude y gastó 500 millones de USD en un solo mes. Aunque los proveedores de IA anuncian regularmente precios más bajos y modelos más eficientes, el cambio de los chatbots a sistemas agentes que operan de forma continua y autónoma aumenta el consumo de tokens en cientos o miles de veces. Al mismo tiempo, el modelo de “suscripción fija por 20 USD o 100 USD” para las empresas se está volviendo cosa del pasado; todos los proveedores principales están haciendo la transición de sus clientes empresariales a la facturación de pago por uso.
Como consecuencia, las empresas se enfrentan a un problema demasiado familiar para las industrias del alojamiento en la nube y de las comunicaciones móviles. Sin sistemas especializados de contabilidad y administración de costes, una organización solo descubre cuánto costará un proceso o proyecto concreto una vez que lo ha completado. En los sectores de las telecomunicaciones y la nube, este problema finalmente se resolvió mediante el desarrollo de sofisticados sistemas de facturación, y sus clientes incluso han adoptado el término especializado FinOps. En el caso de la IA, este proceso todavía está en sus primeras etapas. Además, la naturaleza probabilística de la IA generativa complicará la solución del problema.
Consumo impredecible de tokens
Para comprender por qué los costes aumentan tan rápido y son tan difíciles de predecir y controlar, debemos recordar cómo funciona un modelo de lenguaje y qué lo convierte en un agente de IA. El modelo no tiene estado; es decir, no conserva ninguna información entre interacciones. Cada vez que el agente da el siguiente paso, debe volver a enviar al modelo todo el historial de trabajo de una tarea específica (el contexto): el mensaje inicial, el razonamiento previo, el contenido de los archivos que ha leído y las respuestas de todas las herramientas. Con cada paso, este “resumen” se hace más extenso, especialmente si la tarea implica bucles iterativos. Si un paso falla, la respuesta no es clara o una herramienta devuelve un error, el agente sencillamente vuelve a intentarlo, lo que aumenta aún más el tamaño del contexto. Y si la tarea no la realiza un único agente, sino varios que se reparten el trabajo e intercambian resultados, este volumen se multiplica por el número de agentes. Como consecuencia, el consumo de tokens no aumenta de forma gradual, sino a intervalos, y es prácticamente imposible predecirlo al inicio de la tarea.
Al ejecutar dos sesiones diferentes de interacción con un agente de IA para resolver exactamente la misma tarea (dos tickets de servicio de soporte técnico, dos tareas de análisis, etc.), el número de tokens utilizados puede variar y llegar a multiplicarse por 30. Esto depende de cuántos pasos, errores y reintentos se requieran para resolver la tarea. El aumento del consumo de recursos no depende necesariamente de la complejidad de la tarea. Hay casos bien conocidos en los que la IA se atascó en un “bucle de pensamiento” y desperdició una cantidad absurda de recursos en tareas triviales.
Tres generaciones de IA en sistemas empresariales consumen recursos de formas completamente diferentes:
- Aprendizaje automático clásico (ML). Esto generalmente funciona con datos bien estructurados y no es demasiado intensivo en términos de computación. El consumo de recursos es predecible y bajo. Este es un artículo de presupuesto fijo.
- Un chatbot u otro asistente de IA basado en LLM. Consume tokens, pero el ritmo lo marca un humano: un empleado inicia manualmente una tarea, luego evalúa el resultado y hace una pausa. El coste aumenta aproximadamente en proporción al número de usuarios activos y se puede estimar aproximadamente en función del número de licencias.
- Un agente de IA autónomo. Una persona establece una meta y se aleja, y el sistema decide por sí solo qué hacer y cuántos pasos se necesitan. El medidor sigue funcionando hasta que se considera que la tarea está completa y no hay un límite de coste predecible.
Tokenómics en ataques: denegación de cartera como nuevo ataque DDoS
Dado que las llamadas a los LLM son significativamente más costosas que las llamadas habituales de un software estándar, automatizar tareas rutinarias de una empresa implica un coste inusualmente elevado. Por ejemplo, Gartner estima que resolver una única solicitud de soporte al cliente utilizando un LLM cuesta aproximadamente 3 $. Es fácil imaginar cómo los atacantes podrían bombardear una empresa con miles de solicitudes extensas y sofisticadas generadas por un LLM de bajo coste, lo que provocaría un daño financiero considerable. Dado que el proceso está automatizado, es posible que las anomalías no se detecten de inmediato.
Si un atacante sabe qué sistema de agentes y qué LLM se utilizan en un proceso empresarial, puede llevar a cabo un ataque más preciso y causar un daño significativamente mayor. Los autores del estudio GitInject estimaron que un atacante que pueda crear incidencias en GitHub dentro de una organización que utilice agentes de IA para analizar errores puede causar hasta 111 $ de daños con un solo ataque (antes de que entren en acción los mecanismos de defensa de GitHub) y consumir 400 minutos de GitHub Actions de la cuenta de la víctima. Naturalmente, un ataque de este tipo se puede repetir varias veces, sin ningún coste para el atacante.
El mayor riesgo, aunque difícil de cuantificar en términos monetarios, proviene de los ataques que provocan que los LLM tengan un razonamiento excesivo. En el artículo OverThink, los autores demostraron cómo una tarea redactada de manera inofensiva, cuando se introduce en un modelo de lenguaje, finalmente produce un resultado correcto pero, en el proceso, consume 46 veces más tokens de lo que debería. Además, todas las tareas que probaron los investigadores superaron correctamente los filtros de seguridad existentes.
En la nueva versión de la guía Principales riesgos de los modelos de lenguaje de OWASP, este problema ha alcanzado una prioridad récord: el consumo de tokens ilimitado ahora se designa como LLM06:2026, y entre sus variaciones, el ataque de “denegación de cartera”, que agota el presupuesto de la víctima para LLM, se destaca explícitamente.
¿Cómo evitar convertirse en víctima del “nuevo ataque DDoS”?
En primer lugar, debes abandonar el principio de “usar la IA por el simple hecho de usarla”. No tiene sentido encomendar todas las tareas a agentes autónomos. Es aconsejable realizar periódicamente un análisis de coste-beneficio del uso de la IA.
Además, debes limitar los permisos y el conjunto de herramientas disponibles para un agente de IA autónomo. Cuantas menos acciones tenga el sistema a su alcance, con mayor eficacia realizará una tarea concreta, menos oportunidades tendrá de aumentar los costes y menos probable será que alguien logre “manipularlo” para que consuma tokens de manera innecesaria.
También recomendamos establecer límites estrictos en el consumo de tokens y configurar un sistema de notificación para alertar a los humanos cuando se exceden estos límites. Conviene establecer varios límites de forma simultánea: un límite por tarea, un límite diario, etc. Las alertas sobre superaciones de límites deben enviarse inmediatamente al especialista responsable del sistema para que pueda tomar una decisión informada, ya sea para continuar o detener el proceso.
Verifica estrictamente los datos externos que no sean de confianza. Cualquier información procesada por IA que provenga de fuentes externas, ya sean solicitudes, consultas, mensajes o comentarios, o varios campos técnicos capaces de contener texto arbitrario (registros DNS, encabezados HTTP, nombres de archivo), no solo puede conducir a una inyección rápida, sino también aumentar deliberadamente la carga de trabajo. Sería conveniente limitar su tamaño y supervisar la carga que generan.
Calcula el coste unitario del trabajo y compara las facturas del proveedor con tus propios datos. El coste por análisis, por solicitud o por cheque es la única forma de comprender lo que estás pagando y de detectar errores en las facturas.
Kaspersky Managed Detection and Responce
IA