¿Qué hace esta skill?

La Optimización de Costes para LLM Skill proporciona una arquitectura componible para controlar y reducir el gasto en APIs de LLM sin sacrificar la calidad de las respuestas. Combina enrutamiento inteligente de modelos según la complejidad de la tarea, un rastreador de costes inmutable, reintentos selectivos ante errores transitorios y caché de prompts para minimizar latencia y coste por token en iteraciones repetidas.

Enrutamiento dinámico
Selecciona automáticamente el modelo más económico para tareas simples y el más potente para tareas complejas según umbrales de longitud y número de elementos.
Control de presupuesto
Mantén el gasto en API dentro de un límite estricto con un rastreador inmutable que registra cada llamada y detiene el procesamiento si se excede el presupuesto.
Reintentos selectivos
Reintenta solo errores transitorios como límites de tasa o caídas de conexión, con backoff exponencial. Falla inmediatamente ante errores de autenticación o solicitudes incorrectas.
Caché de prompts
Marca los prompts del sistema largos con cache_control para evitar reenviarlos en cada petición, reduciendo latencia y coste por token en iteraciones repetidas.

Ejemplos de uso

🔀 Enrutamiento por complejidad
Tengo 50 textos cortos para clasificar y 3 documentos largos de 15.000 palabras para resumir. Usa el enrutamiento dinámico para asignar el modelo adecuado a cada tarea.
📊 Control de presupuesto
Procesa este lote de 200 elementos con un presupuesto máximo de 5€. Detén el procesamiento si se supera el límite y dame el CostTracker con el gasto acumulado.
🔄 Reintentos con backoff
Ejecuta esta llamada a la API de Claude con reintentos selectivos. Si hay un error de rate limit, reintenta hasta 3 veces con backoff exponencial.
💾 Caché de system prompt
Voy a hacer 10 peticiones con el mismo system prompt de 2.000 palabras. Activa la caché de prompts para reducir el coste y la latencia en cada iteración.

Características

Enrutamiento inteligente de modelos Selecciona automáticamente entre modelos económicos y potentes según la longitud del texto y el número de elementos, con opción de forzar un modelo concreto.
Rastreador de costes inmutable Usa dataclasses congeladas para registrar el gasto acumulado sin mutar el estado anterior, garantizando trazabilidad total del presupuesto.
Reintentos selectivos con backoff Reintena solo errores transitorios (rate limit, conexión, servidor) con backoff exponencial. Falla de inmediato ante errores de autenticación o solicitudes mal formadas.
Caché de prompts efímera Marca los prompts del sistema con cache_control para evitar reenvíos redundantes y reducir significativamente latencia y coste por token.
Pipeline componible Integra enrutamiento, control de presupuesto, reintentos y caché en una única tubería que procesa texto, verifica el presupuesto y registra el coste de cada operación.

Preguntas frecuentes

La skill está diseñada principalmente para la API de Anthropic (Claude), pero la arquitectura es componible y adaptable a otros proveedores como OpenAI ajustando los nombres de los modelos y los errores transitorios.
Sí, necesitas el SDK de Python de Anthropic (anthropic) y Python 3.10+ con soporte para dataclasses con slots. Instálalo con: pip install anthropic.
Se utiliza un CostTracker inmutable basado en dataclasses congeladas. Cada llamada a la API devuelve un nuevo rastreador con el coste acumulado actualizado. Si el total supera el budget_limit, el sistema lanza una excepción y detiene el procesamiento.
Sí. Los umbrales de longitud de texto y número de elementos son configurables en la función select_model. También puedes forzar un modelo concreto con el parámetro force_model.

Skills relacionadas

Mas skills de la misma categoria:

Optimización de Costes para LLM — Reduce el gasto en APIs de IA

¿Prefieres escuchar el contenido? Genera la narración de audio con un clic.