¿Qué hace esta skill?

La Parser Híbrido Regex y LLM Skill resuelve el dilema de elegir entre regex y modelos de lenguaje para extraer texto estructurado. La estrategia central usa regex para el 95-98% de los casos de forma determinista y económica, reservando el LLM exclusivamente para los casos límite donde la confianza de la extracción es baja. Incluye puntuación de confianza, filtrado automático y validación selectiva con modelos económicos.

Parseo de Cuestionarios
Extrae preguntas, opciones y respuestas de cuestionarios con formato repetitivo usando patrones regex.
Puntuación de Confianza
Evalúa cada extracción con criterios como número de opciones, presencia de respuesta y longitud del texto.
Validación Selectiva con LLM
Envía al LLM solo los elementos con confianza inferior a 0.95, reduciendo llamadas y costes un 95%.
Procesamiento de Alto Volumen
Procesa facturas, formularios y tablas a escala sin enviar todo el contenido al LLM.

Ejemplos de uso

📋 Parseo de cuestionario
Parsea este cuestionario con regex y devuelve los elementos con su puntuación de confianza.
🔍 Revisar baja confianza
Extrae las preguntas de este formulario y marca para revisión con LLM las que tengan confianza menor a 0.95.
📊 Procesar lote de facturas
Procesa estas 410 facturas con el pipeline híbrido y dime cuántas necesitaron validación con LLM.
🧩 Pipeline completo
Construye un pipeline que combine regex y LLM para extraer datos estructurados de este documento.

Características

Estrategia regex-first Resuelve el 95-98% de los casos de forma determinista sin llamadas al LLM.
Puntuación de confianza automática Evalúa cada extracción penalizando opciones faltantes, respuestas vacías y textos cortos.
Validación LLM selectiva Solo los elementos con confianza inferior al umbral se envían al modelo más económico disponible.
Inmutabilidad de objetos Los elementos corregidos por el LLM se integran sin mutar las instancias originales del parser.
Ahorro de costes del 95% En producción con 410 elementos, solo 8 necesitaron revisión y se hicieron 5 llamadas al LLM.

Preguntas frecuentes

No obligatoriamente. El pipeline funciona solo con regex; el LLM solo se usa si hay elementos de baja confianza y se proporciona un cliente LLM.
El umbral por defecto es 0.95. Los elementos con puntuación inferior se marcan para validación con LLM.
Cualquier texto estructurado con patrones repetitivos: cuestionarios, formularios, tablas, facturas y documentos similares.
En un caso real con 410 elementos, el regex logró un 98% de éxito y solo se realizaron 5 llamadas al LLM, lo que supuso un ahorro del 95% en costes.

Skills relacionadas

Mas skills de la misma categoria:

Parser Híbrido Regex y LLM — Extracción de Texto Eficiente con Claude AI

¿Prefieres escuchar el contenido? Genera la narración de audio con un clic.