---
title: "Criterios de Éxito de un Piloto de IA: 12 KPIs"
canonical: https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/
language: es
description: "Evalúa un piloto de IA tras 30 días con 12 KPIs, fórmulas, barreras duras y un ejemplo. Decide con evidencia si escalar, iterar o cancelar."
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

16 min de lectura · 16 de julio de 2026

[**Siguiente**](/es/blog/t3mp3st-ai-red-teaming-review-2026/)

# Scorecard para Cancelar o Escalar un Piloto de IA: 12 Métricas Tras 30 Días

Resumen

Evalúa un piloto de IA tras 30 días operativos medidos con doce métricas: coste base, coste por acción exitosa, finalización sin intervención, corrección humana, fallos de herramientas, coste de falsos positivos, latencia P50/P95, escalados, adopción, auditabilidad, preparación de datos y retorno. Verde vale dos puntos, ámbar uno y rojo cero: 20-24 permite un paso controlado de escala, 14-19 una iteración limitada y 0-13 exige cancelar o pausar. Daño inaceptable, una traza ausente o una línea base inválida anulan el total.

Los criterios de éxito de un piloto de IA deben responder una decisión: ¿ha generado el sistema suficiente valor de negocio fiable para justificar el siguiente euro de inversión? Tras 30 días operativos medidos, evalúa 12 métricas de economía, calidad de automatización, fiabilidad, adopción y gobernanza. Puntúa cada una en verde, ámbar o rojo, pero no permitas que un promedio alto oculte un fallo inaceptable de seguridad, falsos positivos o auditabilidad.

Este es el modelo de medición, no el plan de despliegue. Para decidir qué hacer entre los días 0 y 90, usa nuestro [plan de piloto de agente de IA de 30/60/90 días](/es/blog/ai-agent-pilot-30-60-90-days/). Este scorecard empieza después de 30 días de uso representativo en modo sombra o producción. Para profundizar en la economía operativa, consulta el [coste por acción exitosa de un agente de IA](/es/blog/ai-agent-cost-per-action-2026/).

## ¿Cuáles son buenos criterios de éxito para un piloto de IA?

Unos buenos criterios comparan el nuevo flujo con una línea base medida, cuentan solo resultados que superan el umbral de calidad del negocio, incluyen corrección humana y costes de fallo, y fijan barreras duras de gobernanza. Se escriben antes del piloto y producen en una fecha fija una decisión explícita: escalar, iterar una vez o detener.

"Tras 30 días" significa 30 días en los que usuarios y trabajo representativos pudieron llegar al sistema. Un mes bloqueado por permisos, datos o integraciones es evidencia de falta de preparación de datos, no una muestra válida de adopción o rendimiento.

El marco sigue la lógica del [NIST AI RMF Playbook](https://airc.nist.gov/airmf-resources/playbook/measure/): comparar con una línea base humana o previa al despliegue, observar el comportamiento real, registrar anulaciones y escalados, y documentar decisiones responsables de go/no-go. Microsoft separa la finalización end-to-end de las métricas de proceso, y Google Cloud evalúa trazas inmutables con entradas, respuestas y tool calls.

## El scorecard de 12 métricas

Estas bandas son el punto de partida recomendado por Wavect para un flujo interno de bajo riesgo. No son benchmarks universales. Sustitúyelas antes del kickoff cuando la economía, el riesgo o el SLO exijan un listón diferente.

| # | KPI | Fórmula | Verde | Ámbar | Rojo |
| --- | --- | --- | --- | --- | --- |
| 1 | Coste base por tarea | (Minutos × coste horario completo ÷ 60) + sistemas + retrabajo + pérdida esperada por errores | Muestra representativa, responsable y variación documentados | Promedio disponible, con retrabajo o errores estimados | Sin línea base defendible |
| 2 | Coste por acción exitosa | Coste operativo total ÷ acciones que superan el umbral de calidad | ≤70% del coste base | 71% a 100% | >100% |
| 3 | Tasa de finalización sin intervención | Éxitos sin corrección ni escalado ÷ intentos elegibles × 100 | ≥80% | 60% a 79% | <60% |
| 4 | Tiempo de corrección humana | Minutos totales de corrección ÷ intentos elegibles | ≤20% del tiempo base | 21% a 50% | >50% |
| 5 | Tasa de fallo de tool calls | Tool calls con fallo técnico ÷ tool calls totales × 100 | <2% | 2% a 5% | >5% |
| 6 | Coste de falsos positivos | Investigación, reversión y pérdidas ÷ intentos elegibles | ≤5% del beneficio bruto | 5% a 20% | >20% o un incidente inaceptable |
| 7 | Latencia P50 y P95 | Percentiles 50 y 95 de la duración end-to-end | Ambos cumplen el SLO | P50 cumple, P95 falla | P50 falla o P95 rompe el proceso |
| 8 | Tasa de escalado | Intentos transferidos a una persona ÷ intentos elegibles × 100 | ≤15% | 16% a 30% | >30% |
| 9 | Adopción | Usuarios elegibles con uso rutinario ÷ usuarios elegibles invitados × 100 | ≥60% | 30% a 59% | <30% |
| 10 | Auditabilidad | Ejecuciones reconstruibles ÷ ejecuciones muestreadas × 100 | 100% de alto impacto y ≥95% total | 90% a 94% | <90% o falta una traza de alto impacto |
| 11 | Fallos de preparación de datos | Intentos bloqueados o invalidados por datos ÷ intentos elegibles × 100 | <5% | 5% a 15% | >15% |
| 12 | Periodo de retorno | Inversión restante ÷ beneficio neto mensual | ≤12 meses | 13 a 24 meses | >24 meses o sin beneficio positivo |

No copies un umbral solo porque aparece en una tabla. Un 20% de escalado puede ser sano para una aprobación de alto riesgo y fatal para soporte de nivel uno. Define primero la consecuencia de negocio y después el objetivo.

## ¿Cómo se calcula cada KPI?

### 1. Coste base por tarea

Mide una muestra representativa del proceso actual e incluye trabajo a coste completo, software atribuible, revisión, retrabajo y pérdida esperada por errores. [Microsoft](https://learn.microsoft.com/en-us/microsoft-copilot-studio/guidance/agent-business-value-metrics-reference) define el coste por transacción con tiempo productivo, sistemas y retrabajo antes de construir el agente.

Coste base = (minutos medianos × coste horario completo ÷ 60) + sistemas + retrabajo + pérdida esperada por errores.

### 2. Coste por acción exitosa

Una respuesta del modelo no es un resultado. Define éxito como una factura contabilizada correctamente, un ticket resuelto sin reapertura o un lead aceptado por ventas.

Coste por acción exitosa = (modelo + retrieval + herramientas + plataforma + reintentos + corrección humana + incidentes) ÷ acciones exitosas.

### 3. Finalización sin intervención

Microsoft la llama touchless rate: la proporción completada de principio a fin sin intervención humana. Una ejecución corregida, aprobada o rescatada no cuenta.

Tasa sin intervención = éxitos sin intervención humana ÷ intentos elegibles × 100.

### 4. Tiempo de corrección humana

Mide sobre todos los intentos, incluidos los de cero minutos. Registra aparte la revisión obligatoria.

Tiempo de corrección por intento = minutos totales de corrección ÷ intentos elegibles.

### 5. Fallos de tool calls

Cuenta timeouts, autenticación, permisos, validación de schema, rate limits y respuestas 4xx o 5xx. Reporta también por herramienta. [Microsoft Foundry](https://learn.microsoft.com/en-us/azure/foundry/concepts/evaluation-evaluators/agent-evaluators) separa selección, precisión de inputs, uso del output y éxito técnico del resultado final.

Tasa de fallo = tool calls con error técnico ÷ tool calls totales × 100.

### 6. Coste de falsos positivos

La accuracy trata los errores por igual; el negocio no. [Google](https://developers.google.com/machine-learning/crash-course/classification/accuracy-precision-recall) recomienda elegir la métrica según el coste relativo de falsos positivos y falsos negativos.

Coste por intento = suma de investigación, reversión, remediación, cliente y compliance ÷ intentos elegibles.

### 7. Latencia P50 y P95

P50 representa la experiencia típica; P95 revela la cola lenta por reintentos, contexto y herramientas. Mide desde el evento de negocio hasta el resultado útil. [OpenTelemetry](https://opentelemetry.io/blog/2026/genai-observability/) captura duración, tokens y spans de agente y herramientas.

P50 es el tiempo en el que termina el 50% de las acciones; P95, el tiempo en el que termina el 95%.

### 8. Tasa de escalado

Un escalado es una transferencia deliberada por falta de confianza, autoridad, datos o capacidad. No lo mezcles con fallos técnicos.

Tasa de escalado = acciones entregadas a una persona ÷ intentos elegibles × 100.

### 9. Adopción

Invitaciones y logins únicos no son adopción. Microsoft usa cuatro o más días activos en cuatro semanas como ejemplo de hábito. Adapta el umbral a la frecuencia real de la tarea.

Adopción rutinaria = usuarios que superan el umbral acordado ÷ usuarios elegibles invitados × 100.

### 10. Auditabilidad

Una ejecución es auditable si un revisor puede reconstruir input, modelo y prompt, herramientas, intervención humana y resultado. Para sistemas de alto riesgo, el [Reglamento de IA de la UE](https://eur-lex.europa.eu/legal-content/ES/TXT/?uri=CELEX%3A32024R1689) exige logging y supervisión humana.

Auditabilidad = ejecuciones con traza completa y resultado enlazado ÷ ejecuciones muestreadas × 100.

### 11. Fallos de preparación de datos

Etiqueta campos ausentes, datos obsoletos, duplicados, mala calidad documental, fuentes inaccesibles y permisos erróneos por separado. [AWS](https://docs.aws.eu/prescriptive-guidance/latest/gen-ai-lifecycle-operational-excellence/gen-ai-lifecycle-operational-excellence.pdf) trata un PoC serio como validación de valor, datos, viabilidad técnica y riesgo.

Tasa de fallos de datos = intentos invalidados por datos inadecuados, ausentes, obsoletos o inaccesibles ÷ intentos elegibles × 100.

### 12. Periodo de retorno

Incluye integración, seguridad, datos, formación, monitorización y cambio organizativo. Resta costes de IA, trabajo humano residual y pérdidas esperadas.

Beneficio neto mensual = coste base evitado − operación de IA − coste humano residual − pérdida esperada.

Retorno en meses = inversión de producción restante ÷ beneficio neto mensual.

Si el beneficio es cero o negativo, el retorno no es largo: no existe.

## ¿Cómo funciona la decisión de cancelar o escalar?

Verde vale 2 puntos, ámbar 1 y rojo 0. El máximo es 24.

| Decisión | Puntos | Acción |
| --- | --- | --- |
| Escalar | 20 a 24 | Ampliar una cohorte o banda de volumen, manteniendo monitorización y rollback. |
| Iterar una vez | 14 a 19 | Financiar un ciclo limitado contra métricas concretas y volver a puntuar. |
| Cancelar o pausar | 0 a 13 | Detener el rollout. Cancelar si fallan economía o encaje; pausar si faltan evidencias. |

Tres barreras anulan el total: daño inaceptable, ausencia de traza en una acción de alto impacto, o falta de una línea base y definición de resultado defendibles.

## Ejemplo completo: IA para procesar facturas

Un equipo austriaco prueba un agente que extrae, valida y enruta 1.000 facturas durante 30 días. Éxito significa campos correctos y cola correcta; sin intervención significa además cero correcciones y escalados.

| Métrica | Cálculo | Resultado |
| --- | --- | --- |
| Coste base | (12 min × €42 ÷ 60) + €1,10 | **€9,50, verde** |
| Coste por éxito | €1.768 ÷ 900 | **€1,96, verde** |
| Sin intervención | 720 ÷ 1.000 | **72%, ámbar** |
| Corrección | 440 min ÷ 1.000 | **0,44 min, verde** |
| Tool calls | 108 ÷ 3.600 | **3%, ámbar** |
| Falsos positivos | €660 ÷ €9.500 | **6,9%, ámbar** |
| Latencia | P50 18 s; P95 84 s; SLO 60 s | **Ámbar** |
| Escalado | 190 ÷ 1.000 | **19%, ámbar** |
| Adopción | 14 ÷ 18 | **77,8%, verde** |
| Auditabilidad | 100% alto impacto; 96% total | **Verde** |
| Datos | 80 ÷ 1.000 | **8%, ámbar** |
| Retorno | €48.000 ÷ €9.278 | **5,2 meses, verde** |

El total es 18 de 24: iterar una vez y volver a medir. La economía, adopción y auditabilidad justifican otro paso controlado, pero antes hay que reparar el conector, mejorar los datos maestros de proveedores y bajar P95 de 60 segundos.

## ¿Qué debe contener la reunión del día 30?

1. Definiciones únicas de intento, éxito, escalado, falso positivo y fallo de datos.
2. Línea base, muestra, exclusiones y volumen.
3. Scorecard con objetivo, actual, banda, responsable y evidencia.
4. Las trazas más lentas, corregidas y caras.
5. Incidentes, privacidad, accesos y trazas ausentes.
6. Una decisión firmada con responsable y próxima fecha.

![Kevin Riedl](/img/team/kevin.webp)

"Un piloto no tiene éxito porque el modelo parezca inteligente. Tiene éxito cuando un flujo representativo mejora, los usuarios lo eligen, los fallos permanecen dentro del presupuesto de riesgo y otro equipo puede reconstruir lo ocurrido sin preguntar a quien lo construyó."

## ¿Dónde encaja este scorecard?

Úsalo para la decisión de inversión del día 30. Usa el [plan de 30/60/90 días](/es/blog/ai-agent-pilot-30-60-90-days/) para secuencia, permisos, modo sombra y handover. Usa el [modelo de coste por acción](/es/blog/ai-agent-cost-per-action-2026/) para tokens, herramientas, reintentos, caching y routing.

## Fuentes y metodología

Este es un marco de decisión original de Wavect. Las fórmulas son reproducibles y los umbrales son recomendaciones para un flujo interno de bajo riesgo, no promedios universales. Fuentes verificadas el 16 de julio de 2026: NIST, Microsoft, Google Cloud, OpenTelemetry, AWS y el Reglamento de IA de la UE.

## Preguntas frecuentes

### ¿Cómo se evalúa si un piloto de IA tuvo éxito?

Compara 30 días representativos con una línea base medida. Evalúa economía, éxito, automatización sin intervención, corrección, herramientas, coste de errores, latencia, escalados, adopción, auditabilidad, datos y retorno. Aplica barreras duras ante daño, trazas ausentes o línea base inválida.

### ¿Cuáles son los KPIs principales de un piloto de agente de IA?

Empieza por coste por acción exitosa y finalización sin intervención. Añade corrección humana, fallos de herramientas, coste de falsos positivos, P50/P95, escalado, adopción rutinaria, auditabilidad, fallos de datos y retorno.

### ¿Bastan 30 días para evaluar un PoC de IA?

Sí para una primera decisión si incluyen usuarios, variedad y volumen representativos. No bastan para estacionalidad, incidentes raros o un mes bloqueado principalmente por acceso a datos.

### ¿Cuándo debe cancelarse un piloto de IA?

Cuando no existe beneficio neto positivo, la demanda sigue débil, los fallos superan el riesgo aceptado o una iteración limitada no mejora las métricas rojas. Pausa si faltan línea base, permisos o datos representativos.

### ¿Cómo se calcula el retorno?

Resta operación de IA, trabajo humano residual y pérdidas esperadas al coste base mensual evitado. Divide la inversión restante entre ese beneficio neto mensual. Si es cero o negativo, no hay periodo de retorno.

## Reflexiones finales

La revisión del día 30 debe terminar con una decisión firmada, no con otra demo. Escala solo cuando valor, adopción y auditabilidad avanzan juntos. Itera una vez ante un bloqueo corregible. Cancela una economía débil y pausa cuando la falta de datos hace que la puntuación no sea honesta.

## También te puede gustar..

[**Piloto de agente de IA en 30/60/90 días** El plan de despliegue para un flujo delimitado: reducir riesgo, construir en modo sombra, producción limitada y handover.](/es/blog/ai-agent-pilot-30-60-90-days/) [**AI Enablement frente a consultoría genérica** Compara un sistema operativo en tu infraestructura con un proyecto centrado en estrategia.](/es/compare/ai-enablement-vs-generic-ai-consultancy/)

Ingeniería de agentes

## Continúa por este clúster

Agentes de código, MCP, contexto, evaluación y controles para automatización fiable.

[Empieza por el artículo fundamental**Ingeniería de grafos para agentes de IA: ¿Cuándo compensa un knowledge graph?**](/es/blog/graph-engineering-ai-agents/)

- [Por qué las ediciones de agentes necesitan identidad semántica: SEMAPRAX en Rust](/es/blog/semantic-identity-rust-agent-edits/)
- [Análisis de OpenViking 2026: ¿Memoria de archivos lista para producción?](/es/blog/openviking-agent-memory-review/)
- [LLM-as-a-Verifier: arquitectura, costes y uso en producción](/es/blog/llm-as-a-verifier/)
- [TrueForge: análisis del agent harness open source para producción](/es/blog/trueforge-agent-harness-review/)
- [Webs legibles por agentes: llms.txt, espejos en Markdown y qué se rompe](/es/blog/agent-readable-website-llms-txt-markdown-mirrors/)

Tu bandeja, sin ruido

## Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

16 min de lectura · 16 de julio de 2026

[**Siguiente**](/es/blog/t3mp3st-ai-red-teaming-review-2026/)

Nuevos artículos por correo ×

×

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-16",
      "inLanguage": "es",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-16",
      "url": "https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Evalúa un piloto de IA tras 30 días operativos medidos con doce métricas: coste base, coste por acción exitosa, finalización sin intervención, corrección humana, fallos de herramientas, coste de falsos positivos, latencia P50/P95, escalados, adopción, auditabilidad, preparación de datos y retorno. Verde vale dos puntos, ámbar uno y rojo cero: 20-24 permite un paso controlado de escala, 14-19 una iteración limitada y 0-13 exige cancelar o pausar. Daño inaceptable, una traza ausente o una línea base inválida anulan el total.",
  "articleBody": " Resumen del blog/IA y agentes/Ingeniería de agentes Scorecard para Cancelar o Escalar un Piloto de IA: 12 Métricas Tras 30 Días Resumen Evalúa un piloto de IA tras 30 días operativos medidos con doce métricas: coste base, coste por acción exitosa, finalización sin intervención, corrección humana, fallos de herramientas, coste de falsos positivos, latencia P50/P95, escalados, adopción, auditabilidad, preparación de datos y retorno. Verde vale dos puntos, ámbar uno y rojo cero: 20-24 permite un paso controlado de escala, 14-19 una iteración limitada y 0-13 exige cancelar o pausar. Daño inaceptable, una traza ausente o una línea base inválida anulan el total. Los criterios de éxito de un piloto de IA deben responder una decisión: ¿ha generado el sistema suficiente valor de negocio fiable para justificar el siguiente euro de inversión? Tras 30 días operativos medidos, evalúa 12 métricas de economía, calidad de automatización, fiabilidad, adopción y gobernanza. Puntúa cada una en verde, ámbar o rojo, pero no permitas que un promedio alto oculte un fallo inaceptable de seguridad, falsos positivos o auditabilidad. Este es el modelo de medición, no el plan de despliegue. Para decidir qué hacer entre los días 0 y 90, usa nuestro plan de piloto de agente de IA de 30/60/90 días. Este scorecard empieza después de 30 días de uso representativo en modo sombra o producción. Para profundizar en la economía operativa, consulta el coste por acción exitosa de un agente de IA. ¿Cuáles son buenos criterios de éxito para un piloto de IA? Unos buenos criterios comparan el nuevo flujo con una línea base medida, cuentan solo resultados que superan el umbral de calidad del negocio, incluyen corrección humana y costes de fallo, y fijan barreras duras de gobernanza. Se escriben antes del piloto y producen en una fecha fija una decisión explícita: escalar, iterar una vez o detener. \"Tras 30 días\" significa 30 días en los que usuarios y trabajo representativos pudieron llegar al sistema. Un mes bloqueado por permisos, datos o integraciones es evidencia de falta de preparación de datos, no una muestra válida de adopción o rendimiento. El marco sigue la lógica del NIST AI RMF Playbook: comparar con una línea base humana o previa al despliegue, observar el comportamiento real, registrar anulaciones y escalados, y documentar decisiones responsables de go/no-go. Microsoft separa la finalización end-to-end de las métricas de proceso, y Google Cloud evalúa trazas inmutables con entradas, respuestas y tool calls. El scorecard de 12 métricas Estas bandas son el punto de partida recomendado por Wavect para un flujo interno de bajo riesgo. No son benchmarks universales. Sustitúyelas antes del kickoff cuando la economía, el riesgo o el SLO exijan un listón diferente. #KPIFórmulaVerdeÁmbarRojo 1Coste base por tarea(Minutos × coste horario completo ÷ 60) + sistemas + retrabajo + pérdida esperada por erroresMuestra representativa, responsable y variación documentadosPromedio disponible, con retrabajo o errores estimadosSin línea base defendible 2Coste por acción exitosaCoste operativo total ÷ acciones que superan el umbral de calidad≤70% del coste base71% a 100%>100% 3Tasa de finalización sin intervenciónÉxitos sin corrección ni escalado ÷ intentos elegibles × 100≥80%60% a 79%<60% 4Tiempo de corrección humanaMinutos totales de corrección ÷ intentos elegibles≤20% del tiempo base21% a 50%>50% 5Tasa de fallo de tool callsTool calls con fallo técnico ÷ tool calls totales × 100<2%2% a 5%>5% 6Coste de falsos positivosInvestigación, reversión y pérdidas ÷ intentos elegibles≤5% del beneficio bruto5% a 20%>20% o un incidente inaceptable 7Latencia P50 y P95Percentiles 50 y 95 de la duración end-to-endAmbos cumplen el SLOP50 cumple, P95 fallaP50 falla o P95 rompe el proceso 8Tasa de escaladoIntentos transferidos a una persona ÷ intentos elegibles × 100≤15%16% a 30%>30% 9AdopciónUsuarios elegibles con uso rutinario ÷ usuarios elegibles invitados × 100≥60%30% a 59%<30% 10AuditabilidadEjecuciones reconstruibles ÷ ejecuciones muestreadas × 100100% de alto impacto y ≥95% total90% a 94%<90% o falta una traza de alto impacto 11Fallos de preparación de datosIntentos bloqueados o invalidados por datos ÷ intentos elegibles × 100<5%5% a 15%>15% 12Periodo de retornoInversión restante ÷ beneficio neto mensual≤12 meses13 a 24 meses>24 meses o sin beneficio positivo No copies un umbral solo porque aparece en una tabla. Un 20% de escalado puede ser sano para una aprobación de alto riesgo y fatal para soporte de nivel uno. Define primero la consecuencia de negocio y después el objetivo. ¿Cómo se calcula cada KPI? 1. Coste base por tarea Mide una muestra representativa del proceso actual e incluye trabajo a coste completo, software atribuible, revisión, retrabajo y pérdida esperada por errores. Microsoft define el coste por transacción con tiempo productivo, sistemas y retrabajo antes de construir el agente. Coste base = (minutos medianos × coste horario completo ÷ 60) +",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-16",
  "datePublished": "2026-07-16",
  "description": "Evalúa un piloto de IA tras 30 días operativos medidos con doce métricas: coste base, coste por acción exitosa, finalización sin intervención, corrección humana, fallos de herramientas, coste de falsos positivos, latencia P50/P95, escalados, adopción, auditabilidad, preparación de datos y retorno. Verde vale dos puntos, ámbar uno y rojo cero: 20-24 permite un paso controlado de escala, 14-19 una iteración limitada y 0-13 exige cancelar o pausar. Daño inaceptable, una traza ausente o una línea base inválida anulan el total.",
  "headline": "Scorecard para Cancelar o Escalar un Piloto de IA: 12 Métricas Tras 30 Días",
  "image": "https://wavect.io/img/blog/headers/header_ai-pilot-kill-or-scale-scorecard.svg",
  "inLanguage": "es",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/",
  "wordCount": 2306
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/",
      "name": "Inicio",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/overview/",
      "name": "Resumen del blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/topics/ai-agents/",
      "name": "IA y agentes",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/clusters/agent-engineering/",
      "name": "Ingeniería de agentes",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/ai-pilot-kill-or-scale-scorecard/",
      "name": "Criterios de Éxito de un Piloto de IA: 12 KPIs | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Compara 30 días representativos con una línea base medida. Evalúa economía, éxito, automatización sin intervención, corrección, herramientas, coste de errores, latencia, escalados, adopción, auditabilidad, datos y retorno. Aplica barreras duras ante daño, trazas ausentes o línea base inválida."
      },
      "name": "¿Cómo se evalúa si un piloto de IA tuvo éxito?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Empieza por coste por acción exitosa y finalización sin intervención. Añade corrección humana, fallos de herramientas, coste de falsos positivos, P50/P95, escalado, adopción rutinaria, auditabilidad, fallos de datos y retorno."
      },
      "name": "¿Cuáles son los KPIs principales de un piloto de agente de IA?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Sí para una primera decisión si incluyen usuarios, variedad y volumen representativos. No bastan para estacionalidad, incidentes raros o un mes bloqueado principalmente por acceso a datos."
      },
      "name": "¿Bastan 30 días para evaluar un PoC de IA?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Cuando no existe beneficio neto positivo, la demanda sigue débil, los fallos superan el riesgo aceptado o una iteración limitada no mejora las métricas rojas. Pausa si faltan línea base, permisos o datos representativos."
      },
      "name": "¿Cuándo debe cancelarse un piloto de IA?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Resta operación de IA, trabajo humano residual y pérdidas esperadas al coste base mensual evitado. Divide la inversión restante entre ese beneficio neto mensual. Si es cero o negativo, no hay periodo de retorno."
      },
      "name": "¿Cómo se calcula el retorno?"
    }
  ]
}
```
