---
title: "Calculadora de Costes LLM 2026: Coste por Tarea"
canonical: https://wavect.io/es/blog/llm-cost-calculator-2026/
language: es
description: "Calculadora práctica de costes LLM para 2026: fórmulas de coste por tarea, prompt caching, batch APIs, routing, self-hosting, reintentos y calidad de eval."
image: "https://wavect.io/img/blog/headers/header_llm-cost-calculator-2026.png"
---

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min de lectura · 08 jul 2026

[**Siguiente**](/es/blog/the-factory-returns/)

# Calculadora de Costes LLM 2026: Coste por Tarea, No por Token

Resumen

La unidad útil para una factura LLM es una tarea completada, no un millón de tokens. Una calculadora real de 2026 debe contar cada llamada al modelo dentro de la tarea, separar input sin caché de input cacheado, cobrar output aparte, aplicar descuentos batch solo al trabajo async, modelar el routing con tasa de escalado y añadir reintentos más retrabajo humano. El prompt caching suele ser la primera palanca: prefijos estables primero, datos volátiles al final, y tokens cacheados medidos por feature. Las Batch APIs encajan con evals, enrichment y extracción offline, no con UX en vivo. El routing solo ahorra dinero de forma segura cuando un verificador y un eval harness prueban que el camino barato mantuvo la calidad. El self-hosting solo tiene sentido cuando la residencia de datos lo exige o el volumen estable llena la GPU después de contar ops, redundancia y mantenimiento de evals. Optimiza en orden: instrumentar coste por tarea exitosa, cachear, batch, routing, ajustar modelo, comprimir contexto y self-host solo cuando la matemática o governance lo pidan. Las cifras son una foto de julio de 2026; revisa los docs de proveedores antes de presupuestar.

La unidad útil para una factura de [LLM](/es/glossary/llm/) no es un millón de tokens. Es una tarea completada: un ticket de soporte respondido, una factura extraída, una pull request revisada, una pregunta interna resuelta. El precio por token es solo la lista de precios. El coste por tarea es la realidad de la factura después de reintentos, llamadas a herramientas, contexto, aciertos de caché, routing, descuentos por batch y salidas fallidas.

Perspectiva de ingeniería, no asesoramiento de precios. Las fórmulas son estables; los precios de ejemplo son orientativos y deben reemplazarse por precios actuales antes de comprometer presupuesto. A 8 de julio de 2026: OpenAI lista un descuento del 50% para Batch API y una ventana de 24 horas, OpenAI prompt caching empieza a partir de 1.024 tokens de prompt, Anthropic cobra las lecturas de caché a 0,1x del precio base de input y su Batches API al 50% del precio estándar, y Gemini activa caching implícito por defecto para Gemini 2.5 y modelos posteriores. Revisa las fuentes primarias enlazadas antes de presupuestar.

## La calculadora en una fórmula

Empieza con una tarea, no con una llamada API. Una tarea puede incluir varias llamadas al modelo, retrieval, herramientas, un verificador y a veces un reintento. El coste completo es:

| Partida | Fórmula | Qué medir |
| --- | --- | --- |
| Input sin caché | input_tokens_uncached / 1M * input_price | Prompt, chunks, esquemas de herramientas, historial |
| Input cacheado | input_tokens_cached / 1M * cached_input_price | Prefijo estable, definiciones de herramientas, prompt de sistema |
| Output | output_tokens / 1M * output_price | Respuesta final, salida visible de razonamiento, artefactos |
| Llamadas por tarea | sum(call_cost) en toda la tarea | Turnos de agente, verificadores, clasificadores, fallbacks |
| Reintentos | task_cost * retry_rate | Timeouts, fallos de esquema, baja confianza, errores de herramientas |
| Descuento batch | eligible_async_cost * batch_multiplier | Evals, enrichment, extracción, análisis nocturno |
| Coste de fallo | failed_task_rate * human_rework_cost | Soporte, QA, revisión humana, impacto en clientes |

Coste por tarea completada = coste del modelo en todas las llamadas + retrieval e infraestructura + reintentos + retrabajo humano.

Por eso escribimos sobre [coste por token frente a coste por tarea](/es/blog/cost-per-token-vs-cost-per-task/). Un modelo más barato que necesita más turnos, escribe salidas más largas o falla más a menudo puede salir más caro que el modelo con la lista de precios incómoda.

## Qué entradas debe tener la calculadora

- Volumen de tareas. Cuenta unidades de negocio reales: tickets, documentos, presupuestos, pull requests, checks, informes de research.
- Llamadas por tarea. Los flujos agentic gastan mucho en bucles: clasificación, retrieval, borrador, herramienta, verificador, reescritura y resumen de auditoría.
- Input medio por llamada. Separa prefijo estable, contexto recuperado, historial, esquemas de herramientas y datos volátiles del usuario.
- Output medio por llamada. Los agentes de razonamiento y coding pueden ser muy pesados en output.
- Tasa de caché. Mide tokens cacheados, no solo requests. OpenAI expone `cached_tokens`; Gemini expone conteos de tokens cacheados; Anthropic separa escritura y lectura de caché.
- Parte batchable. Todo lo que puede esperar debe ir primero a batch: evals, extracción offline, enrichment, clasificación, resúmenes.
- Tasa de escalado. Si un modelo barato hace el primer pase y uno fuerte cubre los casos difíciles, ese porcentaje es un KPI de producto.
- Suelo de calidad. Pon la tasa de aprobado del eval junto al coste. Sin eso comparas facturas e ignoras si el trabajo sigue funcionando.

![Kevin Riedl](/img/team/kevin.webp)

"Si tu calculadora no muestra cuánto cuesta una tarea exitosa, no es una calculadora de costes de IA. Es un recibo de tokens."

## Ejemplo: triage de soporte

Un flujo de soporte lee un ticket, recupera políticas, redacta una respuesta y verifica si está fundamentada. La hoja ingenua dice: una llamada de respuesta, quizá 4.000 tokens de input y 600 de output. El trace de producción dice otra cosa:

| Paso | Llamadas | Input | Output | Palanca |
| --- | --- | --- | --- | --- |
| Clasificar ticket | 1 | 700 | 60 | Modelo pequeño o reglas |
| Retrieval y borrador | 1 | 5.500 | 700 | Prompt cache, mejor retrieval |
| Verificar grounding | 1 | 3.200 | 120 | Verificador barato, checks deterministas primero |
| Reescribir si hay baja confianza | 0,18 de media | 4.800 | 500 | Mejor prompt o escalado selectivo |

El coste del modelo no es la llamada de respuesta. Son 3,18 llamadas de media, más retrieval, más la cola de reintentos. Si el 60% del input del borrador es prompt de sistema, política y esquema de herramientas estable, el prompt caching pesa más que cambiar de modelo. Si solo el 20% de tickets necesita el modelo fuerte, routing pesa más que ahorrar unos céntimos en el modelo por defecto. Es el mismo patrón que nuestro [manual para reducir costes de tokens LLM](/es/blog/reduce-llm-token-costs-2026/), pero convertido en calculadora.

## Cómo entra el prompt caching

Coste de input = uncached_input * normal_input_price + cached_input * cache_read_price + cache_writes * cache_write_price.

La táctica operativa es simple: contenido estable primero, contenido volátil al final. OpenAI recomienda colocar contenido estático o repetido al principio para prompts de 1.024 tokens o más. Anthropic cobra cache reads a 0,1x, mientras que los cache writes cuestan más que input normal, así que la escritura se paga sola solo cuando se reutiliza. Gemini indica que el caching implícito está activo por defecto para Gemini 2.5 y modelos posteriores, y recomienda poner el contenido común grande al inicio.

- Buen prefijo de caché: instrucción de sistema, definiciones de herramientas, esquema de salida, política de producto, contexto estable.
- Mal prefijo de caché: timestamp, ID de usuario, trace aleatorio, documento de la request, cuerpo del ticket.
- Métrica: tokens de input cacheados dividido por tokens de input totales, por feature y modelo.

Fuentes primarias: [OpenAI prompt caching](https://developers.openai.com/api/docs/guides/prompt-caching), [Anthropic prompt caching](https://platform.claude.com/docs/en/build-with-claude/prompt-caching) y [Gemini context caching](https://ai.google.dev/gemini-api/docs/caching).

## Cómo entran las Batch APIs

Coste total del modelo = live_cost + batchable_cost * batch_multiplier.

OpenAI documenta un descuento del 50% para Batch API frente a APIs síncronas y una ventana de 24 horas. Anthropic dice que Message Batches reduce los costes en un 50%, con la mayoría de batches terminando en menos de una hora y resultados al completarse todos los mensajes o al llegar a 24 horas. Batch debe ser el defecto para evals, enrichment nocturno, extracción offline, backfills, moderación y resúmenes analíticos.

No pongas en batch una experiencia en vivo donde el usuario espera. Sí pon en batch tu eval harness. Muchos equipos pagan continuamente por re-testear prompts y modelos, y olvidan que esas pruebas no necesitan latencia en vivo. Lo cubrimos en [cuándo un eval LLM se paga solo](/es/blog/llm-evaluation-cost-roi-production/).

Fuentes primarias: [OpenAI Batch API](https://developers.openai.com/api/docs/guides/batch) y [Anthropic batch processing](https://platform.claude.com/docs/en/build-with-claude/batch-processing).

## Routing: ahorro con trampa de calidad

Coste con routing = cheap_path_cost * (1 - escalation_rate) + strong_path_cost * escalation_rate + verifier_cost.

RouteLLM formula bien la idea: consultas simples a modelos baratos, modelos fuertes para casos difíciles, y un threshold calibrado sobre tráfico parecido al tuyo. Su README reporta hasta 85% de reducción de coste manteniendo el 95% de rendimiento GPT-4 en benchmarks. Trátalo como referencia de investigación, no como tu número de producción.

1. **Modelo barato por defecto.** Empieza con el modelo más barato que aprueba la mayoría fácil.
2. **Verificador.** Comprueba esquema, grounding, política y confianza.
3. **Escalado.** Casos inciertos, caros o fallidos van al modelo fuerte.
4. **Puerta de eval.** Compara camino barato, camino fuerte y routing sobre ejemplos reales.
5. **Monitorización.** Si sube el porcentaje fuerte, cambió el tráfico o el modelo barato está sobrecargado.

Aquí ayudan los [gateways y routers LLM](/es/blog/llm-gateway-router-comparison-2026/). LiteLLM, Portkey, OpenRouter o una capa propia con RouteLLM centralizan logs, mezcla de modelos, fallback, presupuestos y routing.

Investigación y herramientas: [RouteLLM](https://github.com/lm-sys/RouteLLM), [paper de RouteLLM](https://arxiv.org/abs/2406.18665), [routing por batch bajo coste y capacidad](https://arxiv.org/abs/2603.26796) y [routing con batch prompting](https://arxiv.org/abs/2605.28268).

## Modelos locales y self-hosting

Self-hosting no convierte la inferencia en gratis. Cambia coste variable por coste de GPU, riesgo de utilización, ops, redundancia y mantenimiento de evals:

Coste self-host por tarea = (gpu_hour_cost + ops_hour_cost + redundancy + monitoring + eval_upkeep) / completed_tasks_per_hour.

El denominador decide. Una GPU al 80% todo el día puede tener sentido. Una GPU al 12% porque tu tráfico llega en picos es un símbolo de soberanía muy caro. Por eso nuestra guía de [coste de self-hosting LLM en la UE](/es/blog/self-hosting-llms-eu-cost/) empieza por volumen y residencia de datos, no por la ficha de la GPU.

- Residencia de datos o governance obliga. Entonces el coste es la segunda pregunta.
- Volumen alto y estable llena el hardware. Contra APIs open-weight baratas, necesitas carga sostenida, no picos ocasionales.

La elección de modelo viene después. Nuestra [comparación de LLM open-weight](/es/blog/open-weight-llm-comparison-2026/) cubre DeepSeek, Qwen, Kimi, GLM y Llama desde una perspectiva europea de despliegue. La calculadora debe incluir la tasa de aprobado en tu eval, no solo tokens por segundo.

## Compresión de contexto y semantic caching

- Semantic caching. Si una nueva petición se parece lo suficiente a una anterior, devuelves la respuesta previa o una adaptación ligera. Ahorra mucho en soporte repetitivo y asistentes internos, pero puede crear respuestas obsoletas, personalizadas de forma incorrecta o no autorizadas.
- Compresión de contexto. Envía el contexto correcto más pequeño: resúmenes, mapas de archivos, snippets relevantes y salidas de herramientas podadas en lugar de reenviar todo el workspace.

Esto conecta con [por qué los agentes de coding fallan por contexto, no por inteligencia](/es/blog/ai-coding-agents-context-not-intelligence/), y con nuestro texto sobre [ahorro de tokens renderizando texto como imagen](/es/blog/text-as-image-token-savings/). La compresión es potente, pero valores exactos, IDs, importes, hashes, cláusulas legales y permisos deben seguir exactos. Si la optimización tiene pérdidas, la calculadora necesita una línea de coste de fallo.

## Una hoja que puedes copiar

| Columna | Ejemplo | Por qué importa |
| --- | --- | --- |
| Tipo de tarea | Respuesta de soporte | Unidad de negocio, no unidad API |
| Volumen mensual | 25.000 | Escala la factura |
| Llamadas por tarea | 3,18 | Captura bucles agentic |
| Input por llamada | 3.900 | Objetivo principal del caching |
| Parte cacheada | 55% | Muestra upside del prompt cache |
| Output por llamada | 420 | A menudo domina agentes de razonamiento |
| Parte batchable | 20% | Aplica descuento async |
| Escalado a modelo fuerte | 18% | Economía de routing |
| Tasa de reintento | 7% | Coste oculto y señal de calidad |
| Eval pass rate | 94% | Evita ahorros falsos |
| Retrabajo humano | 0,6 min | Convierte fallos en dinero |
| Coste por tarea exitosa | Calculado | La cifra que optimizas |

## En qué orden optimizar

1. **Instrumenta coste por tarea.** Loguea task ID, modelo, tokens, cache hits, reintentos, latencia, estado y veredicto del eval.
2. **Tómate en serio el caching.** Prefijo estable primero, datos volátiles al final.
3. **Pon en batch el trabajo offline.** Evals y enrichment no deberían pagar precios live.
4. **Routea con verificador.** Default barato, fallback fuerte, tasa de escalado monitorizada.
5. **Ajusta el modelo al trabajo.** Prueba modelos open-weight y modelos pequeños en tu eval.
6. **Comprime contexto.** Quita historial irrelevante y contexto repetido.
7. **Self-host solo por volumen o governance.** Precia utilización e ingeniería, no solo horas GPU.

Si esta cifra es el motivo por el que un proyecto está parado, la solución suele ser arquitectónica y no aritmética. Instrumentar el gasto y luego rehacer el enrutado, el caching y el retrieval hasta que se mueva el coste por tarea completada es lo que hace nuestro [servicio de habilitación de IA](/es/services/ai-enablement/). [Hyperstate AI](/es/case-studies/hyperstate-ai/) es un caso publicado en el que dividir un monolito intensivo en GPU redujo latencia y coste, y nuestra [guía de selección tecnológica](/es/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) aborda esta decisión antes de que exista la factura.

## Reflexiones finales

La calculadora de costes LLM de 2026 empieza por la tarea. Cuenta cada llamada al modelo, separa input cacheado y no cacheado, cobra output aparte, aplica descuentos batch solo al trabajo que puede esperar, modela routing por tasa de escalado y suma reintentos más retrabajo humano. Luego divide por tareas exitosas, no por requests.

La secuencia ganadora: mide coste por tarea, arregla prompt caching, mueve trabajos offline a batch, routea trabajo fácil fuera de los modelos frontier, ajusta el modelo con un eval harness, comprime contexto y self-host solo cuando volumen o residencia de datos lo hagan racional. La cifra ganadora no es el token más barato. Es la tarea más barata que todavía pasa tu barra de calidad.

## También te puede gustar..

[**Cómo reducir los costes de tokens LLM en 2026** El manual de implementación detrás de esta calculadora: caching, batch, routing, ajuste de modelo, compresión y self-hosting solo cuando tiene sentido.](/es/blog/reduce-llm-token-costs-2026/) [**AI Enablement vs una consultora de IA genérica** Una te entrega una presentación de estrategia. La otra lanza un setup que funciona en tu infraestructura y que tu equipo posee.](/es/compare/ai-enablement-vs-generic-ai-consultancy/)

Modelos e infraestructura

## Continúa por este clúster

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

[Empieza por el artículo fundamental**Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights**](/es/blog/self-hosting-llms-eu-cost/)

- [El stack vLLM y Triton de Netflix: 7 lecciones de producción](/es/blog/netflix-vllm-triton-inference-stack/)
- [Transformers.js en el navegador: cuándo llevar la IA local a tu producto](/es/blog/transformers-js-browser-ai-guide/)
- [Cómo autoalojar LiteLLM en producción: guía 2026](/es/blog/self-host-litellm-production-2026/)
- [Wiki empresarial preparada para IA: arquitectura e implementación](/es/blog/ai-ready-company-wiki/)
- [¿Claude añade marcas de agua al texto? Respuesta API 2026](/es/blog/claude-text-watermark-api-2026/)

Tu bandeja, sin ruido

## Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min de lectura · 08 jul 2026

[**Siguiente**](/es/blog/the-factory-returns/)

Nuevos artículos por correo ×

×

Recibe nuevos artículos por correo

Un correo breve cuando publicamos. Gratis y sin seguimiento.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/es/blog/llm-cost-calculator-2026/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-08",
      "inLanguage": "es",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-08",
      "url": "https://wavect.io/es/blog/llm-cost-calculator-2026/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "La unidad útil para una factura LLM es una tarea completada, no un millón de tokens. Una calculadora real de 2026 debe contar cada llamada al modelo dentro de la tarea, separar input sin caché de input cacheado, cobrar output aparte, aplicar descuentos batch solo al trabajo async, modelar el routing con tasa de escalado y añadir reintentos más retrabajo humano. El prompt caching suele ser la primera palanca: prefijos estables primero, datos volátiles al final, y tokens cacheados medidos por feature. Las Batch APIs encajan con evals, enrichment y extracción offline, no con UX en vivo. El routing solo ahorra dinero de forma segura cuando un verificador y un eval harness prueban que el camino barato mantuvo la calidad. El self-hosting solo tiene sentido cuando la residencia de datos lo exige o el volumen estable llena la GPU después de contar ops, redundancia y mantenimiento de evals. Optimiza en orden: instrumentar coste por tarea exitosa, cachear, batch, routing, ajustar modelo, comprimir contexto y self-host solo cuando la matemática o governance lo pidan. Las cifras son una foto de julio de 2026; revisa los docs de proveedores antes de presupuestar.",
  "articleBody": " Resumen del blog/IA y agentes/Modelos e infraestructura Calculadora de Costes LLM 2026: Coste por Tarea, No por Token Resumen La unidad útil para una factura LLM es una tarea completada, no un millón de tokens. Una calculadora real de 2026 debe contar cada llamada al modelo dentro de la tarea, separar input sin caché de input cacheado, cobrar output aparte, aplicar descuentos batch solo al trabajo async, modelar el routing con tasa de escalado y añadir reintentos más retrabajo humano. El prompt caching suele ser la primera palanca: prefijos estables primero, datos volátiles al final, y tokens cacheados medidos por feature. Las Batch APIs encajan con evals, enrichment y extracción offline, no con UX en vivo. El routing solo ahorra dinero de forma segura cuando un verificador y un eval harness prueban que el camino barato mantuvo la calidad. El self-hosting solo tiene sentido cuando la residencia de datos lo exige o el volumen estable llena la GPU después de contar ops, redundancia y mantenimiento de evals. Optimiza en orden: instrumentar coste por tarea exitosa, cachear, batch, routing, ajustar modelo, comprimir contexto y self-host solo cuando la matemática o governance lo pidan. Las cifras son una foto de julio de 2026; revisa los docs de proveedores antes de presupuestar. La unidad útil para una factura de LLM no es un millón de tokens. Es una tarea completada: un ticket de soporte respondido, una factura extraída, una pull request revisada, una pregunta interna resuelta. El precio por token es solo la lista de precios. El coste por tarea es la realidad de la factura después de reintentos, llamadas a herramientas, contexto, aciertos de caché, routing, descuentos por batch y salidas fallidas. Perspectiva de ingeniería, no asesoramiento de precios. Las fórmulas son estables; los precios de ejemplo son orientativos y deben reemplazarse por precios actuales antes de comprometer presupuesto. A 8 de julio de 2026: OpenAI lista un descuento del 50% para Batch API y una ventana de 24 horas, OpenAI prompt caching empieza a partir de 1.024 tokens de prompt, Anthropic cobra las lecturas de caché a 0,1x del precio base de input y su Batches API al 50% del precio estándar, y Gemini activa caching implícito por defecto para Gemini 2.5 y modelos posteriores. Revisa las fuentes primarias enlazadas antes de presupuestar. La calculadora en una fórmula Empieza con una tarea, no con una llamada API. Una tarea puede incluir varias llamadas al modelo, retrieval, herramientas, un verificador y a veces un reintento. El coste completo es: PartidaFórmulaQué medir Input sin cachéinput_tokens_uncached / 1M * input_pricePrompt, chunks, esquemas de herramientas, historial Input cacheadoinput_tokens_cached / 1M * cached_input_pricePrefijo estable, definiciones de herramientas, prompt de sistema Outputoutput_tokens / 1M * output_priceRespuesta final, salida visible de razonamiento, artefactos Llamadas por tareasum(call_cost) en toda la tareaTurnos de agente, verificadores, clasificadores, fallbacks Reintentostask_cost * retry_rateTimeouts, fallos de esquema, baja confianza, errores de herramientas Descuento batcheligible_async_cost * batch_multiplierEvals, enrichment, extracción, análisis nocturno Coste de fallofailed_task_rate * human_rework_costSoporte, QA, revisión humana, impacto en clientes Coste por tarea completada = coste del modelo en todas las llamadas + retrieval e infraestructura + reintentos + retrabajo humano. Por eso escribimos sobre coste por token frente a coste por tarea. Un modelo más barato que necesita más turnos, escribe salidas más largas o falla más a menudo puede salir más caro que el modelo con la lista de precios incómoda. Qué entradas debe tener la calculadora Volumen de tareas. Cuenta unidades de negocio reales: tickets, documentos, presupuestos, pull requests, checks, informes de research. Llamadas por tarea. Los flujos agentic gastan mucho en bucles: clasificación, retrieval, borrador, herramienta, verificador, reescritura y resumen de auditoría. Input medio por llamada. Separa prefijo estable, contexto recuperado, historial, esquemas de herramientas y datos volátiles del usuario. Output medio por llamada. Los agentes de razonamiento y coding pueden ser muy pesados en output. Tasa de caché. Mide tokens cacheados, no solo requests. OpenAI expone `cached_tokens`; Gemini expone conteos de tokens cacheados; Anthropic separa escritura y lectura de caché. Parte batchable. Todo lo que puede esperar debe ir primero a batch: evals, extracción offline, enrichment, clasificación, resúmenes. Tasa de escalado. Si un modelo barato hace el primer pase y uno fuerte cubre los casos difíciles, ese porcentaje es un KPI de producto. Suelo de calidad. Pon la tasa de aprobado del eval junto al coste. Sin eso comparas facturas e ignoras si el trabajo sigue funcionando. \"Si tu calculadora no muestra cuánto cuesta una tarea exitosa, no es una calculadora de costes de IA. Es un recibo de tokens.\" Ejemplo: triage de soporte Un",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-08",
  "datePublished": "2026-07-08",
  "description": "La unidad útil para una factura LLM es una tarea completada, no un millón de tokens. Una calculadora real de 2026 debe contar cada llamada al modelo dentro de la tarea, separar input sin caché de input cacheado, cobrar output aparte, aplicar descuentos batch solo al trabajo async, modelar el routing con tasa de escalado y añadir reintentos más retrabajo humano. El prompt caching suele ser la primera palanca: prefijos estables primero, datos volátiles al final, y tokens cacheados medidos por feature. Las Batch APIs encajan con evals, enrichment y extracción offline, no con UX en vivo. El routing solo ahorra dinero de forma segura cuando un verificador y un eval harness prueban que el camino barato mantuvo la calidad. El self-hosting solo tiene sentido cuando la residencia de datos lo exige o el volumen estable llena la GPU después de contar ops, redundancia y mantenimiento de evals. Optimiza en orden: instrumentar coste por tarea exitosa, cachear, batch, routing, ajustar modelo, comprimir contexto y self-host solo cuando la matemática o governance lo pidan. Las cifras son una foto de julio de 2026; revisa los docs de proveedores antes de presupuestar.",
  "headline": "Calculadora de Costes LLM 2026: Coste por Tarea, No por Token",
  "image": "https://wavect.io/img/blog/headers/header_llm-cost-calculator-2026.svg",
  "inLanguage": "es",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/es/blog/llm-cost-calculator-2026/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/es/blog/llm-cost-calculator-2026/",
  "wordCount": 2392
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/",
      "name": "Inicio",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/overview/",
      "name": "Resumen del blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/topics/ai-agents/",
      "name": "IA y agentes",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/clusters/models-infrastructure/",
      "name": "Modelos e infraestructura",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/llm-cost-calculator-2026/",
      "name": "Calculadora de Costes LLM 2026: Coste por Tarea | ",
      "position": 5
    }
  ]
}
```
