Volver
Kevin Riedl

9 min de lectura · 02 Jul 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Más barato por token todavía puede ser más caro por tarea

Artificial Analysis calculó Claude Sonnet 5 con la tarifa estándar futura anunciada originalmente, 3 dólares por millón de tokens de entrada y 15 por millón de salida. Con esa base, su ejecución del Intelligence Index costó unos 2,29 dólares por tarea, frente a unos 1,99 para Opus 4.8. El benchmark excluyó expresamente el precio promocional de Sonnet 5 (1).

La comparación histórica es útil, pero ya no es la comparación de precios actual. Anthropic convirtió después en permanentes las tarifas introductorias de 2 dólares para entrada y 10 para salida. Aplicar proporcionalmente esa reducción de un tercio a la estimación publicada da unos 1,53 dólares por tarea, por debajo de la cifra citada de Opus 4.8. Es una ilustración aritmética, no una nueva ejecución del benchmark.

Una cifra por millón de tokens todavía omite la pregunta que decide la factura: ¿cuántos tokens facturados y operaciones de herramientas usa el modelo para llegar a un resultado aceptable?

Un modelo que razona dando vueltas no es barato. Es barato al empezar.

Para elegir un modelo, compara el coste total por tarea completada, no solo el precio de etiqueta por token.

La cifra que nadie pone en precio: tokens-hasta-la-respuesta

El precio por millón de tokens es la etiqueta del escaparate. Te dice la tarifa. No te dice nada sobre cuánto conduce el modelo hasta llegar al destino.

Detrás de una sola llamada a la API se esconden dos costes:

  • El precio unitario. Dólares por millón de tokens de entrada y de salida. Es lo que anuncia cada página de precios.
  • La ruta de uso. Entrada, entrada en caché, salida y tokens de pensamiento, además de turnos repetidos y herramientas de servidor con precio separado.

Tu factura combina las tarifas aplicables con el uso medido y las operaciones con precio separado. Artificial Analysis llama a su medida coste por tarea: el coste ponderado medio de tokens para completar una tarea del Intelligence Index. Respuestas más largas o más tokens de razonamiento elevan ese coste con precios por token idénticos (2).

Recorta el precio unitario un 40 por ciento y deja que el consumo de tokens suba más que eso, y habrás hecho que el modelo parezca más barato mientras lo vuelves más caro.

Lo que de verdad pasó con Sonnet 5

El lanzamiento de Sonnet 5 es un caso útil porque la respuesta cambia con el precio que realmente se aplica.

En el lanzamiento, Anthropic anunció 2 dólares por millón de tokens de entrada y 10 por millón de salida hasta el 31 de agosto de 2026, con una subida prevista a 3 y 15. Anthropic canceló después esa subida. El 2 de septiembre de 2026, Sonnet 5 seguía en 2 y 10, mientras Opus 4.8 estaba en 5 y 25 (3). Por tanto, Sonnet 5 es un 60 por ciento más barato tanto en entrada base como en salida.

Luego lo ejecutas. Artificial Analysis descubrió que, con el máximo esfuerzo de razonamiento, Sonnet 5 usó cerca de un 40 por ciento más de tokens de salida por tarea del Intelligence Index que Sonnet 4.6, y aproximadamente el triple de turnos agénticos. En las evaluaciones de trabajo de conocimiento quemó alrededor de seis veces más turnos con el máximo esfuerzo que con el esfuerzo bajo. Las mejoras de rendimiento llegaron a través de cadenas de razonamiento más largas y más llamadas a herramientas, no a través de la eficiencia (1).

Súmale un segundo cambio: Anthropic dice que Claude 4.7 y posteriores usan un tokenizador nuevo que genera aproximadamente un 30 por ciento más de tokens para el mismo texto que modelos anteriores, aunque el aumento exacto depende del contenido y la carga (3). Vuelve a contar los prompts reales para el modelo previsto en lugar de aplicar ese 30 por ciento a ciegas.

La lección corregida no es que Sonnet 5 sea actualmente más caro que Opus 4.8. La clasificación por tarea depende del uso observado y del precio realmente vigente. El mismo consumo de benchmark puede cambiar de posición cuando una promoción se vuelve permanente.

Kevin Riedl

"Un precio unitario más barato en un modelo que razona dando vueltas no es un descuento. Es una factura aplazada. Los equipos que ganan leen todo el recibo, no el precio de la estantería."

Las cifras se comprobaron el 2 de septiembre de 2026. La estimación de 2,29 dólares de Artificial Analysis usó las tarifas previstas de 3 y 15 dólares, mientras el precio estándar actual de Anthropic es 2 y 10 dólares. Tu carga no es la batería del benchmark, así que mídela directamente.

Por qué los modelos de razonamiento rompen el precio de etiqueta

No es específico de Sonnet. Es una cuestión general de medición para modelos y agentes cuya cantidad de pensamiento y uso de herramientas puede variar.

La documentación de precios de Anthropic factura el uso de herramientas mediante tokens de entrada y salida y puede añadir cargos por herramientas de servidor. El control de esfuerzo afecta al texto, las llamadas a herramientas y el pensamiento, por lo que un nivel mayor puede cambiar capacidad y gasto (3, 5). Los bloques de pensamiento y herramientas son observables en respuestas API cuando el producto los expone, y no deben describirse como trabajo invisible.

Así que un modelo puede ser:

  • Más barato por token y más caro por tarea, porque piensa durante más tiempo.
  • Más caro por token y más barato por tarea, porque llega a la respuesta en una sola pasada en lugar de en cinco.

El precio de etiqueta y el coste real no son solo cifras distintas. Pueden apuntar en direcciones opuestas.

Coste por tarea, definido

Si te llevas una sola métrica de este artículo, llévate esta.

El coste por tarea completada es el gasto total, a través de cada token y cada turno, para dejar una tarea real hecha a tu nivel de calidad. No por token. No por petición. Por respuesta terminada y aceptable.

Captura lo que el precio de etiqueta esconde:

  • Tokens de pensamiento. Salida facturada para razonar cuando el proveedor la expone o contabiliza.
  • Longitud de la salida. Un modelo verboso factura más incluso con la misma tarifa.
  • Turnos agénticos y herramientas. Más turnos consumen tokens y algunas herramientas de servidor tienen cargos propios.
  • Reintentos. Las respuestas erróneas que tienes que volver a ejecutar no son gratis.
  • Deriva del tokenizador. El mismo texto puede contar como más tokens en un modelo más nuevo.

Un modelo que es barato al empezar y caro al terminar suspende esta medida. Ese es todo el sentido de usarla.

¿Quieres una lectura directa sobre qué modelo es de verdad el más barato para tu carga de trabajo?

 Book Free Consultation

Cómo medir el coste por tarea completada

No necesitas un laboratorio de investigación. Necesitas tus propias tareas y una balanza. Este es el proceso que seguimos antes de recomendar un modelo a un cliente.

  1. Define la tarea y el nivel de calidad. No "resume esto", sino "produce un resumen que pase esta rúbrica". Una tarea solo está completa cuando cumple el nivel, de lo contrario el reintento forma parte del coste.
  2. Construye un pequeño conjunto de evaluación con trabajo real. De veinte a cincuenta tareas representativas pueden ser un punto de partida práctico. Los benchmarks públicos dan contexto, pero no son tu carga.
  3. Ejecuta cada modelo candidato hasta completar la tarea. Las mismas tareas, la misma configuración que llevarías a producción. Deja que razone, llame a herramientas y reintente como lo hará en producción.
  4. Cuenta el uso hasta terminar. Registra entrada sin caché, escrituras y lecturas de caché, salida, pensamiento, cada turno y herramientas con precio separado. El endpoint de conteo de Anthropic estima la entrada, pero el uso real de la respuesta y la factura siguen siendo el registro de cobro (4).
  5. Pon precio a todo el recorrido, incluidos los fallos. Multiplica los tokens por la tarifa real, suma el coste de los reintentos en las tareas que el modelo hizo mal a la primera. Ese total, dividido por las tareas completadas, es tu coste por tarea completada.

La clasificación puede invertirse. Un modelo con mayor tarifa por token puede costar menos al terminar, mientras otro con tarifa menor puede generar más uso facturable.

Qué significa esto para la elección de modelo

La lección no es "elige siempre el modelo caro". Es "deja de elegir por la etiqueta".

Algunas reglas con las que trabajamos:

  • Ajusta el modelo a la tarea, no a la lista de precios. Un modelo capaz que responde en una sola pasada puede ser más barato por tarea que uno más débil que da vueltas. Dirige el trabajo simple y de alto volumen a modelos baratos y el trabajo difícil y ambiguo a los fuertes. Escribimos el manual completo de enrutamiento en cómo reducir los costes de tokens de LLM en 2026.
  • Ajusta el dial del esfuerzo. Anthropic describe el esfuerzo como una señal de comportamiento, no como un presupuesto estricto de tokens. Los niveles menores suelen intercambiar algo de capacidad por eficiencia. Prueba los niveles admitidos en tu evaluación en vez de suponer que el máximo es mejor (5).
  • Vigila turnos y herramientas, no solo la salida. Las llamadas extra pueden añadir costes de entrada, salida y herramientas. Un modelo con menos turnos puede costar menos incluso con una tarifa de tokens mayor.
  • Vuelve a correr los números cuando un modelo se actualice. Una versión nueva puede cambiar el tokenizador y el comportamiento de razonamiento a la vez, como hizo Sonnet 5. El ranking de costes del trimestre pasado no es el de este trimestre.

El precio por token es la cifra de marketing. El coste por tarea completada es la cifra que aterriza en tu factura. Optimiza la que de verdad pagas.

Reflexiones finales

La comparación original de Sonnet 5 usó una subida prevista que Anthropic canceló después. Con la tarifa estándar actual, el consumo publicado ya no respalda que Sonnet 5 cueste más por tarea que Opus 4.8. La corrección refuerza el método: el coste total por tarea completada debe usar precios actuales y uso observado.

Mide tu umbral de calidad, tokens, categorías de caché, turnos, herramientas, reintentos y fallos. Repite el cálculo cuando cambien el modelo, tokenizador, precio o flujo de trabajo.

References

  1. Artificial Analysis (2026): Claude Sonnet 5 costó unos 2,29 dólares por tarea del Intelligence Index con la tarifa prevista de 3/15, frente a 1,99 para Opus 4.8; se excluyó el precio promocional. Fuente (Consultado: 2 de septiembre de 2026).
  2. Artificial Analysis: metodología y definición del coste medio ponderado por tarea del Intelligence Index. Fuente (Consultado: 2 de septiembre de 2026).
  3. Anthropic: precios actuales, 2/10 dólares permanentes para Sonnet 5 tras cancelar la subida a 3/15, costes de herramientas y aproximadamente un 30 por ciento más de tokens con el tokenizador nuevo. Fuente (Consultado: 2 de septiembre de 2026).
  4. Anthropic: el endpoint de conteo estima tokens de entrada, incluidas herramientas, y admite modelos activos; la facturación real puede variar ligeramente. Fuente (Consultado: 2 de septiembre de 2026).
  5. Anthropic: Effort afecta texto, llamadas a herramientas y pensamiento; es una señal de comportamiento y no un presupuesto estricto de tokens. Fuente (Consultado: 2 de septiembre de 2026).

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

9 min de lectura · 02 Jul 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.