---
title: "Phonely Alma: Review de Coste y Latencia del LLM"
canonical: https://wavect.io/es/blog/phonely-alma-voice-llm-review/
language: es
description: "Review de Phonely Alma: verifica 182 ms TTFT, 206 ms P99, coste de 0,55 USD, límites para agentes de voz y criterios de piloto."
image: "https://wavect.io/img/blog/headers/header_phonely-alma-voice-llm-review.png"
---

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min de lectura · 6 de septiembre de 2026 Última revisión 6 de septiembre de 2026

[**Siguiente**](/es/blog/agent-knowledge-transfer-cheaper-models/)

# Review de Phonely Alma: ¿Está listo el LLM de voz para producción?

Resumen

Alma de Phonely es un modelo especializado para conversaciones telefónicas estructuradas, no un modelo general para programar ni ejecutar agentes de horizonte largo. Phonely reporta 182 ms hasta el primer token, 206 ms de P99, respuestas completas en 379 ms, 0,867 en etiqueta telefónica y 0,55 USD por millón de tokens mixtos en un benchmark de 200 transcripciones medido el 21 de agosto de 2026. Es suficiente para justificar un piloto en citas, soporte, cualificación de leads y otros flujos repetibles. No demuestra superioridad independiente ni latencia percibida de voz a voz porque el proveedor ejecutó y calificó la prueba, usó solicitudes secuenciales y no publicó todos los prompts, transcripciones, jueces, regiones ni condiciones de concurrencia. Compare Alma con el modelo actual en llamadas reales, con acentos, ruido, interrupciones, herramientas, políticas, escalado humano, P95 y P99 de voz a voz, coste por llamada resuelta, condiciones de datos y fallback. Adóptelo solo si mejora el resultado completo.

**Alma es un LLM especializado y prometedor para una tarea concreta: mantener conversaciones telefónicas estructuradas, breves y enfocadas.** Phonely reporta 182 ms hasta el primer token, 206 ms de P99, 379 ms para una respuesta completa y 0,55 USD por millón de tokens mixtos. Merece un piloto de producción, no una migración automática.

Esta review cubre la elección del modelo dentro del stack de voz. Para los componentes vecinos, consulte nuestro [análisis de STT streaming para producción](/es/blog/nvidia-nemotron-3-5-asr-production-review/) y la [comparación entre TTS autoalojado y API](/es/blog/miso-tts-self-hosted-vs-api/). Separar las tres decisiones evita confundir un LLM rápido con una llamada rápida.

## ¿Qué es Phonely Alma?

**Alma es un modelo para flujos telefónicos repetibles, lenguaje hablado y llamadas a herramientas.** Phonely lo propone para citas, soporte, cualificación de leads, cobros, consultas y transferencias. La empresa excluye programación, escritura creativa, trabajo multiagente abierto y planificación de largo horizonte.

La etiqueta «LLM nativo de voz» necesita límites. Alma se factura por tokens de entrada y salida, y Phonely afirma que funciona con componentes existentes de transcripción y síntesis. Trátelo como la etapa LLM salvo que el contrato incluya audio de entrada, audio de salida, detección de turno y telefonía.

## ¿Qué cifras publica Phonely?

| Métrica | Alma | GPT-4.1 | GPT-5.6 | Lectura para compradores |
| --- | --- | --- | --- | --- |
| Tiempo al primer token | 182 ms | 490 ms | 997 ms | Solo la etapa LLM |
| Latencia P99 | 206 ms | 2,02 s | 2,84 s | Buen resultado de cola en esta prueba |
| Respuesta completa | 379 ms | 771 ms | 1,46 s | Sugiere respuestas habladas cortas |
| Etiqueta telefónica | 0,867 | 0,700 | 0,770 | La rúbrica y los jueces importan |
| Coste mixto por 1 M de tokens | 0,55 USD | 3,50 USD | Sin precio | No es el coste total de llamada |

La [página oficial de lanzamiento de Alma](https://www.phonely.ai/alma) indica 200 transcripciones reservadas, prompts y evaluación idénticos, solicitudes secuenciales desde AWS `us-east-1` y cinco calentamientos excluidos. El plan compartido aparece a 0,30 USD por millón de tokens de entrada y 1,30 USD de salida; Priority cuesta 0,50 y 2,10 USD. VPC y on-premises tienen condiciones personalizadas.

Independencia y marcas

Wavect publica esta página y es también un proveedor, así que tenemos un interés comercial en ella. No estamos afiliados a las demás empresas nombradas aquí, no contamos con su respaldo y no somos socios suyos, y todos los nombres de empresa, marcas y marcas registradas de terceros pertenecen a sus respectivos titulares. Las afirmaciones sobre otros proveedores proceden de fuentes públicamente accesibles, sobre todo de sus propias páginas publicadas, en la fecha de revisión indicada en esta página, y pueden haber cambiado desde entonces. Verifícalas directamente antes de decidir. Esta página se ha redactado según nuestro leal saber y entender, con la intención de mantenernos objetivos. Si crees que algo aquí es inexacto o injusto, escríbenos y lo corregimos: [office@wavect.io](mailto:office@wavect.io)

## ¿Qué demuestra el benchmark?

Demuestra que Alma merece una comparación directa en telefonía estructurada. Publicar fecha, región, muestra, comparadores y P99 aporta más que una demo. No demuestra superioridad general. El proveedor ejecutó y calificó la prueba, aparentemente sobre transcripciones y no llamadas de audio completas.

No están públicos todo el conjunto, el prompt, la rúbrica de etiqueta, los jueces, intervalos de confianza, longitudes, estado de caché, nivel de servicio ni perfil concurrente. Las solicitudes secuenciales no describen 50, 500 o 5.000 llamadas simultáneas. La afirmación defendible es que Alma fue más rápido y barato en el benchmark telefónico publicado por Phonely.

## ¿Por qué puede ganar un modelo especializado?

Una introducción larga, una repetición o una confirmación ausente parecen fallos menores en chat. Por teléfono ralentizan o corrompen direcciones, fechas y compromisos. Las herramientas deben coincidir con lo que el agente afirma. Un modelo especializado puede intercambiar conocimiento general por inicios breves, disciplina conversacional, fidelidad al flujo y serving predecible.

Por eso no basta una puntuación académica general. El [diseño abierto de PhoneBench](https://www.pipecat.ai/benchmarks/phonebench-alpha-1) combina estilo telefónico, precisión de herramientas, coherencia entre decir y hacer, grounding, autenticación, escalado y resultado con latencia y coste estimado por minuto.

## Por qué 182 ms no es la espera del usuario

**El tiempo al primer token mide una etapa.** Siguen telefonía, jitter, STT, fin de turno, retrieval, herramientas, TTS y entrega de audio. Mida desde la última muestra audible hasta la transcripción estable, el primer token útil y el primer audio del agente. Informe P50, P95 y P99 de voz a voz, más tiempo de parada y falsos cortes.

El estudio [τ-Voice](https://arxiv.org/abs/2603.13686) combina resultados verificables, interacción full-duplex y audio realista en 278 tareas. En ese entorno, los agentes probados conservaron solo entre el 30 y el 45 por ciento de la capacidad del baseline de texto bajo acentos, ruido y turnos realistas. Un primer token rápido no corrige una herramienta equivocada.

## ¿Cuánto puede ahorrar Alma?

Los 0,55 USD publicados son aproximadamente un 84 por ciento menos que el comparador de 3,50 USD. Con 8.000 tokens mixtos hipotéticos por llamada, serían 0,0044 USD frente a 0,028 USD. La diferencia sería 0,0236 USD por llamada, o 2.360 USD en 100.000 llamadas antes de descuentos.

Es aritmética ilustrativa, no una oferta. El coste completo incluye telefonía, STT, TTS, retrieval, operación y escalados humanos. Use `coste por llamada resuelta = todos los costes + operación + intervención humana / resoluciones aceptadas`. Tokens baratos con más transferencias o reservas erróneas no ahorran.

## Shared, Priority u on-premises

| Ruta | Buen inicio | Pregunta de compra |
| --- | --- | --- |
| API Shared | Evaluación y tráfico variable | ¿Qué P95 y P99 aplican a región, prompt y ráfaga? |
| API Priority | Producción con objetivo de latencia | ¿Qué capacidad y niveles están en contrato? |
| VPC u on-premises | Datos sensibles y control de red | ¿Quién opera actualizaciones, escala, failover e incidentes? |

Solicite DPA, subencargados, regiones, retención, borrado, uso para entrenamiento, cifrado, aislamiento, auditoría, incidentes, política de actualización y salida. Una etiqueta de despliegue no garantiza cumplimiento.

## Scorecard y piloto de producción

- **Resultado:** resolución correcta por tipo de llamada.
- **Herramientas:** herramienta, argumentos y cambio de estado correctos.
- **Conversación:** brevedad, claridad, reparación e interrupción con revisión ciega.
- **Latencia:** P50, P95 y P99 de voz a voz con carga esperada.
- **Política:** autenticación, divulgaciones, escalado y acciones prohibidas.
- **Economía:** coste total por resolución aceptada.
- **Resiliencia:** timeouts, fallos de herramientas, ráfagas y fallback.

1. Elija un flujo limitado, como cambiar una cita o cualificar un lead.
2. Congele entre 200 y 500 escenarios con acentos, ruido, números, pausas y ataques.
3. Mantenga constantes STT, TTS, herramientas, conocimiento, región y telefonía.
4. Evalúe resultados y conversación sin mostrar el nombre del modelo.
5. Pruebe el plan pagado con la concurrencia y las ráfagas previstas.
6. Fuerce errores de herramientas, datos obsoletos, timeouts y fallback.
7. Empiece con shadow traffic y un porcentaje pequeño y reversible de llamadas reales.

## ¿Quién debería probar Alma ahora?

Encaja cuando los flujos son repetibles, la latencia o el coste LLM son materiales, las herramientas tienen estados de éxito claros y el equipo puede medir resultados. Para investigación abierta, planificación larga y troubleshooting amplio, mantenga un modelo general o un router híbrido. Nuestra [guía de gateways y routing LLM](/es/blog/llm-gateway-router-comparison-2026/) cubre esa portabilidad.

## Fuentes y límite de verificación

Capacidades, usos, despliegue, precios y cifras provienen de Phonely. La scorecard se apoya en PhoneBench y τ-Voice. Comprobamos los datos el 6 de septiembre de 2026. Wavect no ejecutó Alma, inspeccionó sus pesos o corpus, verificó los diez millones de llamadas ni reprodujo latencia, etiqueta, disponibilidad, precisión, coste o emisiones. Todo resultado no reproducido es una cifra del proveedor.

## Preguntas frecuentes sobre Phonely Alma

### ¿Qué es Phonely Alma?

Es un modelo especializado para conversaciones telefónicas estructuradas, herramientas y respuestas breves. No está diseñado para programación ni tareas generales largas.

### ¿Alma es speech-to-speech?

La etiqueta voice-native no lo demuestra. Phonely factura tokens y describe uso con STT y TTS existentes. Revise el límite exacto del producto contratado.

### ¿Alma es más rápido que GPT-4.1?

En la prueba del proveedor reportó 182 ms TTFT frente a 490 ms y 206 ms P99 frente a 2,02 segundos. Reprodúzcalo con sus prompts, región, plan, carga y pipeline completo.

### ¿Cuánto cuesta Alma?

El 6 de septiembre de 2026, Shared costaba 0,30 USD de entrada y 1,30 USD de salida por millón de tokens; Priority, 0,50 y 2,10 USD. El benchmark usa 0,55 USD mixtos.

### ¿Qué debe medir el piloto?

Resultado, estado de herramientas, política, calidad de conversación, interrupciones, P50, P95 y P99 de voz a voz, errores, fallback y coste por resolución.

## Reflexiones finales

Alma presenta un argumento sólido a favor de la especialización. Los 182 ms TTFT, 206 ms P99 y 0,55 USD publicados son relevantes, pero justifican un piloto, no un ganador universal.

El comprador necesita latencia de audio completa, éxito de tarea, coherencia de herramientas, interrupciones, política, carga concurrente, condiciones de datos y coste por llamada resuelta. Mantenga STT, LLM y TTS modulares. Envíe tráfico productivo solo cuando una prueba limitada mejore el resultado completo.

## También te puede gustar..

[**Evaluar la etapa speech-to-text** Separe la transcripción estable y el fin de turno del benchmark del LLM.](/es/blog/nvidia-nemotron-3-5-asr-production-review/) [**Evaluar la etapa text-to-speech** Compare TTS gestionado y autoalojado por latencia, privacidad y coste operativo.](/es/blog/miso-tts-self-hosted-vs-api/)

Modelos e infraestructura

## Continúa por este clúster

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

[Empieza por el artículo fundamental**Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights**](/es/blog/self-hosting-llms-eu-cost/)

- [NVIDIA PAIR: Routing de IA Local y la Brecha de AMD](/es/blog/nvidia-pair-amd-rocm-strix-halo/)
- [Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?](/es/blog/tencent-hy4-preview-coding-agent-review/)
- [PageLM: autoalojamiento y uso comercial](/es/blog/pagelm-self-hosted-ai-study-platform/)
- [Mac mini M6 vs Mac Studio M5 para IA local: guía de compra](/es/blog/mac-mini-m6-vs-mac-studio-m5-local-ai/)
- [Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica?](/es/blog/freetoken-ai-inference-engine-review/)

[**Volver**](/es/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/es/team/kevin-riedl/)

[Kevin Riedl](/es/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 min de lectura · 6 de septiembre de 2026 Última revisión 6 de septiembre de 2026

[**Siguiente**](/es/blog/agent-knowledge-transfer-cheaper-models/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/es/blog/phonely-alma-voice-llm-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-06",
      "inLanguage": "es",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-06",
      "url": "https://wavect.io/es/blog/phonely-alma-voice-llm-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Alma de Phonely es un modelo especializado para conversaciones telefónicas estructuradas, no un modelo general para programar ni ejecutar agentes de horizonte largo. Phonely reporta 182 ms hasta el primer token, 206 ms de P99, respuestas completas en 379 ms, 0,867 en etiqueta telefónica y 0,55 USD por millón de tokens mixtos en un benchmark de 200 transcripciones medido el 21 de agosto de 2026. Es suficiente para justificar un piloto en citas, soporte, cualificación de leads y otros flujos repetibles. No demuestra superioridad independiente ni latencia percibida de voz a voz porque el proveedor ejecutó y calificó la prueba, usó solicitudes secuenciales y no publicó todos los prompts, transcripciones, jueces, regiones ni condiciones de concurrencia. Compare Alma con el modelo actual en llamadas reales, con acentos, ruido, interrupciones, herramientas, políticas, escalado humano, P95 y P99 de voz a voz, coste por llamada resuelta, condiciones de datos y fallback. Adóptelo solo si mejora el resultado completo.",
  "articleBody": " Resumen del blog/IA y agentes/Modelos e infraestructura Review de Phonely Alma: ¿Está listo el LLM de voz para producción? Resumen Alma de Phonely es un modelo especializado para conversaciones telefónicas estructuradas, no un modelo general para programar ni ejecutar agentes de horizonte largo. Phonely reporta 182 ms hasta el primer token, 206 ms de P99, respuestas completas en 379 ms, 0,867 en etiqueta telefónica y 0,55 USD por millón de tokens mixtos en un benchmark de 200 transcripciones medido el 21 de agosto de 2026. Es suficiente para justificar un piloto en citas, soporte, cualificación de leads y otros flujos repetibles. No demuestra superioridad independiente ni latencia percibida de voz a voz porque el proveedor ejecutó y calificó la prueba, usó solicitudes secuenciales y no publicó todos los prompts, transcripciones, jueces, regiones ni condiciones de concurrencia. Compare Alma con el modelo actual en llamadas reales, con acentos, ruido, interrupciones, herramientas, políticas, escalado humano, P95 y P99 de voz a voz, coste por llamada resuelta, condiciones de datos y fallback. Adóptelo solo si mejora el resultado completo. Alma es un LLM especializado y prometedor para una tarea concreta: mantener conversaciones telefónicas estructuradas, breves y enfocadas. Phonely reporta 182 ms hasta el primer token, 206 ms de P99, 379 ms para una respuesta completa y 0,55 USD por millón de tokens mixtos. Merece un piloto de producción, no una migración automática. Esta review cubre la elección del modelo dentro del stack de voz. Para los componentes vecinos, consulte nuestro análisis de STT streaming para producción y la comparación entre TTS autoalojado y API. Separar las tres decisiones evita confundir un LLM rápido con una llamada rápida. ¿Qué es Phonely Alma? Alma es un modelo para flujos telefónicos repetibles, lenguaje hablado y llamadas a herramientas. Phonely lo propone para citas, soporte, cualificación de leads, cobros, consultas y transferencias. La empresa excluye programación, escritura creativa, trabajo multiagente abierto y planificación de largo horizonte. La etiqueta «LLM nativo de voz» necesita límites. Alma se factura por tokens de entrada y salida, y Phonely afirma que funciona con componentes existentes de transcripción y síntesis. Trátelo como la etapa LLM salvo que el contrato incluya audio de entrada, audio de salida, detección de turno y telefonía. ¿Qué cifras publica Phonely? Benchmark del proveedor medido el 21 de agosto de 2026 MétricaAlmaGPT-4.1GPT-5.6Lectura para compradores Tiempo al primer token182 ms490 ms997 msSolo la etapa LLM Latencia P99206 ms2,02 s2,84 sBuen resultado de cola en esta prueba Respuesta completa379 ms771 ms1,46 sSugiere respuestas habladas cortas Etiqueta telefónica0,8670,7000,770La rúbrica y los jueces importan Coste mixto por 1 M de tokens0,55 USD3,50 USDSin precioNo es el coste total de llamada La página oficial de lanzamiento de Alma indica 200 transcripciones reservadas, prompts y evaluación idénticos, solicitudes secuenciales desde AWS us-east-1 y cinco calentamientos excluidos. El plan compartido aparece a 0,30 USD por millón de tokens de entrada y 1,30 USD de salida; Priority cuesta 0,50 y 2,10 USD. VPC y on-premises tienen condiciones personalizadas. Independencia y marcas Wavect publica esta página y es también un proveedor, así que tenemos un interés comercial en ella. No estamos afiliados a las demás empresas nombradas aquí, no contamos con su respaldo y no somos socios suyos, y todos los nombres de empresa, marcas y marcas registradas de terceros pertenecen a sus respectivos titulares. Las afirmaciones sobre otros proveedores proceden de fuentes públicamente accesibles, sobre todo de sus propias páginas publicadas, en la fecha de revisión indicada en esta página, y pueden haber cambiado desde entonces. Verifícalas directamente antes de decidir. Esta página se ha redactado según nuestro leal saber y entender, con la intención de mantenernos objetivos. Si crees que algo aquí es inexacto o injusto, escríbenos y lo corregimos: office@wavect.io ¿Qué demuestra el benchmark? Demuestra que Alma merece una comparación directa en telefonía estructurada. Publicar fecha, región, muestra, comparadores y P99 aporta más que una demo. No demuestra superioridad general. El proveedor ejecutó y calificó la prueba, aparentemente sobre transcripciones y no llamadas de audio completas. No están públicos todo el conjunto, el prompt, la rúbrica de etiqueta, los jueces, intervalos de confianza, longitudes, estado de caché, nivel de servicio ni perfil concurrente. Las solicitudes secuenciales no describen 50, 500 o 5.000 llamadas simultáneas. La afirmación defendible es que Alma fue más rápido y barato en el benchmark telefónico publicado por Phonely. ¿Por qué puede ganar un modelo especializado? Una introducción larga, una repetición o una confirmación ausente parecen fallos menores en chat. Por teléfono ralentizan o corrompen direcciones, fechas y compromisos. Las",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "página oficial de lanzamiento de Alma",
      "url": "https://www.phonely.ai/alma"
    },
    {
      "@type": "WebPage",
      "name": "diseño abierto de PhoneBench",
      "url": "https://www.pipecat.ai/benchmarks/phonebench-alpha-1"
    },
    {
      "@type": "WebPage",
      "name": "τ-Voice",
      "url": "https://arxiv.org/abs/2603.13686"
    }
  ],
  "dateModified": "2026-09-06",
  "datePublished": "2026-09-06",
  "description": "Alma de Phonely es un modelo especializado para conversaciones telefónicas estructuradas, no un modelo general para programar ni ejecutar agentes de horizonte largo. Phonely reporta 182 ms hasta el primer token, 206 ms de P99, respuestas completas en 379 ms, 0,867 en etiqueta telefónica y 0,55 USD por millón de tokens mixtos en un benchmark de 200 transcripciones medido el 21 de agosto de 2026. Es suficiente para justificar un piloto en citas, soporte, cualificación de leads y otros flujos repetibles. No demuestra superioridad independiente ni latencia percibida de voz a voz porque el proveedor ejecutó y calificó la prueba, usó solicitudes secuenciales y no publicó todos los prompts, transcripciones, jueces, regiones ni condiciones de concurrencia. Compare Alma con el modelo actual en llamadas reales, con acentos, ruido, interrupciones, herramientas, políticas, escalado humano, P95 y P99 de voz a voz, coste por llamada resuelta, condiciones de datos y fallback. Adóptelo solo si mejora el resultado completo.",
  "headline": "Review de Phonely Alma: ¿Está listo el LLM de voz para producción?",
  "image": "https://wavect.io/img/blog/headers/header_phonely-alma-voice-llm-review.svg",
  "inLanguage": "es",
  "keywords": "IA de voz, Evaluación de LLM",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/es/blog/phonely-alma-voice-llm-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/es/blog/phonely-alma-voice-llm-review/",
  "wordCount": 1886
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/",
      "name": "Inicio",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/overview/",
      "name": "Resumen del blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/topics/ai-agents/",
      "name": "IA y agentes",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/clusters/models-infrastructure/",
      "name": "Modelos e infraestructura",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/es/blog/phonely-alma-voice-llm-review/",
      "name": "Phonely Alma: Review de Coste y Latencia del LLM",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es un modelo especializado para conversaciones telefónicas estructuradas, herramientas y respuestas breves. No está diseñado para programación ni tareas generales largas."
      },
      "name": "¿Qué es Phonely Alma?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "La etiqueta voice-native no lo demuestra. Phonely factura tokens y describe uso con STT y TTS existentes. Revise el límite exacto del producto contratado."
      },
      "name": "¿Alma es speech-to-speech?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "En la prueba del proveedor reportó 182 ms TTFT frente a 490 ms y 206 ms P99 frente a 2,02 segundos. Reprodúzcalo con sus prompts, región, plan, carga y pipeline completo."
      },
      "name": "¿Alma es más rápido que GPT-4.1?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "El 6 de septiembre de 2026, Shared costaba 0,30 USD de entrada y 1,30 USD de salida por millón de tokens; Priority, 0,50 y 2,10 USD. El benchmark usa 0,55 USD mixtos."
      },
      "name": "¿Cuánto cuesta Alma?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Resultado, estado de herramientas, política, calidad de conversación, interrupciones, P50, P95 y P99 de voz a voz, errores, fallback y coste por resolución."
      },
      "name": "¿Qué debe medir el piloto?"
    }
  ]
}
```
