---
title: "Phonely Alma im Test: Kosten & Voice-LLM-Latenz"
canonical: https://wavect.io/de/blog/phonely-alma-voice-llm-review/
language: de
description: "Phonely Alma im Test: 182 ms TTFT, 206 ms P99, 0,55 USD Tokenkosten, Grenzen für Voice Agents und messbare Kriterien für den Pilot."
image: "https://wavect.io/img/blog/headers/header_phonely-alma-voice-llm-review.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 Min Lesezeit · 6. September 2026 Zuletzt geprüft 6. September 2026

[**Weiter**](/de/blog/agent-knowledge-transfer-cheaper-models/)

# Phonely Alma im Test: Ist das Voice-LLM produktionsreif?

TL;DR

Phonelys Alma ist ein spezialisiertes Sprachmodell für strukturierte Telefonate, kein allgemeines Modell für Coding oder lang laufende Agents. Phonely meldet in einem Benchmark mit 200 Transkripten vom 21. August 2026 eine Time to First Token von 182 ms, 206 ms P99, vollständige Antworten in 379 ms, einen Telefonetikette-Score von 0,867 und 0,55 USD pro gemischter Million Tokens. Damit verdient Alma einen Pilot für Terminplanung, Support, Lead-Qualifizierung und andere wiederholbare Gesprächsabläufe. Unabhängige Überlegenheit oder echte Voice-to-Voice-Latenz sind damit nicht belegt: Der Anbieter führte und bewertete den Test selbst, nutzte sequenzielle Requests und veröffentlicht nicht alle Prompts, Transkripte, Judges, Regionen oder Concurrency-Bedingungen. Vergleicht Alma auf echten Calls mit dem bisherigen Modell. Messt Akzente, Lärm, Unterbrechungen, Tool Calls, Policy-Treue, Eskalation, P95 und P99 von Stimme zu Stimme, Kosten pro erfolgreichem Gespräch, Datenbedingungen und Fallback. Übernehmt es nur bei besserem Gesamtergebnis.

**Alma ist ein glaubwürdiges Spezial-LLM für eine enge Aufgabe: strukturierte Telefonate schnell, knapp und auf Kurs zu halten.** Phonely meldet 182 ms bis zum ersten Token, 206 ms P99, 379 ms für eine vollständige Antwort und 0,55 USD pro gemischter Million Tokens. Das rechtfertigt einen Produktionspilot, aber keinen automatischen Wechsel.

Dieser Test gehört zur Modellauswahl im Voice-Agent-Stack. Für die angrenzenden Komponenten gibt es unseren [Produktionscheck für Streaming Speech-to-Text](/de/blog/nvidia-nemotron-3-5-asr-production-review/) und die [Analyse von Self-Hosted versus API bei Text-to-Speech](/de/blog/miso-tts-self-hosted-vs-api/). So wird ein schneller LLM-Benchmark nicht mit einem schnellen Telefonat verwechselt.

## Was ist Phonely Alma?

**Alma ist ein Sprachmodell für wiederholbare Telefonabläufe, gesprochene Formulierungen und Tool Calls.** Phonely positioniert es für Terminbuchung, Support, Lead-Qualifizierung, Forderungseinzug, Nachschlagen und Weiterleitung. Coding, kreatives Schreiben, offene Multi-Agent-Aufgaben und lange Planung nennt das Unternehmen ausdrücklich als ungeeignet.

Der Begriff „Voice-Native LLM“ braucht eine Grenze. Alma wird nach Input- und Output-Tokens verrechnet und funktioniert laut Anbieter mit bestehenden Transkriptions- und Sprachgenerierungs-Komponenten. Behandelt es als LLM-Stufe, solange der Vertrag nicht Audioeingabe, Audioausgabe, Turn Detection und Telefonie umfasst.

## Welche Zahlen veröffentlicht Phonely?

| Kennzahl | Alma | GPT-4.1 | GPT-5.6 | Einordnung |
| --- | --- | --- | --- | --- |
| Time to First Token | 182 ms | 490 ms | 997 ms | LLM-Stufe, nicht Gesamtgespräch |
| P99-Antwortlatenz | 206 ms | 2,02 s | 2,84 s | Starkes Tail-Ergebnis im Test |
| Vollständige Antwort | 379 ms | 771 ms | 1,46 s | Hinweis auf kurze Antworten |
| Telefonetikette | 0,867 | 0,700 | 0,770 | Rubrik und Judges nicht vollständig öffentlich |
| Gemischte Kosten pro 1 Mio. Tokens | 0,55 USD | 3,50 USD | Nicht angegeben | Nicht die Gesamtkosten eines Calls |

Die [offizielle Alma-Launch-Seite](https://www.phonely.ai/alma) nennt 200 zurückgehaltene Gesprächstranskripte, identische Prompts und Bewertung, sequenzielle Requests von AWS `us-east-1` sowie fünf ausgeschlossene Warm-ups. Shared kostet dort 0,30 USD pro Million Input- und 1,30 USD pro Million Output-Tokens. Priority kostet 0,50 und 2,10 USD. VPC und On-Premises sind individuell.

Unabhängigkeit und Marken

Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: [office@wavect.io](mailto:office@wavect.io)

## Was beweist der Benchmark und was nicht?

Alma verdient einen direkten Test für strukturierte Telefonarbeit. Datum, Region, Stichprobe, Vergleichsmodelle und mehrere Latenzwerte sind benannt. P99 ist wertvoll, weil ein langes Schweigen einem Call stärker schaden kann als ein guter Median hilft.

Allgemeine Überlegenheit folgt daraus nicht. Der Anbieter führte und bewertete den Test selbst. Offenbar wurden Transkripte statt kompletter Live-Audio-Calls verwendet. Vollständiger Datensatz, Prompt, Telefonetikette-Rubrik, Judges, Konfidenzintervalle, Request-Längen, Cache-Zustand, Tarif und Concurrency fehlen öffentlich. Belastbar ist: schneller und günstiger in Phonelys veröffentlichtem Telefon-Benchmark.

## Warum kann Spezialisierung am Telefon gewinnen?

Lange Einleitungen, Wiederholungen und fehlende Bestätigungen wirken im Chat harmlos, am Telefon aber langsam oder unnatürlich. Adressen, Zahlen und Termine brauchen knappe Reparaturen. Tool Calls müssen mit dem Gesagten und dem Geschäftssystem übereinstimmen. Ein Spezialmodell kann breite Wissensarbeit gegen kurze Starts, Gesprächsdisziplin, Flow-Treue und planbares Serving tauschen.

Darum reichen allgemeine Scores nicht. Das [offene PhoneBench-Evaluierungsdesign](https://www.pipecat.ai/benchmarks/phonebench-alpha-1) verbindet Telefonstil, Tool-Call-Genauigkeit, Konsistenz zwischen Aussage und Handlung, Faktenbindung, Authentifizierung, Eskalation und Ergebnis mit Latenz und geschätzten Kosten pro Minute.

## Warum sind 182 ms nicht die Wartezeit des Anrufers?

**Time to First Token misst nur die LLM-Stufe.** Telefonie, Jitter, STT, End-of-Turn, Retrieval, Tools, TTS und Audioausgabe bleiben. Messt vom letzten hörbaren Nutzersample bis zum stabilen Transkript, weiter bis zum ersten brauchbaren Token, dann bis zum ersten hörbaren Agent-Ton. Berichtet Voice-to-Voice P50, P95 und P99 sowie Stopplatenz bei Unterbrechungen.

Die [τ-Voice-Studie](https://arxiv.org/abs/2603.13686) verbindet überprüfbare Aufgabenerfüllung, Full-Duplex und realistisches Audio in 278 Aufgaben. In diesem Setup behielten getestete Voice Agents bei Akzenten, Lärm und Turn-Taking nur 30 bis 45 Prozent der Fähigkeit der Text-Baseline. Ein schneller erster Token repariert keinen falschen Tool Call.

## Wie viel kann Alma sparen?

0,55 USD liegen rund 84 Prozent unter dem veröffentlichten Vergleich von 3,50 USD. Bei hypothetischen 8.000 gemischten Tokens pro Call wären es 0,0044 USD gegenüber 0,028 USD. Die Differenz beträgt 0,0236 USD pro Call oder 2.360 USD bei 100.000 Calls vor Rabatten.

Das ist Beispielrechnung, kein Angebot. Zum Call gehören auch Telefonie, STT, TTS, Retrieval, Betrieb und menschliche Eskalation. Nutzt `Kosten pro gelöstem Call = alle Kosten + Betrieb + menschliche Bearbeitung / akzeptierte Lösungen`. Günstige Tokens mit mehr Transfers oder Fehlbuchungen sind kein Gewinn.

## Shared, Priority oder On-Premises?

| Pfad | Guter Start | Kauffrage |
| --- | --- | --- |
| Shared API | Evaluation und schwankender Traffic | Welche P95 und P99 gelten für Region, Prompt und Burst? |
| Priority API | Produktion mit Latenzziel | Welche Kapazität und Servicewerte sind vertraglich? |
| VPC oder On-Premises | Datensensibilität und Netzwerkkontrolle | Wer betreibt Updates, Skalierung, Failover und Incidents? |

Fordert DPA, Subprozessoren, Regionen, Aufbewahrung, Löschung, Trainingsnutzung, Verschlüsselung, Tenant-Isolation, Audit Logs, Incident-Fristen, Update-Politik und Exit-Pfad an. Ein Deployment-Label allein ist keine Compliance.

## Produktions-Scorecard und Pilot

- **Ergebnis:** richtige Lösungsrate je Call-Typ, nicht nur Antwortqualität.
- **Tools:** korrektes Tool, Argumente und bestätigter State Change.
- **Gespräch:** blind bewertete Kürze, Klarheit, Reparatur und Unterbrechung.
- **Latenz:** Voice-to-Voice P50, P95 und P99 unter erwarteter Last.
- **Policy:** Authentifizierung, Pflichtangaben, Eskalation und verbotene Aktionen.
- **Kosten:** Gesamtkosten pro akzeptierter Lösung.
- **Resilienz:** Timeouts, Tool-Fehler, Burst und getesteter Fallback.

1. Einen begrenzten Flow wie Terminänderung oder Qualifizierung wählen.
2. 200 bis 500 reale Szenarien inklusive Akzenten, Lärm, Zahlen, Pausen und Angriffen einfrieren.
3. STT, TTS, Tools, Wissen, Region und Telefonie konstant halten.
4. Ergebnisse und Gespräch ohne sichtbaren Modellnamen bewerten.
5. Den bezahlten Tarif mit erwarteter Parallelität und Lastspitzen testen.
6. Tool-Ausfälle, veraltete Daten, Timeouts und Rückfallpfad erzwingen.
7. Mit Shadow Traffic beginnen und nur einen kleinen Live-Anteil reversibel routen.

## Wer sollte Alma jetzt testen?

Ein Pilot passt bei wiederholbaren Gesprächsabläufen, relevanter LLM-Latenz oder Modellkosten, klaren Tool-Erfolgszuständen und einem messenden Team. Für offene Recherche, lange Planung und breite Fehlersuche bleibt ein Generalistenmodell oder hybrides Routing sinnvoll. Unser [Guide zu LLM Gateways und Routing](/de/blog/llm-gateway-router-comparison-2026/) behandelt diese Portabilität.

## Quellen und Prüfgrenze

Funktionen, Use Cases, Deployment, Preise und Benchmark-Zahlen stammen von Phonely. Die Scorecard orientiert sich an PhoneBench und τ-Voice. Die Angaben wurden am 6. September 2026 geprüft. Wavect hat Alma nicht ausgeführt, Gewichte oder Trainingskorpus nicht eingesehen, die gemeldeten zehn Millionen Calls nicht verifiziert und Latenz, Etikette, Uptime, Genauigkeit, Kosten oder CO2-Claims nicht reproduziert. Nicht reproduzierte Ergebnisse sind Anbieterangaben.

## Häufige Fragen zu Phonely Alma

### Was ist Phonely Alma?

Alma ist ein Spezialmodell für strukturierte Telefonate, Tool Calls und knappe Gesprächsführung. Es ist nicht für Coding oder lange allgemeine Agent-Aufgaben gedacht.

### Ist Alma Speech-to-Speech?

Das folgt nicht aus dem Voice-Native-Label. Phonely verrechnet Text-Tokens und beschreibt die Nutzung mit bestehendem STT und TTS. Prüft die konkrete Produktgrenze.

### Ist Alma schneller als GPT-4.1?

Im Anbieter-Test meldete Alma 182 ms TTFT gegenüber 490 ms und 206 ms P99 gegenüber 2,02 Sekunden. Reproduziert das mit euren Prompts, Region, Tarif, Last und kompletter Call-Kette.

### Was kostet Alma?

Am 6. September 2026 kostete Shared 0,30 USD Input und 1,30 USD Output pro Million Tokens, Priority 0,50 und 2,10 USD. Der Benchmark nennt 0,55 USD gemischt.

### Was muss ein Pilot messen?

Messt Call-Ergebnis, Tool-State, Policy, Gespräch, Unterbrechung, Voice-to-Voice P50, P95 und P99, Fehler, Fallback und Kosten pro Lösung.

## Fazit

Alma liefert ein starkes Argument für Spezialisierung. Die veröffentlichten 182 ms TTFT, 206 ms P99 und 0,55 USD gemischter Tokenpreis sind relevant. Sie tragen einen Pilot, keinen universellen Sieger.

Käufer brauchen komplette Audio-Latenz, Task-Erfolg, Tool-State, Unterbrechungsqualität, Policy-Treue, Lastverhalten, Datenbedingungen und Kosten pro gelöstem Call. Haltet STT, LLM und TTS modular. Routet erst dann produktiv, wenn ein begrenzter Test das Gesamtergebnis verbessert.

## Das könnte dich auch interessieren..

[**Speech-to-Text getrennt bewerten** Trenne stabiles Transkript und End-of-Turn-Latenz vom LLM-Benchmark.](/de/blog/nvidia-nemotron-3-5-asr-production-review/) [**Text-to-Speech getrennt bewerten** Vergleiche Managed und Self-Hosted TTS nach Latenz, Datenschutz und Betriebskosten.](/de/blog/miso-tts-self-hosted-vs-api/)

Modelle und Infrastruktur

## In diesem Cluster weiterlesen

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

[Mit dem Grundlagenartikel starten**LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen**](/de/blog/self-hosting-llms-eu-cost/)

- [NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke](/de/blog/nvidia-pair-amd-rocm-strix-halo/)
- [Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?](/de/blog/tencent-hy4-preview-coding-agent-review/)
- [PageLM im Check: Selbst hosten und kommerziell nutzen](/de/blog/pagelm-self-hosted-ai-study-platform/)
- [M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung](/de/blog/mac-mini-m6-vs-mac-studio-m5-local-ai/)
- [FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?](/de/blog/freetoken-ai-inference-engine-review/)

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 Min Lesezeit · 6. September 2026 Zuletzt geprüft 6. September 2026

[**Weiter**](/de/blog/agent-knowledge-transfer-cheaper-models/)

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/phonely-alma-voice-llm-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-09-06",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-09-06",
      "url": "https://wavect.io/de/blog/phonely-alma-voice-llm-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Phonelys Alma ist ein spezialisiertes Sprachmodell für strukturierte Telefonate, kein allgemeines Modell für Coding oder lang laufende Agents. Phonely meldet in einem Benchmark mit 200 Transkripten vom 21. August 2026 eine Time to First Token von 182 ms, 206 ms P99, vollständige Antworten in 379 ms, einen Telefonetikette-Score von 0,867 und 0,55 USD pro gemischter Million Tokens. Damit verdient Alma einen Pilot für Terminplanung, Support, Lead-Qualifizierung und andere wiederholbare Gesprächsabläufe. Unabhängige Überlegenheit oder echte Voice-to-Voice-Latenz sind damit nicht belegt: Der Anbieter führte und bewertete den Test selbst, nutzte sequenzielle Requests und veröffentlicht nicht alle Prompts, Transkripte, Judges, Regionen oder Concurrency-Bedingungen. Vergleicht Alma auf echten Calls mit dem bisherigen Modell. Messt Akzente, Lärm, Unterbrechungen, Tool Calls, Policy-Treue, Eskalation, P95 und P99 von Stimme zu Stimme, Kosten pro erfolgreichem Gespräch, Datenbedingungen und Fallback. Übernehmt es nur bei besserem Gesamtergebnis.",
  "articleBody": " Blog-Übersicht/AI und Agents/Modelle und Infrastruktur Phonely Alma im Test: Ist das Voice-LLM produktionsreif? TL;DR Phonelys Alma ist ein spezialisiertes Sprachmodell für strukturierte Telefonate, kein allgemeines Modell für Coding oder lang laufende Agents. Phonely meldet in einem Benchmark mit 200 Transkripten vom 21. August 2026 eine Time to First Token von 182 ms, 206 ms P99, vollständige Antworten in 379 ms, einen Telefonetikette-Score von 0,867 und 0,55 USD pro gemischter Million Tokens. Damit verdient Alma einen Pilot für Terminplanung, Support, Lead-Qualifizierung und andere wiederholbare Gesprächsabläufe. Unabhängige Überlegenheit oder echte Voice-to-Voice-Latenz sind damit nicht belegt: Der Anbieter führte und bewertete den Test selbst, nutzte sequenzielle Requests und veröffentlicht nicht alle Prompts, Transkripte, Judges, Regionen oder Concurrency-Bedingungen. Vergleicht Alma auf echten Calls mit dem bisherigen Modell. Messt Akzente, Lärm, Unterbrechungen, Tool Calls, Policy-Treue, Eskalation, P95 und P99 von Stimme zu Stimme, Kosten pro erfolgreichem Gespräch, Datenbedingungen und Fallback. Übernehmt es nur bei besserem Gesamtergebnis. Alma ist ein glaubwürdiges Spezial-LLM für eine enge Aufgabe: strukturierte Telefonate schnell, knapp und auf Kurs zu halten. Phonely meldet 182 ms bis zum ersten Token, 206 ms P99, 379 ms für eine vollständige Antwort und 0,55 USD pro gemischter Million Tokens. Das rechtfertigt einen Produktionspilot, aber keinen automatischen Wechsel. Dieser Test gehört zur Modellauswahl im Voice-Agent-Stack. Für die angrenzenden Komponenten gibt es unseren Produktionscheck für Streaming Speech-to-Text und die Analyse von Self-Hosted versus API bei Text-to-Speech. So wird ein schneller LLM-Benchmark nicht mit einem schnellen Telefonat verwechselt. Was ist Phonely Alma? Alma ist ein Sprachmodell für wiederholbare Telefonabläufe, gesprochene Formulierungen und Tool Calls. Phonely positioniert es für Terminbuchung, Support, Lead-Qualifizierung, Forderungseinzug, Nachschlagen und Weiterleitung. Coding, kreatives Schreiben, offene Multi-Agent-Aufgaben und lange Planung nennt das Unternehmen ausdrücklich als ungeeignet. Der Begriff „Voice-Native LLM“ braucht eine Grenze. Alma wird nach Input- und Output-Tokens verrechnet und funktioniert laut Anbieter mit bestehenden Transkriptions- und Sprachgenerierungs-Komponenten. Behandelt es als LLM-Stufe, solange der Vertrag nicht Audioeingabe, Audioausgabe, Turn Detection und Telefonie umfasst. Welche Zahlen veröffentlicht Phonely? Anbieter-Benchmark, gemessen am 21. August 2026 KennzahlAlmaGPT-4.1GPT-5.6Einordnung Time to First Token182 ms490 ms997 msLLM-Stufe, nicht Gesamtgespräch P99-Antwortlatenz206 ms2,02 s2,84 sStarkes Tail-Ergebnis im Test Vollständige Antwort379 ms771 ms1,46 sHinweis auf kurze Antworten Telefonetikette0,8670,7000,770Rubrik und Judges nicht vollständig öffentlich Gemischte Kosten pro 1 Mio. Tokens0,55 USD3,50 USDNicht angegebenNicht die Gesamtkosten eines Calls Die offizielle Alma-Launch-Seite nennt 200 zurückgehaltene Gesprächstranskripte, identische Prompts und Bewertung, sequenzielle Requests von AWS us-east-1 sowie fünf ausgeschlossene Warm-ups. Shared kostet dort 0,30 USD pro Million Input- und 1,30 USD pro Million Output-Tokens. Priority kostet 0,50 und 2,10 USD. VPC und On-Premises sind individuell. Unabhängigkeit und Marken Wavect veröffentlicht diese Seite und ist selbst Anbieter, wir haben also ein wirtschaftliches Interesse daran. Mit den hier genannten anderen Unternehmen sind wir weder verbunden noch von ihnen beauftragt oder empfohlen, und alle Firmennamen, Marken und Warenzeichen Dritter gehören ihren jeweiligen Inhabern. Aussagen über andere Anbieter stammen aus öffentlich zugänglichen Quellen, vor allem aus deren eigenen veröffentlichten Seiten, mit Stand des auf dieser Seite genannten Prüfdatums, und können sich seither geändert haben. Bitte prüfe sie vor einer Entscheidung selbst. Diese Seite wurde nach bestem Wissen und Gewissen erstellt, mit dem Ziel, möglichst objektiv zu bleiben. Wenn dir etwas falsch oder unfair erscheint, schreib uns und wir korrigieren es: office@wavect.io Was beweist der Benchmark und was nicht? Alma verdient einen direkten Test für strukturierte Telefonarbeit. Datum, Region, Stichprobe, Vergleichsmodelle und mehrere Latenzwerte sind benannt. P99 ist wertvoll, weil ein langes Schweigen einem Call stärker schaden kann als ein guter Median hilft. Allgemeine Überlegenheit folgt daraus nicht. Der Anbieter führte und bewertete den Test selbst. Offenbar wurden Transkripte statt kompletter Live-Audio-Calls verwendet. Vollständiger Datensatz, Prompt, Telefonetikette-Rubrik, Judges, Konfidenzintervalle, Request-Längen, Cache-Zustand, Tarif und Concurrency fehlen öffentlich. Belastbar ist: schneller und günstiger in Phonelys veröffentlichtem Telefon-Benchmark. Warum kann Spezialisierung am Telefon gewinnen? Lange Einleitungen, Wiederholungen und fehlende Bestätigungen wirken im Chat",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "citation": [
    {
      "@type": "WebPage",
      "name": "offizielle Alma-Launch-Seite",
      "url": "https://www.phonely.ai/alma"
    },
    {
      "@type": "WebPage",
      "name": "offene PhoneBench-Evaluierungsdesign",
      "url": "https://www.pipecat.ai/benchmarks/phonebench-alpha-1"
    },
    {
      "@type": "WebPage",
      "name": "τ-Voice-Studie",
      "url": "https://arxiv.org/abs/2603.13686"
    }
  ],
  "dateModified": "2026-09-06",
  "datePublished": "2026-09-06",
  "description": "Phonelys Alma ist ein spezialisiertes Sprachmodell für strukturierte Telefonate, kein allgemeines Modell für Coding oder lang laufende Agents. Phonely meldet in einem Benchmark mit 200 Transkripten vom 21. August 2026 eine Time to First Token von 182 ms, 206 ms P99, vollständige Antworten in 379 ms, einen Telefonetikette-Score von 0,867 und 0,55 USD pro gemischter Million Tokens. Damit verdient Alma einen Pilot für Terminplanung, Support, Lead-Qualifizierung und andere wiederholbare Gesprächsabläufe. Unabhängige Überlegenheit oder echte Voice-to-Voice-Latenz sind damit nicht belegt: Der Anbieter führte und bewertete den Test selbst, nutzte sequenzielle Requests und veröffentlicht nicht alle Prompts, Transkripte, Judges, Regionen oder Concurrency-Bedingungen. Vergleicht Alma auf echten Calls mit dem bisherigen Modell. Messt Akzente, Lärm, Unterbrechungen, Tool Calls, Policy-Treue, Eskalation, P95 und P99 von Stimme zu Stimme, Kosten pro erfolgreichem Gespräch, Datenbedingungen und Fallback. Übernehmt es nur bei besserem Gesamtergebnis.",
  "headline": "Phonely Alma im Test: Ist das Voice-LLM produktionsreif?",
  "image": "https://wavect.io/img/blog/headers/header_phonely-alma-voice-llm-review.svg",
  "inLanguage": "de",
  "keywords": "Voice AI, LLM-Evaluierung",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/phonely-alma-voice-llm-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/phonely-alma-voice-llm-review/",
  "wordCount": 1622
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/models-infrastructure/",
      "name": "Modelle und Infrastruktur",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/phonely-alma-voice-llm-review/",
      "name": "Phonely Alma im Test: Kosten & Voice-LLM-Latenz",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Alma ist ein Spezialmodell für strukturierte Telefonate, Tool Calls und knappe Gesprächsführung. Es ist nicht für Coding oder lange allgemeine Agent-Aufgaben gedacht."
      },
      "name": "Was ist Phonely Alma?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Das folgt nicht aus dem Voice-Native-Label. Phonely verrechnet Text-Tokens und beschreibt die Nutzung mit bestehendem STT und TTS. Prüft die konkrete Produktgrenze."
      },
      "name": "Ist Alma Speech-to-Speech?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Im Anbieter-Test meldete Alma 182 ms TTFT gegenüber 490 ms und 206 ms P99 gegenüber 2,02 Sekunden. Reproduziert das mit euren Prompts, Region, Tarif, Last und kompletter Call-Kette."
      },
      "name": "Ist Alma schneller als GPT-4.1?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Am 6. September 2026 kostete Shared 0,30 USD Input und 1,30 USD Output pro Million Tokens, Priority 0,50 und 2,10 USD. Der Benchmark nennt 0,55 USD gemischt."
      },
      "name": "Was kostet Alma?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Messt Call-Ergebnis, Tool-State, Policy, Gespräch, Unterbrechung, Voice-to-Voice P50, P95 und P99, Fehler, Fallback und Kosten pro Lösung."
      },
      "name": "Was muss ein Pilot messen?"
    }
  ]
}
```
