Test-Labor
Sprachausgabe, Erkennung und Dialogmodelle einzeln messen — ohne Anruf. Es wird ausschließlich verarbeitet, was du hier eingibst oder hochlädst; Telefonate werden nie aufgezeichnet.
Sprachausgabe (Voxtral)
Erkennung (Voxtral, Batch)
Eigene Aufnahme hochladen. Bewusst die Batch-Strecke: nur sie kennt die Sprachfestlegung auf Deutsch. Die Echtzeit-Erkennung kennt sie nicht und wird deshalb im echten Anruf gemessen, nicht hier.
Dialogmodelle im Vergleich
Dieselben Telefon-Fragen gegen mehrere Modelle. Gemessen wird die Zeit bis zum ersten Token — das ist es, was am Telefon als Pause zu hören ist. Ohne Werkzeuge und ohne Systemprompt: ob ein Modell die 25 Telefon-Werkzeuge richtig bedient, entscheidet sich erst am vollen Prompt und lässt sich hier nicht feststellen.