Tim KI.

Test-Labor

Sprachausgabe, Erkennung und Dialogmodelle einzeln messen — ohne Anruf. Es wird ausschließlich verarbeitet, was du hier eingibst oder hochlädst; Telefonate werden nie aufgezeichnet.

Sprachausgabe (Voxtral)

Erkennung (Voxtral, Batch)

Eigene Aufnahme hochladen. Bewusst die Batch-Strecke: nur sie kennt die Sprachfestlegung auf Deutsch. Die Echtzeit-Erkennung kennt sie nicht und wird deshalb im echten Anruf gemessen, nicht hier.

Dialogmodelle im Vergleich

Dieselben Telefon-Fragen gegen mehrere Modelle. Gemessen wird die Zeit bis zum ersten Token — das ist es, was am Telefon als Pause zu hören ist. Ohne Werkzeuge und ohne Systemprompt: ob ein Modell die 25 Telefon-Werkzeuge richtig bedient, entscheidet sich erst am vollen Prompt und lässt sich hier nicht feststellen.