Spracherkennung · Spracherkennungsmodell, das Anrufaufnahmen in Sprecherkanäle aufteilt und in Text umwandelt. Analyse, Coaching und Qualitätsbewertung basieren auf dieser Transkription.
CALLAII ASR v4LiveLive September 2026
Gesprächsaufnahmen werden in Sprecherkanäle aufgeteilt und in Text umgewandelt. Diese Version wurde mit Audio trainiert, das Telefonleitungen nachempfunden ist, und in zehn Sprachen; die Fehlerquote in Callcenter-Gesprächen ist deutlich gesunken.
Neuigkeiten in dieser Version
Die Wortfehlerquote im Türkischen in Callcenter-Szenarien sank von 25,70 % auf 6,32 %
Die Fehlerquote in Arabisch, Deutsch, Französisch, Englisch und Italienisch sank auf ein Viertel bzw. ein Fünftel; die sprachspezifischen Ergebnisse sind im Diagramm dargestellt
Auch bei vorgelesenem Türkisch verbesserte sich die Quote: 4,72 % → 4,47 % (800 Aufnahmen)
Das Modell wurde mit derselben Textvorlage in Telefonleitung-, Rausch- und Studioqualität trainiert
Die Daten der vorherigen Version wurden ebenfalls in das Training einbezogen, um bei der Hinzufügung neuer Daten bereits erlernte Muster nicht zu beeinträchtigen
Was es kann
Wandelt zweikanalige Aufnahmen getrennt für Kunde und Agent in Text um
Erkennt die Sprache jedes Kanals automatisch
Erzeugt einen transkribierten Text mit Zeitstempeln und Sprecherkennzeichnungen
Lässt stille Abschnitte leer und wurde darauf trainiert, keine erfundenen Sätze zu erzeugen
Grenzen und verantwortungsvolle Nutzung
Die Messungen wurden an Testdatensätzen durchgeführt; die referenzierte Fehlerquote bei echten Telefonanrufen wurde noch nicht gemessen
Bei Überlappungen und sehr schlechter Aufnahmequalität steigt die Fehlerquote
Die Latenzzeit für die Echtzeit-Transkription wurde nicht gemessen
Training und Messungen
19.369Schritt
1Epoche
0,0981Letzter Validierungsverlust
%9,41Letzte Wortfehlerrate
%2,82Letzte Zeichenfehlerrate
Trainingsdaten
2.479.180 Aufnahmen, 3.654 Stunden Audio
Anteil neuer Daten
26,5 %; der Rest stammt aus der vorherigen Version
Jeder Punkt ist der Durchschnitt von sieben aufeinanderfolgenden Aufnahmen.
Werte als Tabelle anzeigen
Trainingsverlust
175
10,8073
1.050
6,4649
1.925
5,6508
2.800
5,3350
3.675
5,0206
4.550
4,7431
5.425
4,6104
6.300
4,6143
7.175
4,5038
8.050
4,3882
8.925
4,4358
9.800
4,3362
10.675
4,2276
11.550
4,1843
12.425
4,2788
13.300
4,1626
14.175
4,1483
15.050
4,1727
15.925
4,0753
16.800
4,0031
17.675
4,0504
18.550
4,2040
19.350
4,0197
Validierungsverlust
Gemessen an Beispielen, die im Training nie vorkamen; eine fallende Kurve zeigt, dass das Modell lernt statt auswendig zu lernen.
Werte als Tabelle anzeigen
Validierungsverlust
1.000
0,1911
2.000
0,1611
3.000
0,1446
4.000
0,1345
5.000
0,1259
6.000
0,1187
7.000
0,1135
8.000
0,1097
9.000
0,1068
10.000
0,1050
11.000
0,1025
12.000
0,1021
13.000
0,1010
14.000
0,0997
15.000
0,0994
16.000
0,0985
17.000
0,0985
18.000
0,0984
19.000
0,0980
19.369
0,0981
Fehlerrate bei der Validierung (%)
Wortfehlerrate (WER)Zeichenfehlerrate (CER)
Niedriger ist besser. Während des Trainings auf dem Validierungsset gemessen.
Werte als Tabelle anzeigen
Wortfehlerrate (WER)
1.000
15,03
2.000
13,22
3.000
12,06
4.000
10,78
5.000
10,51
6.000
10,01
7.000
9,60
8.000
9,72
9.000
9,52
10.000
9,43
11.000
9,36
12.000
9,35
13.000
9,38
14.000
9,52
15.000
9,23
16.000
9,36
17.000
9,35
18.000
9,36
19.000
9,24
19.369
9,41
Zeichenfehlerrate (CER)
1.000
4,24
2.000
3,85
3.000
3,47
4.000
3,13
5.000
3,01
6.000
2,94
7.000
2,87
8.000
2,89
9.000
2,89
10.000
2,85
11.000
2,88
12.000
2,81
13.000
2,92
14.000
2,93
15.000
2,80
16.000
2,83
17.000
2,77
18.000
2,80
19.000
2,72
19.369
2,82
Callcenter-Test · Wortfehlerquote nach Sprache (%)
v3v4
Niedriger ist besser. 300 Beispiele pro Sprache.
Werte als Tabelle anzeigen
v3
v4
Arabisch
67,59
13,86
Deutsch
54,58
15,37
Englisch
59,92
12,58
Französisch
62,36
15,57
Italienisch
38,88
8,42
Türkisch
25,70
6,32
Callcenter-Test · Zeichenfehlerquote nach Sprache (%)
v3v4
Niedriger ist besser. 300 Beispiele pro Sprache.
Werte als Tabelle anzeigen
v3
v4
Arabisch
48,62
5,76
Deutsch
46,00
7,23
Englisch
44,41
6,23
Französisch
47,92
7,34
Italienisch
26,92
3,45
Türkisch
10,47
1,96
Vorgelesenes Türkisch · Wortfehlerquote nach Sprache (%)
v3v4
Niedriger ist besser. 800 Beispiele pro Sprache.
Werte als Tabelle anzeigen
v3
v4
Türkisch
4,72
4,47
Vorgelesenes Türkisch · Zeichenfehlerquote nach Sprache (%)
v3v4
Niedriger ist besser. 800 Beispiele pro Sprache.
Werte als Tabelle anzeigen
v3
v4
Türkisch
1,11
0,95
Technisches Datenblatt
Version
v4
Veröffentlichung
8. September 2026
Eingabe
Audioaufnahme, ein- oder zweikanalig
Ausgabe
Text mit Sprecherkennzeichnungen und Zeitstempeln
Spracherkennung
automatisch pro Kanal
Laufumgebung
Server, die von Callmenta verwaltet werden
Kundendaten werden nicht für das Modelltraining verwendet.
Dieses Datenblatt wurde am 27.09.2026 erstellt. Für die aktuelle Version besuchen Sie callmenta.com.
Versionen und Verbesserungen