Riconoscimento vocale · Modello di riconoscimento vocale che separa le registrazioni di chiamate in canali parlanti e le converte in testo. L'analisi, il coaching e la valutazione della qualità si basano su questa trascrizione.
CALLAII ASR v3Versione precedentePubblicazione agosto 2026
Versione con ampio addestramento multilingue. La simulazione della linea telefonica e il riconoscimento delle sezioni silenziose sono stati aggiunti in questa versione.
Novità di questa versione
Nel set di benchmark pubblico, il tasso di errore delle parole in turco è sceso dall'8,87% al 7,11%
In arabo è sceso dal 7,96% al 7,82%
Ha imparato a lasciare vuote le sezioni silenziose; le frasi inventate sono diminuite
Nessun degrado osservato alla fine di una chiamata lunga (in una chiamata reale di 571 secondi)
Iniziato il rilevamento automatico della lingua per ogni canale
Limiti e uso responsabile
Il set di benchmark pubblico è composto da frasi di notizie lette ad alta voce; non rappresenta il successo assoluto nelle chiamate telefoniche
Nei scenari di contact center, il tasso di errore nelle lingue diverse dal turco era elevato; risolto in v4
Addestramento e misurazioni
11.540Passo
1Epoca
0,1315Perdita di validazione finale
%10,49Tasso di errore sulle parole finale
%3,01Tasso di errore sui caratteri finale
Dati di addestramento
1.477.006 registrazioni, 2.190,9 ore di audio
Esempio di silenzio
25,7 ore
Tipi di audio
simulazione banda telefonica (8 kHz), miscelazione incrociata, frammentazione del dialogo
Passi
11.540 · 1 epoca
Data di addestramento
Agosto 2026
Perdita di addestramento
Ogni punto è la media di 2 registrazioni consecutive.
Mostra i valori in tabella
Perdita di addestramento
100
2,6340
600
1,6663
1.100
1,6001
1.600
1,5598
2.100
1,5177
2.600
1,4338
3.100
1,4080
3.600
1,3531
4.100
1,3821
4.600
1,3530
5.100
1,3306
5.600
1,3333
6.100
1,3021
6.600
1,2923
7.100
1,2736
7.600
1,2613
8.100
1,2606
8.600
1,2679
9.100
1,2166
9.600
1,2256
10.100
1,2165
10.600
1,2068
11.100
1,1835
11.500
1,1665
Perdita di validazione
Misurata su esempi mai visti durante l'addestramento; una curva in discesa indica che il modello impara invece di memorizzare.
Mostra i valori in tabella
Perdita di validazione
2.000
0,1633
4.000
0,1528
6.000
0,1456
8.000
0,1383
10.000
0,1340
11.540
0,1316
Tasso di errore in validazione (%)
Tasso di errore sulle parole (WER)Tasso di errore sui caratteri (CER)
Più basso è meglio. Misurato sul set di validazione durante l'addestramento.
Mostra i valori in tabella
Tasso di errore sulle parole (WER)
2.000
12,60
4.000
11,94
6.000
19,10
8.000
10,71
10.000
18,35
11.540
10,49
Tasso di errore sui caratteri (CER)
2.000
3,64
4.000
3,33
6.000
10,35
8.000
2,94
10.000
10,79
11.540
3,01
Set di benchmark pubblico (FLEURS) · Tasso di errore delle parole (%)
v2v3
Più basso è meglio. 150 registrazioni per lingua, frasi di notizie lette ad alta voce. Valido per il confronto; non rappresenta il successo assoluto nelle chiamate telefoniche.
Mostra i valori in tabella
v2
v3
Turco
8,87
7,11
Arabo
7,96
7,82
Set di benchmark pubblico (FLEURS) · Tasso di errore dei caratteri (%)
v2v3
Più basso è meglio. 150 registrazioni per lingua.
Mostra i valori in tabella
v2
v3
Turco
2,83
1,67
Arabo
2,65
2,46
Set di test interno · Tasso di errore delle parole per lingua (%)
Più basso è meglio. 200 campioni per lingua.
Mostra i valori in tabella
v3
Arabo
19,72
Tedesco
6,80
Inglese
19,10
Francese
12,74
Italiano
8,11
Turco
10,49
Set di test interno · Tasso di errore dei caratteri per lingua (%)
Più basso è meglio. 200 campioni per lingua.
Mostra i valori in tabella
v3
Arabo
7,41
Tedesco
1,95
Inglese
11,89
Francese
3,75
Italiano
2,22
Turco
3,01
Scheda tecnica
Versione
v3
Pubblicazione
25 Agosto 2026
Stato
sostituita da v4
I dati dei clienti non vengono utilizzati per l'addestramento dei modelli.
Questa scheda è stata creata il 27.09.2026. Per la versione più recente, consulta callmenta.com.
Versioni e sviluppi