Riconoscimento vocale · Modello di riconoscimento vocale che separa le registrazioni di chiamate in canali parlanti e le converte in testo. L'analisi, il coaching e la valutazione della qualità si basano su questa trascrizione.
CALLAII ASR v4In produzionePubblicazione settembre 2026
Separa le registrazioni delle chiamate in canali parlanti e le converte in testo. Questa versione è stata addestrata su dieci lingue e su audio simulato alle condizioni della linea telefonica; il tasso di errore nelle conversazioni del contact center è diminuito in modo significativo.
Novità di questa versione
Nei scenari del contact center, il tasso di errore delle parole in turco è sceso dal 25,70% al 6,32%
In arabo, tedesco, francese, inglese e italiano, il tasso di errore è sceso a un quarto e a un quinto; i risultati per lingua sono nel grafico
Anche nel parlato turco letto c'è stato un miglioramento: 4,72% → 4,47% (800 registrazioni)
Lo stesso testo è stato addestrato con versioni su linea telefonica, ambiente rumoroso e studio
I dati della versione precedente sono stati inclusi nell'addestramento; per evitare che l'apprendimento venga compromesso quando si aggiungono nuovi dati
Cosa fa
In una registrazione a due canali, trascrive separatamente il cliente e l'operatore
Rileva autonomamente la lingua di ciascun canale
Genera una trascrizione con timestamp e etichette dei parlanti
Lascia vuoti i segmenti silenziosi; è stata addestrata per non generare frasi inventate
Limiti e uso responsabile
Le misurazioni sono state effettuate su set di test; il tasso di errore di riferimento in una vera chiamata telefonica non è ancora stato misurato
Il tasso di errore aumenta con il parlato sovrapposto e con registrazioni di qualità molto bassa
Il ritardo della trascrizione in tempo reale non è stato misurato
Addestramento e misurazioni
19.369Passo
1Epoca
0,0981Perdita di validazione finale
%9,41Tasso di errore sulle parole finale
%2,82Tasso di errore sui caratteri finale
Dati di addestramento
2.479.180 registrazioni, 3.654 ore di audio
Quota di nuovi dati
26,5%; il resto proviene dai dati della versione precedente
simulazione linea telefonica, ambiente rumoroso, studio
Set di validazione
11.859 registrazioni
Passo
19.369 · 1 epoca
Data di addestramento
settembre 2026
Perdita di addestramento
Ogni punto rappresenta la media di 7 registrazioni consecutive.
Mostra i valori in tabella
Perdita di addestramento
175
10,8073
1.050
6,4649
1.925
5,6508
2.800
5,3350
3.675
5,0206
4.550
4,7431
5.425
4,6104
6.300
4,6143
7.175
4,5038
8.050
4,3882
8.925
4,4358
9.800
4,3362
10.675
4,2276
11.550
4,1843
12.425
4,2788
13.300
4,1626
14.175
4,1483
15.050
4,1727
15.925
4,0753
16.800
4,0031
17.675
4,0504
18.550
4,2040
19.350
4,0197
Perdita di validazione
Misurata su esempi mai visti durante l'addestramento; una curva in discesa indica che il modello impara invece di memorizzare.
Mostra i valori in tabella
Perdita di validazione
1.000
0,1911
2.000
0,1611
3.000
0,1446
4.000
0,1345
5.000
0,1259
6.000
0,1187
7.000
0,1135
8.000
0,1097
9.000
0,1068
10.000
0,1050
11.000
0,1025
12.000
0,1021
13.000
0,1010
14.000
0,0997
15.000
0,0994
16.000
0,0985
17.000
0,0985
18.000
0,0984
19.000
0,0980
19.369
0,0981
Tasso di errore in validazione (%)
Tasso di errore sulle parole (WER)Tasso di errore sui caratteri (CER)
Più basso è meglio. Misurato sul set di validazione durante l'addestramento.
Mostra i valori in tabella
Tasso di errore sulle parole (WER)
1.000
15,03
2.000
13,22
3.000
12,06
4.000
10,78
5.000
10,51
6.000
10,01
7.000
9,60
8.000
9,72
9.000
9,52
10.000
9,43
11.000
9,36
12.000
9,35
13.000
9,38
14.000
9,52
15.000
9,23
16.000
9,36
17.000
9,35
18.000
9,36
19.000
9,24
19.369
9,41
Tasso di errore sui caratteri (CER)
1.000
4,24
2.000
3,85
3.000
3,47
4.000
3,13
5.000
3,01
6.000
2,94
7.000
2,87
8.000
2,89
9.000
2,89
10.000
2,85
11.000
2,88
12.000
2,81
13.000
2,92
14.000
2,93
15.000
2,80
16.000
2,83
17.000
2,77
18.000
2,80
19.000
2,72
19.369
2,82
Test del contact center · Tasso di errore delle parole per lingua (%)
v3v4
Più basso è meglio. 300 campioni per lingua.
Mostra i valori in tabella
v3
v4
Arabo
67,59
13,86
Tedesco
54,58
15,37
Inglese
59,92
12,58
Francese
62,36
15,57
Italiano
38,88
8,42
Turco
25,70
6,32
Test del contact center · Tasso di errore dei caratteri per lingua (%)
v3v4
Più basso è meglio. 300 campioni per lingua.
Mostra i valori in tabella
v3
v4
Arabo
48,62
5,76
Tedesco
46,00
7,23
Inglese
44,41
6,23
Francese
47,92
7,34
Italiano
26,92
3,45
Turco
10,47
1,96
Parlato turco letto · Tasso di errore delle parole per lingua (%)
v3v4
Più basso è meglio. 800 campioni per lingua.
Mostra i valori in tabella
v3
v4
Turco
4,72
4,47
Parlato turco letto · Tasso di errore dei caratteri per lingua (%)
v3v4
Più basso è meglio. 800 campioni per lingua.
Mostra i valori in tabella
v3
v4
Turco
1,11
0,95
Scheda tecnica
Versione
v4
Pubblicazione
8 settembre 2026
Input
registrazione audio, singolo o doppio canale
Output
testo con etichette dei parlanti e timestamp
Rilevamento lingua
automatico per canale
Ambiente di esecuzione
server gestiti da Callmenta
I dati dei clienti non vengono utilizzati per l'addestramento dei modelli.
Questa scheda è stata creata il 27.09.2026. Per la versione più recente, consulta callmenta.com.
Versioni e sviluppi