Reconnaissance vocale · Modèle de reconnaissance vocale qui sépare les enregistrements d'appels par canaux de locuteurs et les convertit en texte. L'analyse, le coaching et l'évaluation de la qualité fonctionnent sur la base de cette transcription.
CALLAII ASR v4En productionPublication septembre 2026
Sépare les enregistrements d'appels par canaux de locuteurs et les transcrit en texte. Cette version a été entraînée sur dix langues et des voix simulant les conditions d'une ligne téléphonique ; le taux d'erreur dans les conversations de centre d'appels a nettement diminué.
Nouveautés de cette version
Dans les scénarios de centre d'appels, le taux d'erreur par mot en turc est passé de 25,70 % à 6,32 %
En arabe, allemand, français, anglais et italien, le taux d'erreur a été divisé par quatre ou par cinq ; les résultats par langue sont présentés dans le graphique
Amélioration également sur le turc parlé : 4,72 % → 4,47 % (800 enregistrements)
Le même texte a été entraîné avec des versions ligne téléphonique, environnement bruyant et studio
Les données de la version précédente ont également été incluses dans l'entraînement ; pour éviter la dégradation des connaissances acquises lors de l'ajout de nouvelles données
Ce qu'il fait
Transcrit séparément le client et l'agent dans un enregistrement à deux canaux
Détecte automatiquement la langue de chaque canal
Produit une transcription horodatée avec étiquettes de locuteurs
Laisse les sections silencieuses vides, entraîné pour ne pas inventer de phrases
Limites et usage responsable
Les mesures ont été réalisées sur des ensembles de test ; le taux d'erreur de référence sur un appel téléphonique réel n'a pas encore été mesuré
Le taux d'erreur augmente en cas de chevauchement de parole et d'enregistrement de très faible qualité
La latence de transcription en temps réel n'a pas été mesurée
Entraînement et mesures
19.369Étape
1Époque
0,0981Perte de validation finale
%9,41Taux d'erreur de mots final
%2,82Taux d'erreur de caractères final
Données d'entraînement
2 479 180 enregistrements, 3 654 heures d'audio
Part de nouvelles données
26,5 % ; le reste provient des données de la version précédente
simulation de ligne téléphonique, environnement bruyant, studio
Ensemble de validation
11 859 enregistrements
Étape
19 369 · 1 époque
Date d'entraînement
septembre 2026
Perte d'entraînement
Chaque point représente la moyenne de 7 enregistrements consécutifs.
Afficher les valeurs sous forme de tableau
Perte d'entraînement
175
10,8073
1.050
6,4649
1.925
5,6508
2.800
5,3350
3.675
5,0206
4.550
4,7431
5.425
4,6104
6.300
4,6143
7.175
4,5038
8.050
4,3882
8.925
4,4358
9.800
4,3362
10.675
4,2276
11.550
4,1843
12.425
4,2788
13.300
4,1626
14.175
4,1483
15.050
4,1727
15.925
4,0753
16.800
4,0031
17.675
4,0504
18.550
4,2040
19.350
4,0197
Perte de validation
Mesurée sur des exemples jamais vus pendant l'entraînement ; une courbe descendante montre que le modèle apprend au lieu de mémoriser.
Afficher les valeurs sous forme de tableau
Perte de validation
1.000
0,1911
2.000
0,1611
3.000
0,1446
4.000
0,1345
5.000
0,1259
6.000
0,1187
7.000
0,1135
8.000
0,1097
9.000
0,1068
10.000
0,1050
11.000
0,1025
12.000
0,1021
13.000
0,1010
14.000
0,0997
15.000
0,0994
16.000
0,0985
17.000
0,0985
18.000
0,0984
19.000
0,0980
19.369
0,0981
Taux d'erreur en validation (%)
Taux d'erreur de mots (WER)Taux d'erreur de caractères (CER)
Plus bas, c'est mieux. Mesuré sur le jeu de validation tout au long de l'entraînement.
Afficher les valeurs sous forme de tableau
Taux d'erreur de mots (WER)
1.000
15,03
2.000
13,22
3.000
12,06
4.000
10,78
5.000
10,51
6.000
10,01
7.000
9,60
8.000
9,72
9.000
9,52
10.000
9,43
11.000
9,36
12.000
9,35
13.000
9,38
14.000
9,52
15.000
9,23
16.000
9,36
17.000
9,35
18.000
9,36
19.000
9,24
19.369
9,41
Taux d'erreur de caractères (CER)
1.000
4,24
2.000
3,85
3.000
3,47
4.000
3,13
5.000
3,01
6.000
2,94
7.000
2,87
8.000
2,89
9.000
2,89
10.000
2,85
11.000
2,88
12.000
2,81
13.000
2,92
14.000
2,93
15.000
2,80
16.000
2,83
17.000
2,77
18.000
2,80
19.000
2,72
19.369
2,82
Test centre d'appels · Taux d'erreur par mot par langue (%)
v3v4
Plus bas, c'est mieux. 300 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
v4
Arabe
67,59
13,86
Allemand
54,58
15,37
Anglais
59,92
12,58
Français
62,36
15,57
Italien
38,88
8,42
Turc
25,70
6,32
Test centre d'appels · Taux d'erreur par caractère par langue (%)
v3v4
Plus bas, c'est mieux. 300 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
v4
Arabe
48,62
5,76
Allemand
46,00
7,23
Anglais
44,41
6,23
Français
47,92
7,34
Italien
26,92
3,45
Turc
10,47
1,96
Turc parlé · Taux d'erreur par mot par langue (%)
v3v4
Plus bas, c'est mieux. 800 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
v4
Turc
4,72
4,47
Turc parlé · Taux d'erreur par caractère par langue (%)
v3v4
Plus bas, c'est mieux. 800 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
v4
Turc
1,11
0,95
Fiche technique
Version
v4
Publication
8 septembre 2026
Entrée
enregistrement audio, un ou deux canaux
Sortie
texte horodaté avec étiquettes de locuteurs
Détection de langue
automatique par canal
Environnement d'exécution
serveurs gérés par Callmenta
Les données clients ne sont pas utilisées pour l'entraînement des modèles.
Cette fiche a été créée le 27.09.2026. Consultez callmenta.com pour la version actuelle.
Versions et évolutions