Reconnaissance vocale · Modèle de reconnaissance vocale qui sépare les enregistrements d'appels par canaux de locuteurs et les convertit en texte. L'analyse, le coaching et l'évaluation de la qualité fonctionnent sur la base de cette transcription.
CALLAII ASR v3Version précédentePublication août 2026
Version dotée d'un entraînement multilingue étendu. La simulation de ligne téléphonique et la détection des sections silencieuses ont été ajoutées dans cette version.
Nouveautés de cette version
Sur le jeu de référence ouvert, le taux d'erreur de mots en turc est passé de 8,87 % à 7,11 %
En arabe, il est passé de 7,96 % à 7,82 %
Le modèle a appris à laisser les sections silencieuses vides ; les phrases inventées ont diminué
Aucune dégradation observée en fin d'appel long (appel réel de 571 secondes)
La détection automatique de la langue par canal a été initiée
Limites et usage responsable
Le jeu de référence ouvert est composé de phrases d'actualités lues à voix haute ; il ne reflète pas la réussite absolue lors d'un appel téléphonique
Dans les scénarios de centre d'appels, le taux d'erreur était élevé pour les langues autres que le turc ; ce problème a été corrigé dans la v4
Entraînement et mesures
11.540Étape
1Époque
0,1315Perte de validation finale
%10,49Taux d'erreur de mots final
%3,01Taux d'erreur de caractères final
Données d'entraînement
1 477 006 enregistrements, 2 190,9 heures d'audio
Exemple de silence
25,7 heures
Types d'audio
simulation de bande téléphonique (8 kHz), mélange croisé, fragmentation de dialogues
Étape
11 540 · 1 époque
Date d'entraînement
août 2026
Perte d'entraînement
Chaque point représente la moyenne de deux enregistrements consécutifs.
Afficher les valeurs sous forme de tableau
Perte d'entraînement
100
2,6340
600
1,6663
1.100
1,6001
1.600
1,5598
2.100
1,5177
2.600
1,4338
3.100
1,4080
3.600
1,3531
4.100
1,3821
4.600
1,3530
5.100
1,3306
5.600
1,3333
6.100
1,3021
6.600
1,2923
7.100
1,2736
7.600
1,2613
8.100
1,2606
8.600
1,2679
9.100
1,2166
9.600
1,2256
10.100
1,2165
10.600
1,2068
11.100
1,1835
11.500
1,1665
Perte de validation
Mesurée sur des exemples jamais vus pendant l'entraînement ; une courbe descendante montre que le modèle apprend au lieu de mémoriser.
Afficher les valeurs sous forme de tableau
Perte de validation
2.000
0,1633
4.000
0,1528
6.000
0,1456
8.000
0,1383
10.000
0,1340
11.540
0,1316
Taux d'erreur en validation (%)
Taux d'erreur de mots (WER)Taux d'erreur de caractères (CER)
Plus bas, c'est mieux. Mesuré sur le jeu de validation tout au long de l'entraînement.
Afficher les valeurs sous forme de tableau
Taux d'erreur de mots (WER)
2.000
12,60
4.000
11,94
6.000
19,10
8.000
10,71
10.000
18,35
11.540
10,49
Taux d'erreur de caractères (CER)
2.000
3,64
4.000
3,33
6.000
10,35
8.000
2,94
10.000
10,79
11.540
3,01
Jeu de référence ouvert (FLEURS) · Taux d'erreur de mots (%)
v2v3
Plus bas, c'est mieux. 150 enregistrements par langue, phrases d'actualités lues à voix haute. Valable pour le classement ; ne reflète pas la réussite absolue lors d'un appel téléphonique.
Afficher les valeurs sous forme de tableau
v2
v3
Turc
8,87
7,11
Arabe
7,96
7,82
Jeu de référence ouvert (FLEURS) · Taux d'erreur de caractères (%)
v2v3
Plus bas, c'est mieux. 150 enregistrements par langue.
Afficher les valeurs sous forme de tableau
v2
v3
Turc
2,83
1,67
Arabe
2,65
2,46
Jeu de test interne · Taux d'erreur de mots par langue (%)
Plus bas, c'est mieux. 200 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
Arabe
19,72
Allemand
6,80
Anglais
19,10
Français
12,74
Italien
8,11
Turc
10,49
Jeu de test interne · Taux d'erreur de caractères par langue (%)
Plus bas, c'est mieux. 200 exemples par langue.
Afficher les valeurs sous forme de tableau
v3
Arabe
7,41
Allemand
1,95
Anglais
11,89
Français
3,75
Italien
2,22
Turc
3,01
Fiche technique
Version
v3
Publication
25 août 2026
Statut
remplacée par la v4
Les données clients ne sont pas utilisées pour l'entraînement des modèles.
Cette fiche a été créée le 27.09.2026. Consultez callmenta.com pour la version actuelle.
Versions et évolutions