Распознавание речи · Модель распознавания речи, разделяющая записи звонков по каналам говорящих и преобразующая их в текст. Анализ, коучинг и оценка качества работают на основе этой расшифровки.
CALLAII ASR v3Предыдущая версияПубликация август 2026
Версия с расширенным многоязычным обучением. Эмуляция телефонной линии и распознавание пауз добавлены в этой версии.
Что улучшено в этой версии
На открытом бенчмарке доля ошибок в словах на турецком снизилась с 8,87% до 7,11%
На арабском — с 7,96% до 7,82%
Научился оставлять паузы пустыми; уменьшилось количество выдуманных фраз
Деградация в конце длинных вызовов не обнаружена (на реальном вызове длительностью 571 секунда)
Началось автоматическое определение языка для каждого канала
Ограничения и ответственное использование
Открытый бенчмарк состоит из озвученных новостных фраз; не отражает абсолютную точность в телефонных вызовах
В сценариях контакт-центра доля ошибок на языках, отличных от турецкого, была высокой; исправлено в v4
Обучение и метрики
11.540Шаг
1Эпоха
0,1315Итоговая потеря валидации
%10,49Итоговый коэффициент ошибок на слово
%3,01Окончательный показатель CER
Обучающие данные
1 477 006 записей, 2 190,9 часов аудио
Примеры пауз
25,7 часов
Типы аудио
эмуляция телефонной полосы (8 кГц), кросс-миксирование, фрагментация диалогов
Шагов
11 540 · 1 эпоха
Дата обучения
август 2026
Потеря обучения
Каждая точка — среднее из двух последовательных записей.
Показать значения в виде таблицы
Потеря обучения
100
2,6340
600
1,6663
1.100
1,6001
1.600
1,5598
2.100
1,5177
2.600
1,4338
3.100
1,4080
3.600
1,3531
4.100
1,3821
4.600
1,3530
5.100
1,3306
5.600
1,3333
6.100
1,3021
6.600
1,2923
7.100
1,2736
7.600
1,2613
8.100
1,2606
8.600
1,2679
9.100
1,2166
9.600
1,2256
10.100
1,2165
10.600
1,2068
11.100
1,1835
11.500
1,1665
Потеря валидации
Измерено на примерах, не виденных при обучении; снижение показывает, что модель обучилась, а не зазубрила.
Показать значения в виде таблицы
Потеря валидации
2.000
0,1633
4.000
0,1528
6.000
0,1456
8.000
0,1383
10.000
0,1340
11.540
0,1316
Доля ошибок валидации (%)
Коэффициент ошибок на слово (WER)Коэффициент ошибок на символ (CER)
Ниже значение — лучше. Измерялась на валидационном наборе на протяжении всего обучения.
Показать значения в виде таблицы
Коэффициент ошибок на слово (WER)
2.000
12,60
4.000
11,94
6.000
19,10
8.000
10,71
10.000
18,35
11.540
10,49
Коэффициент ошибок на символ (CER)
2.000
3,64
4.000
3,33
6.000
10,35
8.000
2,94
10.000
10,79
11.540
3,01
Открытый бенчмарк (FLEURS) · Доля ошибок в словах (%)
v2v3
Ниже значение — лучше. 150 записей на язык, озвученные новостные фразы. Подходит для сравнения; не отражает абсолютную точность в телефонных вызовах.
Показать значения в виде таблицы
v2
v3
Турецкий
8,87
7,11
Арабский
7,96
7,82
Открытый бенчмарк (FLEURS) · Доля ошибок в символах (%)
v2v3
Ниже значение — лучше. 150 записей на язык.
Показать значения в виде таблицы
v2
v3
Турецкий
2,83
1,67
Арабский
2,65
2,46
Внутренний тестовый набор · Доля ошибок в словах по языкам (%)
Ниже значение — лучше. 200 примеров на язык.
Показать значения в виде таблицы
v3
Арабский
19,72
Немецкий
6,80
Английский
19,10
Французский
12,74
Итальянский
8,11
Турецкий
10,49
Внутренний тестовый набор · Доля ошибок в символах по языкам (%)
Ниже значение — лучше. 200 примеров на язык.
Показать значения в виде таблицы
v3
Арабский
7,41
Немецкий
1,95
Английский
11,89
Французский
3,75
Итальянский
2,22
Турецкий
3,01
Технический паспорт
Версия
v3
Релиз
25 августа 2026
Статус
заменена v4
Данные клиентов не используются для обучения моделей.
Этот паспорт создан 27.09.2026. Актуальная версия — на callmenta.com.
Версии и обновления