CALLAII ®
by CALLMENTA
CALLAII
Language model
The language model powering the AI surfaces in the Callmenta panel: call analysis, coaching, live support, CRM, and CALLAII Legal.
CALLAII v7
Live
Released September 2026
CALLAII v7 is live. The previous live version, v6, was put through the same exam under live settings. On legal questions, it checks procedure almost every time: competent and authorized court, conditions of the lawsuit, and deadlines. It works alongside an additional audit that catches and extracts information the lawyer did not mention in petitions.
What improved in this version
Procedure check in legal mode: performed in 69 out of 70 questions; live v6 did not perform it in any of the same exam.
Procedure check points in legal mode rose from 8 to 57 across 70 questions.
Procedure check in general mode with thinking off rose from 0 to 23.
Answers are more concise: answers cut off at the limit in general mode dropped from 40 to 11.
Text extraction from document images and image description were fully preserved after training.
Limitations and responsible use
Legal knowledge does not come from the model's memory; laws, regulations, and rulings are fetched from the current library every time.
The text it generates is a draft; petitions, contracts, and official documents must be approved by an authorized person.
Numbers and dates must be verified.
Quality in languages other than Turkish has not been measured in as much detail as Turkish .
Training and measurements
0,629 → 0,513 Validation loss
69 out of 70 questions Procedure check · legal
0 out of 70 questions Live v6 on the same exam
8 → 57 Procedure points · legal
Training data 45,847 samples
Validation set 200 samples never seen during training
Steps 2,859 · 1 epoch · 16 samples per step
Training context 4,096 tokens
Validation loss 0.629 → 0.513
Exam 70 procedure questions; same questions as live v6, live settings
Training date September 2026
Training and validation loss
Training loss
Validation loss
0.4
0.5
0.6
0.7
0.8
0.9
0.2
0.4
0.6
0.8
1.0
Epoch
Training loss
Validation loss
Training loss: 0.0 · 0.84
Training loss: 0.0 · 0.76
Training loss: 0.0 · 0.68
Training loss: 0.0 · 0.67
Training loss: 0.0 · 0.64
Training loss: 0.1 · 0.65
Training loss: 0.1 · 0.63
Training loss: 0.1 · 0.61
Training loss: 0.1 · 0.60
Training loss: 0.1 · 0.61
Training loss: 0.1 · 0.60
Training loss: 0.1 · 0.59
Training loss: 0.1 · 0.60
Training loss: 0.1 · 0.58
Training loss: 0.1 · 0.61
Training loss: 0.1 · 0.58
Training loss: 0.1 · 0.58
Training loss: 0.2 · 0.59
Training loss: 0.2 · 0.57
Training loss: 0.2 · 0.56
Training loss: 0.2 · 0.56
Training loss: 0.2 · 0.55
Training loss: 0.2 · 0.55
Training loss: 0.2 · 0.56
Training loss: 0.2 · 0.55
Training loss: 0.2 · 0.56
Training loss: 0.2 · 0.55
Training loss: 0.2 · 0.57
Training loss: 0.3 · 0.56
Training loss: 0.3 · 0.55
Training loss: 0.3 · 0.55
Training loss: 0.3 · 0.56
Training loss: 0.3 · 0.54
Training loss: 0.3 · 0.54
Training loss: 0.3 · 0.55
Training loss: 0.3 · 0.54
Training loss: 0.3 · 0.56
Training loss: 0.3 · 0.57
Training loss: 0.3 · 0.56
Training loss: 0.3 · 0.56
Training loss: 0.4 · 0.55
Training loss: 0.4 · 0.54
Training loss: 0.4 · 0.53
Training loss: 0.4 · 0.52
Training loss: 0.4 · 0.54
Training loss: 0.4 · 0.52
Training loss: 0.4 · 0.55
Training loss: 0.4 · 0.54
Training loss: 0.4 · 0.51
Training loss: 0.4 · 0.52
Training loss: 0.4 · 0.54
Training loss: 0.5 · 0.55
Training loss: 0.5 · 0.51
Training loss: 0.5 · 0.54
Training loss: 0.5 · 0.52
Training loss: 0.5 · 0.54
Training loss: 0.5 · 0.53
Training loss: 0.5 · 0.54
Training loss: 0.5 · 0.54
Training loss: 0.5 · 0.53
Training loss: 0.5 · 0.53
Training loss: 0.5 · 0.52
Training loss: 0.6 · 0.52
Training loss: 0.6 · 0.54
Training loss: 0.6 · 0.52
Training loss: 0.6 · 0.53
Training loss: 0.6 · 0.53
Training loss: 0.6 · 0.51
Training loss: 0.6 · 0.52
Training loss: 0.6 · 0.52
Training loss: 0.6 · 0.51
Training loss: 0.6 · 0.50
Training loss: 0.6 · 0.50
Training loss: 0.6 · 0.53
Training loss: 0.7 · 0.50
Training loss: 0.7 · 0.52
Training loss: 0.7 · 0.51
Training loss: 0.7 · 0.53
Training loss: 0.7 · 0.52
Training loss: 0.7 · 0.53
Training loss: 0.7 · 0.51
Training loss: 0.7 · 0.51
Training loss: 0.7 · 0.53
Training loss: 0.7 · 0.52
Training loss: 0.7 · 0.50
Training loss: 0.8 · 0.53
Training loss: 0.8 · 0.51
Training loss: 0.8 · 0.50
Training loss: 0.8 · 0.52
Training loss: 0.8 · 0.51
Training loss: 0.8 · 0.53
Training loss: 0.8 · 0.49
Training loss: 0.8 · 0.50
Training loss: 0.8 · 0.51
Training loss: 0.8 · 0.50
Training loss: 0.8 · 0.50
Training loss: 0.8 · 0.50
Training loss: 0.9 · 0.49
Training loss: 0.9 · 0.49
Training loss: 0.9 · 0.51
Training loss: 0.9 · 0.51
Training loss: 0.9 · 0.53
Training loss: 0.9 · 0.50
Training loss: 0.9 · 0.49
Training loss: 0.9 · 0.51
Training loss: 0.9 · 0.51
Training loss: 0.9 · 0.53
Training loss: 0.9 · 0.51
Training loss: 1.0 · 0.50
Training loss: 1.0 · 0.49
Training loss: 1.0 · 0.50
Training loss: 1.0 · 0.50
Training loss: 1.0 · 0.50
Training loss: 1.0 · 0.50
Training loss: 1.0 · 0.49
Validation loss: 0.1 · 0.63
Validation loss: 0.1 · 0.63
Validation loss: 0.1 · 0.60
Validation loss: 0.1 · 0.60
Validation loss: 0.2 · 0.58
Validation loss: 0.2 · 0.58
Validation loss: 0.3 · 0.56
Validation loss: 0.3 · 0.56
Validation loss: 0.3 · 0.55
Validation loss: 0.3 · 0.55
Validation loss: 0.4 · 0.54
Validation loss: 0.4 · 0.54
Validation loss: 0.5 · 0.54
Validation loss: 0.5 · 0.54
Validation loss: 0.6 · 0.53
Validation loss: 0.6 · 0.53
Validation loss: 0.6 · 0.52
Validation loss: 0.6 · 0.52
Validation loss: 0.7 · 0.52
Validation loss: 0.7 · 0.52
Validation loss: 0.8 · 0.52
Validation loss: 0.8 · 0.52
Validation loss: 0.8 · 0.51
Validation loss: 0.8 · 0.51
Validation loss: 0.9 · 0.51
Validation loss: 0.9 · 0.51
Validation loss: 1.0 · 0.51
Validation loss: 1.0 · 0.51
Validation loss: 1.0 · 0.51
Validation loss: 1.0 · 0.51
Each point is the average of 5 consecutive records.
Show values as a table
Training loss
0.01 0.8421
0.05 0.6483
0.10 0.5975
0.14 0.5828
0.18 0.5622
0.23 0.5602
0.27 0.5509
0.31 0.5387
0.36 0.5504
0.40 0.5220
0.45 0.5358
0.49 0.5406
0.53 0.5296
0.58 0.5333
0.62 0.5053
0.66 0.5165
0.71 0.5090
0.75 0.5308
0.80 0.5334
0.84 0.5043
0.88 0.5118
0.93 0.5051
0.97 0.5022
1.00 0.4946
Validation loss
0.07 0.6293
0.14 0.5990
0.21 0.5781
0.28 0.5642
0.35 0.5544
0.42 0.5433
0.49 0.5368
0.56 0.5298
0.63 0.5238
0.70 0.5194
0.77 0.5163
0.84 0.5139
0.91 0.5129
0.98 0.5127
1 0.5126
Live v6 vs v7: procedure exam
Live v6
v7
0%
25%
50%
75%
100%
Procedure chec…
Procedure poin…
Procedure chec…
Procedure poin…
Procedure check · legal · Live v6: 0.0%
0.0%
Procedure check · legal · v7: 98.6%
98.6%
Procedure points · legal · Live v6: 11.4%
11.4%
Procedure points · legal · v7: 81.4%
81.4%
Procedure check · general · Live v6: 0.0%
0.0%
Procedure check · general · v7: 32.9%
32.9%
Procedure points · general · Live v6: 11.4%
11.4%
Procedure points · general · v7: 45.7%
45.7%
Same 70 legal questions, live settings. Thinking on in legal mode, off in general mode.
Show values as a table
Live v6 v7
Procedure check · legal 0.00 98.60
Procedure points · legal 11.40 81.40
Procedure check · general 0.00 32.90
Procedure points · general 11.40 45.70
Technical sheet
Version v7
Release September 2026
Input Text and image
Output Text
Language Turkish -focused; responds in the same language for other languages
Open technical sheet
Previous versions
CALLAII v6 · Previous version
CALLAII v6
Previous version
Released September 2026
CALLAII v6 powers all AI surfaces within the Callmenta panel. It was trained on data generated from scratch for this purpose; every sample passed rule-based checks and a judge evaluation.
What improved in this version
Petition and contract style was learned from real documents of the law firm we work with
Contract drafting and evidence review were added
Multi-turn conversation and tool use were strengthened
Training was regularly evaluated on 740 unseen samples; validation error decreased at every measurement, and the model did not memorize
What it does
Call analysis: summary, action items, missed opportunities, and criteria scorecard from call transcripts
Coaching: evidence-based feedback for agent performance
Live support: answers visitor questions and escalates to a human when needed
CRM and reporting: customer card summary, metric interpretation, and commentary
CALLAII Legal: drafting petitions and contracts, document analysis, and legal/regulatory/case-law queries
KVKK masking: extracting personal data from text
Tool use: search, record creation, and document retrieval within the panel
Visual reading: understanding documents and screenshots
Limitations and responsible use
Legal knowledge does not come from the model's memory; laws, regulations, and rulings are retrieved from the current library each time
Generated text is a draft; petitions, contracts, and official correspondence must be approved by an authorized person
Numbers and dates must be verified; the model was trained to state missing information rather than fabricate it
Very long documents are processed in segments
Quality in languages other than Turkish has not been measured with the same granularity as Turkish
Training and measurements
3.101 Step
2 Epoch
0,4729 Final validation loss
Training data 37,102 samples, 118 million tokens
Quality filtering 37,600 of 47,872 generated samples were accepted
Validation set 740 samples never seen during training
Steps 3,101 · 2 epochs · 96,000 tokens per step
Training context 12,288 tokens
Validation loss 0.7435 → 0.4729
Training date September 2026
Training and validation loss
Training loss
Validation loss
0.0
0.2
0.4
0.6
0.8
0
1,000
2,000
3,000
Step
Training loss
Validation loss
Training loss: 0 · 0.78
Training loss: 0 · 0.78
Training loss: 2,700 · 0.40
Training loss: 2,700 · 0.40
Training loss: 3,101 · 0.38
Training loss: 3,101 · 0.38
Validation loss: 0 · 0.74
Validation loss: 0 · 0.74
Validation loss: 2,700 · 0.47
Validation loss: 2,700 · 0.47
Validation loss: 3,101 · 0.47
Validation loss: 3,101 · 0.47
Only measured points; records of intermediate steps were not retained.
Show values as a table
Training loss
0 0.7800
2,700 0.3951
3,101 0.3763
Validation loss
0 0.7435
2,700 0.4730
3,101 0.4729
Training data filtering (example)
0
20,000
40,000
60,000
Generated
Accepted
Training
Validation
Generated · Samples: 47,872.0
47,872.0
Accepted · Samples: 37,600.0
37,600.0
Training · Samples: 37,102.0
37,102.0
Validation · Samples: 740.0
740.0
Every generated sample passed rule-based checks and judge evaluation; those that failed were discarded.
Show values as a table
Samples
Generated 47,872.00
Accepted 37,600.00
Training 37,102.00
Validation 740.00
Technical sheet
Version v6
Release September 2026
Input Text and images
Output Text
Language Turkish -focused; other languages answered in the same language
Customer data not used for training
Hosting servers managed by Callmenta; your data is not sent to a third-party AI provider
Open technical sheet
CALLAII v5 · Previous version
CALLAII v5
Previous version
Released September 2026
CALLAII 's first comprehensive release.
What improved in this version
Call center, coaching, and live support surfaces unified in a single model.
Training and measurements
411 Step
1 Epoch
0,4867 Final validation loss
Training data 45,000 samples, 15 categories, 9 languages
Steps 411 · 1 epoch
Tokens processed 26.7 million
Final validation loss 0.4867
Validation token accuracy 85.4%
Training and validation loss
Training loss
Validation loss
0
1
2
3
100
200
300
400
Step
Training loss
Validation loss
Training loss: 10 · 2.73
Training loss: 20 · 2.13
Training loss: 30 · 1.25
Training loss: 40 · 0.94
Training loss: 50 · 0.84
Training loss: 60 · 0.77
Training loss: 70 · 0.70
Training loss: 80 · 0.64
Training loss: 90 · 0.61
Training loss: 100 · 0.61
Training loss: 110 · 0.58
Training loss: 120 · 0.58
Training loss: 130 · 0.57
Training loss: 140 · 0.55
Training loss: 150 · 0.56
Training loss: 160 · 0.55
Training loss: 170 · 0.54
Training loss: 180 · 0.56
Training loss: 190 · 0.56
Training loss: 200 · 0.52
Training loss: 210 · 0.54
Training loss: 220 · 0.51
Training loss: 230 · 0.54
Training loss: 240 · 0.52
Training loss: 250 · 0.51
Training loss: 260 · 0.50
Training loss: 270 · 0.50
Training loss: 280 · 0.52
Training loss: 290 · 0.51
Training loss: 300 · 0.49
Training loss: 310 · 0.50
Training loss: 320 · 0.51
Training loss: 330 · 0.50
Training loss: 340 · 0.48
Training loss: 350 · 0.47
Training loss: 360 · 0.51
Training loss: 370 · 0.49
Training loss: 380 · 0.50
Training loss: 390 · 0.50
Training loss: 400 · 0.51
Training loss: 410 · 0.50
Validation loss: 40 · 0.88
Validation loss: 40 · 0.88
Validation loss: 80 · 0.62
Validation loss: 80 · 0.62
Validation loss: 120 · 0.57
Validation loss: 120 · 0.57
Validation loss: 160 · 0.54
Validation loss: 160 · 0.54
Validation loss: 200 · 0.52
Validation loss: 200 · 0.52
Validation loss: 240 · 0.51
Validation loss: 240 · 0.51
Validation loss: 280 · 0.50
Validation loss: 280 · 0.50
Validation loss: 320 · 0.49
Validation loss: 320 · 0.49
Validation loss: 360 · 0.49
Validation loss: 360 · 0.49
Validation loss: 400 · 0.49
Validation loss: 400 · 0.49
Validation loss: 411 · 0.49
Validation loss: 411 · 0.49
Show values as a table
Training loss
10 2.7335
30 1.2499
50 0.8402
70 0.7024
90 0.6135
110 0.5847
130 0.5689
150 0.5584
170 0.5385
190 0.5599
210 0.5412
230 0.5371
250 0.5122
270 0.5038
290 0.5125
310 0.5011
330 0.4956
350 0.4728
370 0.4874
390 0.4968
410 0.4969
Validation loss
40 0.8849
80 0.6208
120 0.5651
160 0.5402
200 0.5221
240 0.5106
280 0.5010
320 0.4927
360 0.4880
400 0.4867
411 0.4867
Token accuracy (%)
Training
Validation
50%
60%
70%
80%
90%
100
200
300
400
Step
Training
Validation
Training: 10 · 57.20%
Training: 20 · 62.39%
Training: 30 · 70.07%
Training: 40 · 75.85%
Training: 50 · 78.02%
Training: 60 · 79.40%
Training: 70 · 80.74%
Training: 80 · 82.12%
Training: 90 · 82.59%
Training: 100 · 82.66%
Training: 110 · 83.02%
Training: 120 · 83.18%
Training: 130 · 83.40%
Training: 140 · 83.70%
Training: 150 · 83.64%
Training: 160 · 83.54%
Training: 170 · 84.01%
Training: 180 · 83.55%
Training: 190 · 83.63%
Training: 200 · 84.33%
Training: 210 · 83.78%
Training: 220 · 84.54%
Training: 230 · 83.92%
Training: 240 · 84.32%
Training: 250 · 84.41%
Training: 260 · 84.74%
Training: 270 · 84.64%
Training: 280 · 84.24%
Training: 290 · 84.49%
Training: 300 · 85.05%
Training: 310 · 84.78%
Training: 320 · 84.73%
Training: 330 · 84.86%
Training: 340 · 85.15%
Training: 350 · 85.33%
Training: 360 · 84.60%
Training: 370 · 85.09%
Training: 380 · 84.89%
Training: 390 · 84.94%
Training: 400 · 84.42%
Training: 410 · 84.81%
Validation: 40 · 77.40%
Validation: 40 · 77.40%
Validation: 80 · 82.75%
Validation: 80 · 82.75%
Validation: 120 · 83.79%
Validation: 120 · 83.79%
Validation: 160 · 84.25%
Validation: 160 · 84.25%
Validation: 200 · 84.61%
Validation: 200 · 84.61%
Validation: 240 · 84.85%
Validation: 240 · 84.85%
Validation: 280 · 85.04%
Validation: 280 · 85.04%
Validation: 320 · 85.23%
Validation: 320 · 85.23%
Validation: 360 · 85.32%
Validation: 360 · 85.32%
Validation: 400 · 85.37%
Validation: 400 · 85.37%
Validation: 411 · 85.37%
Validation: 411 · 85.37%
Show values as a table
Training
10 57.20
30 70.07
50 78.02
70 80.74
90 82.59
110 83.02
130 83.40
150 83.64
170 84.01
190 83.63
210 83.78
230 83.92
250 84.41
270 84.64
290 84.49
310 84.78
330 84.86
350 85.33
370 85.09
390 84.94
410 84.81
Validation
40 77.40
80 82.75
120 83.79
160 84.25
200 84.61
240 84.85
280 85.04
320 85.23
360 85.32
400 85.37
411 85.37
Technical sheet
Version v5
Release September 2026
Status Superseded by v6
Open technical sheet
CALLAII ®
by CALLMENTA
CALLAII Edge
Language model
The CALLAII language model prepared to run on the organization's own server.
CALLAII Edge v1
In training
CALLAII Edge is currently in training. The goal is to consolidate CALLAII 's legal and call center capabilities into a model that runs on the organization's own server. The graph below is updated regularly during training.
What improved in this version
Goal: Identify the competent and authorized court, litigation prerequisites, and deadlines for a legal question
Goal: Introduce itself as CALLAII under all circumstances
Results will be published here after training is complete, using the same exam taken before training
Training and measurements
0,49 Epoch
0,6186 Final validation loss
Status In training
Training data 45,847 samples
Validation set 200 samples never seen during training
Training context 4,096 tokens
Training date September 2026
Training and validation loss
Training loss
Validation loss
0
2
4
6
0.1
0.2
0.3
0.4
Epoch
Training loss
Validation loss
Training loss: 0.0 · 5.09
Training loss: 0.0 · 2.96
Training loss: 0.0 · 1.32
Training loss: 0.0 · 1.02
Training loss: 0.0 · 0.95
Training loss: 0.0 · 0.88
Training loss: 0.0 · 0.85
Training loss: 0.0 · 0.83
Training loss: 0.0 · 0.79
Training loss: 0.1 · 0.76
Training loss: 0.1 · 0.78
Training loss: 0.1 · 0.78
Training loss: 0.1 · 0.79
Training loss: 0.1 · 0.73
Training loss: 0.1 · 0.71
Training loss: 0.1 · 0.76
Training loss: 0.1 · 0.72
Training loss: 0.1 · 0.73
Training loss: 0.1 · 0.77
Training loss: 0.1 · 0.75
Training loss: 0.1 · 0.71
Training loss: 0.1 · 0.71
Training loss: 0.1 · 0.71
Training loss: 0.1 · 0.70
Training loss: 0.1 · 0.67
Training loss: 0.1 · 0.70
Training loss: 0.1 · 0.68
Training loss: 0.1 · 0.70
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.67
Training loss: 0.2 · 0.70
Training loss: 0.2 · 0.67
Training loss: 0.2 · 0.63
Training loss: 0.2 · 0.67
Training loss: 0.2 · 0.69
Training loss: 0.2 · 0.67
Training loss: 0.2 · 0.66
Training loss: 0.2 · 0.69
Training loss: 0.2 · 0.65
Training loss: 0.2 · 0.66
Training loss: 0.2 · 0.66
Training loss: 0.2 · 0.62
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.66
Training loss: 0.2 · 0.66
Training loss: 0.2 · 0.67
Training loss: 0.3 · 0.64
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.67
Training loss: 0.3 · 0.62
Training loss: 0.3 · 0.64
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.64
Training loss: 0.3 · 0.64
Training loss: 0.3 · 0.63
Training loss: 0.3 · 0.60
Training loss: 0.3 · 0.63
Training loss: 0.3 · 0.64
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.64
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.61
Training loss: 0.4 · 0.68
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.60
Training loss: 0.4 · 0.61
Training loss: 0.4 · 0.62
Training loss: 0.4 · 0.60
Training loss: 0.4 · 0.64
Training loss: 0.4 · 0.66
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.61
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.59
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.62
Training loss: 0.5 · 0.64
Training loss: 0.5 · 0.63
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.61
Training loss: 0.5 · 0.60
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.60
Validation loss: 0.1 · 0.74
Validation loss: 0.1 · 0.74
Validation loss: 0.3 · 0.63
Validation loss: 0.3 · 0.63
Validation loss: 0.4 · 0.62
Validation loss: 0.4 · 0.62
Each point is the average of 3 consecutive records.
Show values as a table
Training loss
0.01 5.0917
0.03 0.9474
0.05 0.7875
0.07 0.7862
0.09 0.7166
0.11 0.7118
0.13 0.6670
0.15 0.6756
0.17 0.6324
0.19 0.6646
0.22 0.6551
0.24 0.6583
0.26 0.6638
0.28 0.6530
0.30 0.6599
0.32 0.6420
0.34 0.6337
0.36 0.6260
0.38 0.6009
0.40 0.6391
0.42 0.6311
0.45 0.6200
0.47 0.6200
0.49 0.6187
0.49 0.6022
Validation loss
0.07 0.7438
0.35 0.6291
0.42 0.6186
Open technical sheet
CALLAII ®
by CALLMENTA
CALLAII Edge Small Business
Language model
A compact CALLAII language model prepared to run on small businesses' own hardware.
CALLAII Edge Small Business v1
Live
Released September 2026
CALLAII Edge Small Business is designed for businesses that want a compact CALLAII running on their own server. It automatically checks procedural requirements in legal questions and reads document images.
What improved in this version
First release
Procedural check in legal questions: performed in 67 out of 70 exam questions, none before training
Procedural check points improved from 9 to 57 across 70 questions
Text extraction and image description from document images were fully preserved after training
What it does
Legal: petition and contract drafting, procedural check on legal questions
Procedural check: competent and authorized court, conditions of action, and deadlines
Call center: call summary, customer response, and quality evaluation
Visual reading: understanding text and content in documents and screenshots
Limitations and responsible use
Generated text is a draft; petitions, contracts, and official documents must be approved by an authorized person
Must be used together with a legislation library for current laws, regulations, and rulings; the model's memory is not up to date
Audio recordings are transcribed with CALLAII ASR; this model is not used for speech recognition
Quality in languages other than Turkish has not been measured in as much detail as Turkish
Training and measurements
1 Epoch
0,810 → 0,605 Validation loss
In 67 out of 70 questions Procedural check
Training data 45,847 samples
Validation set 200 samples never seen during training
Steps 2,861 · 1 epoch · 16 samples per step
Training context 4,096 tokens
Validation loss 0.810 → 0.605
Exam 70 procedural questions, same questions before and after training
Training date September 2026
Training and validation loss
Training loss
Validation loss
0
1
2
3
0.2
0.4
0.6
0.8
1.0
Epoch
Training loss
Validation loss
Training loss: 0.0 · 2.09
Training loss: 0.0 · 0.99
Training loss: 0.0 · 0.88
Training loss: 0.0 · 0.81
Training loss: 0.0 · 0.83
Training loss: 0.1 · 0.82
Training loss: 0.1 · 0.78
Training loss: 0.1 · 0.81
Training loss: 0.1 · 0.76
Training loss: 0.1 · 0.78
Training loss: 0.1 · 0.77
Training loss: 0.1 · 0.81
Training loss: 0.1 · 0.74
Training loss: 0.1 · 0.76
Training loss: 0.1 · 0.72
Training loss: 0.1 · 0.73
Training loss: 0.1 · 0.74
Training loss: 0.2 · 0.70
Training loss: 0.2 · 0.70
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.70
Training loss: 0.2 · 0.69
Training loss: 0.2 · 0.72
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.68
Training loss: 0.2 · 0.67
Training loss: 0.2 · 0.68
Training loss: 0.3 · 0.68
Training loss: 0.3 · 0.69
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.69
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.65
Training loss: 0.3 · 0.68
Training loss: 0.3 · 0.67
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.64
Training loss: 0.3 · 0.66
Training loss: 0.3 · 0.66
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.71
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.65
Training loss: 0.4 · 0.63
Training loss: 0.4 · 0.62
Training loss: 0.4 · 0.67
Training loss: 0.4 · 0.63
Training loss: 0.5 · 0.64
Training loss: 0.5 · 0.65
Training loss: 0.5 · 0.63
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.64
Training loss: 0.5 · 0.66
Training loss: 0.5 · 0.63
Training loss: 0.5 · 0.63
Training loss: 0.5 · 0.63
Training loss: 0.5 · 0.62
Training loss: 0.5 · 0.64
Training loss: 0.6 · 0.60
Training loss: 0.6 · 0.65
Training loss: 0.6 · 0.63
Training loss: 0.6 · 0.62
Training loss: 0.6 · 0.61
Training loss: 0.6 · 0.63
Training loss: 0.6 · 0.64
Training loss: 0.6 · 0.62
Training loss: 0.6 · 0.64
Training loss: 0.6 · 0.63
Training loss: 0.6 · 0.63
Training loss: 0.6 · 0.64
Training loss: 0.7 · 0.62
Training loss: 0.7 · 0.60
Training loss: 0.7 · 0.62
Training loss: 0.7 · 0.60
Training loss: 0.7 · 0.61
Training loss: 0.7 · 0.62
Training loss: 0.7 · 0.61
Training loss: 0.7 · 0.61
Training loss: 0.7 · 0.61
Training loss: 0.7 · 0.61
Training loss: 0.7 · 0.63
Training loss: 0.8 · 0.60
Training loss: 0.8 · 0.59
Training loss: 0.8 · 0.60
Training loss: 0.8 · 0.59
Training loss: 0.8 · 0.62
Training loss: 0.8 · 0.63
Training loss: 0.8 · 0.59
Training loss: 0.8 · 0.62
Training loss: 0.8 · 0.59
Training loss: 0.8 · 0.63
Training loss: 0.8 · 0.60
Training loss: 0.8 · 0.58
Training loss: 0.9 · 0.59
Training loss: 0.9 · 0.59
Training loss: 0.9 · 0.58
Training loss: 0.9 · 0.60
Training loss: 0.9 · 0.59
Training loss: 0.9 · 0.63
Training loss: 0.9 · 0.61
Training loss: 0.9 · 0.60
Training loss: 0.9 · 0.60
Training loss: 0.9 · 0.67
Training loss: 0.9 · 0.58
Training loss: 1.0 · 0.59
Training loss: 1.0 · 0.58
Training loss: 1.0 · 0.63
Training loss: 1.0 · 0.60
Training loss: 1.0 · 0.59
Training loss: 1.0 · 0.61
Training loss: 1.0 · 0.59
Validation loss: 0.1 · 0.78
Validation loss: 0.1 · 0.78
Validation loss: 0.2 · 0.70
Validation loss: 0.2 · 0.70
Validation loss: 0.3 · 0.68
Validation loss: 0.3 · 0.68
Validation loss: 0.3 · 0.66
Validation loss: 0.3 · 0.66
Validation loss: 0.4 · 0.65
Validation loss: 0.4 · 0.65
Validation loss: 0.5 · 0.65
Validation loss: 0.5 · 0.65
Validation loss: 0.6 · 0.64
Validation loss: 0.6 · 0.64
Validation loss: 0.6 · 0.64
Validation loss: 0.6 · 0.64
Validation loss: 0.7 · 0.62
Validation loss: 0.7 · 0.62
Validation loss: 0.8 · 0.61
Validation loss: 0.8 · 0.61
Validation loss: 0.8 · 0.61
Validation loss: 0.8 · 0.61
Validation loss: 0.9 · 0.61
Validation loss: 0.9 · 0.61
Validation loss: 1.0 · 0.60
Validation loss: 1.0 · 0.60
Validation loss: 1.0 · 0.61
Validation loss: 1.0 · 0.61
Each point is the average of 5 consecutive records.
Show values as a table
Training loss
0.01 2.0882
0.05 0.8227
0.10 0.7656
0.14 0.7346
0.18 0.6991
0.23 0.6836
0.27 0.6616
0.31 0.6667
0.36 0.6545
0.40 0.6291
0.45 0.6276
0.49 0.6401
0.53 0.6182
0.58 0.6186
0.62 0.6388
0.66 0.5980
0.71 0.6144
0.75 0.6025
0.80 0.6273
0.84 0.6025
0.88 0.6050
0.93 0.5961
0.97 0.6281
1.00 0.5878
Validation loss
0.14 0.7797
0.21 0.7025
0.28 0.6809
0.35 0.6608
0.42 0.6528
0.49 0.6549
0.56 0.6427
0.63 0.6439
0.70 0.6169
0.77 0.6117
0.84 0.6079
0.91 0.6055
0.98 0.6049
1 0.6050
Pre- and post-training exam
Before training
After training
0%
25%
50%
75%
100%
Court and juri…
Procedural poi…
Court and jurisdiction · Before training: 0.0%
0.0%
Court and jurisdiction · After training: 95.7%
95.7%
Procedural points · Before training: 12.9%
12.9%
Procedural points · After training: 81.4%
81.4%
70 procedural questions, same questions before and after training.
Show values as a table
Before training After training
Court and jurisdiction 0.00 95.70
Procedural points 12.90 81.40
Technical sheet
Version v1
Release September 2026
Input Text and image
Output Text
Language Turkish -focused; responds in the same language for other languages
Runs on the business's own server
Open technical sheet
CALLAII ®
by CALLMENTA
CALLAII ASR
Speech recognition
A speech recognition model that separates call recordings into speaker channels and converts them into text. Analysis, coaching, and quality scoring operate on this transcription.
CALLAII ASR v4
Live
Released September 2026
Separates call recordings into speaker channels and converts them to text. This version was trained on ten languages and phone-line-simulated audio; error rates in call center conversations dropped significantly.
What improved in this version
Turkish word error rate in call center scenarios dropped from 25.70% to 6.32%
Error rates in Arabic, German, French, English, and Italian fell to one-quarter and one-fifth; per-language results shown in the chart
Improved on read Turkish speech as well: 4.72% → 4.47% (800 recordings)
Trained on phone-line, noisy-environment, and studio versions of the same text
Previous version's data included in training; new data added without degrading learned knowledge
What it does
Transcribes customer and agent separately in two-channel recordings
Detects each channel's language independently
Produces timestamped, speaker-labeled transcripts
Leaves silent sections blank; trained not to generate hallucinated sentences
Limitations and responsible use
Measurements were made on test sets; reference-based error rate on real phone calls has not yet been measured
Error increases with overlapping speech and very low-quality recordings
Real-time transcription latency was not measured
Training and measurements
19.369 Step
1 Epoch
0,0981 Final validation loss
%9,41 Final word error rate
%2,82 Final character error rate
Training data 2,479,180 recordings, 3,654 hours of audio
New data share 26.5%; remainder from previous version
Languages Turkish , Arabic, German, French, Kazakh, Italian, English, Bashkir, Uzbek, Tatar
Audio types phone-line simulation, noisy environment, studio
Validation set 11,859 recordings
Steps 19,369 · 1 epoch
Training date September 2026
Training loss
0
5
10
15
5,000
10,000
15,000
Step
Training loss
Training loss: 175 · 10.81
Training loss: 350 · 8.66
Training loss: 525 · 7.60
Training loss: 700 · 7.07
Training loss: 875 · 6.61
Training loss: 1,050 · 6.46
Training loss: 1,225 · 6.17
Training loss: 1,400 · 6.18
Training loss: 1,575 · 5.93
Training loss: 1,750 · 5.77
Training loss: 1,925 · 5.65
Training loss: 2,100 · 5.73
Training loss: 2,275 · 5.54
Training loss: 2,450 · 5.41
Training loss: 2,625 · 5.55
Training loss: 2,800 · 5.33
Training loss: 2,975 · 5.34
Training loss: 3,150 · 5.20
Training loss: 3,325 · 5.12
Training loss: 3,500 · 5.12
Training loss: 3,675 · 5.02
Training loss: 3,850 · 4.99
Training loss: 4,025 · 4.94
Training loss: 4,200 · 4.99
Training loss: 4,375 · 4.91
Training loss: 4,550 · 4.74
Training loss: 4,725 · 4.77
Training loss: 4,900 · 4.85
Training loss: 5,075 · 4.82
Training loss: 5,250 · 4.71
Training loss: 5,425 · 4.61
Training loss: 5,600 · 4.58
Training loss: 5,775 · 4.61
Training loss: 5,950 · 4.55
Training loss: 6,125 · 4.63
Training loss: 6,300 · 4.61
Training loss: 6,475 · 4.57
Training loss: 6,650 · 4.54
Training loss: 6,825 · 4.53
Training loss: 7,000 · 4.50
Training loss: 7,175 · 4.50
Training loss: 7,350 · 4.46
Training loss: 7,525 · 4.53
Training loss: 7,700 · 4.44
Training loss: 7,875 · 4.41
Training loss: 8,050 · 4.39
Training loss: 8,225 · 4.45
Training loss: 8,400 · 4.41
Training loss: 8,575 · 4.40
Training loss: 8,750 · 4.43
Training loss: 8,925 · 4.44
Training loss: 9,100 · 4.28
Training loss: 9,275 · 4.34
Training loss: 9,450 · 4.24
Training loss: 9,625 · 4.20
Training loss: 9,800 · 4.34
Training loss: 9,975 · 4.30
Training loss: 10,150 · 4.28
Training loss: 10,325 · 4.29
Training loss: 10,500 · 4.22
Training loss: 10,675 · 4.23
Training loss: 10,850 · 4.21
Training loss: 11,025 · 4.26
Training loss: 11,200 · 4.28
Training loss: 11,375 · 4.23
Training loss: 11,550 · 4.18
Training loss: 11,725 · 4.15
Training loss: 11,900 · 4.15
Training loss: 12,075 · 4.10
Training loss: 12,250 · 4.16
Training loss: 12,425 · 4.28
Training loss: 12,600 · 4.22
Training loss: 12,775 · 4.27
Training loss: 12,950 · 4.21
Training loss: 13,125 · 4.19
Training loss: 13,300 · 4.16
Training loss: 13,475 · 4.10
Training loss: 13,650 · 4.15
Training loss: 13,825 · 4.20
Training loss: 14,000 · 4.12
Training loss: 14,175 · 4.15
Training loss: 14,350 · 4.16
Training loss: 14,525 · 4.14
Training loss: 14,700 · 4.13
Training loss: 14,875 · 4.12
Training loss: 15,050 · 4.17
Training loss: 15,225 · 3.98
Training loss: 15,400 · 4.18
Training loss: 15,575 · 4.07
Training loss: 15,750 · 4.17
Training loss: 15,925 · 4.08
Training loss: 16,100 · 4.06
Training loss: 16,275 · 4.12
Training loss: 16,450 · 4.15
Training loss: 16,625 · 4.07
Training loss: 16,800 · 4.00
Training loss: 16,975 · 4.13
Training loss: 17,150 · 4.04
Training loss: 17,325 · 4.11
Training loss: 17,500 · 4.15
Training loss: 17,675 · 4.05
Training loss: 17,850 · 4.04
Training loss: 18,025 · 4.13
Training loss: 18,200 · 4.06
Training loss: 18,375 · 4.10
Training loss: 18,550 · 4.20
Training loss: 18,725 · 3.94
Training loss: 18,900 · 4.06
Training loss: 19,075 · 4.09
Training loss: 19,250 · 4.07
Training loss: 19,350 · 4.02
Each point is the average of 7 consecutive recordings.
Show values as a table
Training loss
175 10.8073
1,050 6.4649
1,925 5.6508
2,800 5.3350
3,675 5.0206
4,550 4.7431
5,425 4.6104
6,300 4.6143
7,175 4.5038
8,050 4.3882
8,925 4.4358
9,800 4.3362
10,675 4.2276
11,550 4.1843
12,425 4.2788
13,300 4.1626
14,175 4.1483
15,050 4.1727
15,925 4.0753
16,800 4.0031
17,675 4.0504
18,550 4.2040
19,350 4.0197
Validation loss
0.00
0.05
0.10
0.15
0.20
5,000
10,000
15,000
Step
Validation loss
Validation loss: 1,000 · 0.19
Validation loss: 1,000 · 0.19
Validation loss: 2,000 · 0.16
Validation loss: 2,000 · 0.16
Validation loss: 3,000 · 0.14
Validation loss: 3,000 · 0.14
Validation loss: 4,000 · 0.13
Validation loss: 4,000 · 0.13
Validation loss: 5,000 · 0.13
Validation loss: 5,000 · 0.13
Validation loss: 6,000 · 0.12
Validation loss: 6,000 · 0.12
Validation loss: 7,000 · 0.11
Validation loss: 7,000 · 0.11
Validation loss: 8,000 · 0.11
Validation loss: 8,000 · 0.11
Validation loss: 9,000 · 0.11
Validation loss: 9,000 · 0.11
Validation loss: 10,000 · 0.10
Validation loss: 10,000 · 0.10
Validation loss: 11,000 · 0.10
Validation loss: 11,000 · 0.10
Validation loss: 12,000 · 0.10
Validation loss: 12,000 · 0.10
Validation loss: 13,000 · 0.10
Validation loss: 13,000 · 0.10
Validation loss: 14,000 · 0.10
Validation loss: 14,000 · 0.10
Validation loss: 15,000 · 0.10
Validation loss: 15,000 · 0.10
Validation loss: 16,000 · 0.10
Validation loss: 16,000 · 0.10
Validation loss: 17,000 · 0.10
Validation loss: 17,000 · 0.10
Validation loss: 18,000 · 0.10
Validation loss: 18,000 · 0.10
Validation loss: 19,000 · 0.10
Validation loss: 19,000 · 0.10
Validation loss: 19,369 · 0.10
Validation loss: 19,369 · 0.10
Measured on examples never seen in training; a falling curve shows the model learns rather than memorises.
Show values as a table
Validation loss
1,000 0.1911
2,000 0.1611
3,000 0.1446
4,000 0.1345
5,000 0.1259
6,000 0.1187
7,000 0.1135
8,000 0.1097
9,000 0.1068
10,000 0.1050
11,000 0.1025
12,000 0.1021
13,000 0.1010
14,000 0.0997
15,000 0.0994
16,000 0.0985
17,000 0.0985
18,000 0.0984
19,000 0.0980
19,369 0.0981
Error rate on validation (%)
Word error rate (WER)
Character error rate (CER)
0%
5%
10%
15%
20%
5,000
10,000
15,000
Step
Word error rate (WER)
Character error rate (CER)
Word error rate (WER): 1,000 · 15.03%
Word error rate (WER): 1,000 · 15.03%
Word error rate (WER): 2,000 · 13.22%
Word error rate (WER): 2,000 · 13.22%
Word error rate (WER): 3,000 · 12.06%
Word error rate (WER): 3,000 · 12.06%
Word error rate (WER): 4,000 · 10.78%
Word error rate (WER): 4,000 · 10.78%
Word error rate (WER): 5,000 · 10.51%
Word error rate (WER): 5,000 · 10.51%
Word error rate (WER): 6,000 · 10.01%
Word error rate (WER): 6,000 · 10.01%
Word error rate (WER): 7,000 · 9.60%
Word error rate (WER): 7,000 · 9.60%
Word error rate (WER): 8,000 · 9.72%
Word error rate (WER): 8,000 · 9.72%
Word error rate (WER): 9,000 · 9.52%
Word error rate (WER): 9,000 · 9.52%
Word error rate (WER): 10,000 · 9.43%
Word error rate (WER): 10,000 · 9.43%
Word error rate (WER): 11,000 · 9.36%
Word error rate (WER): 11,000 · 9.36%
Word error rate (WER): 12,000 · 9.35%
Word error rate (WER): 12,000 · 9.35%
Word error rate (WER): 13,000 · 9.38%
Word error rate (WER): 13,000 · 9.38%
Word error rate (WER): 14,000 · 9.52%
Word error rate (WER): 14,000 · 9.52%
Word error rate (WER): 15,000 · 9.23%
Word error rate (WER): 15,000 · 9.23%
Word error rate (WER): 16,000 · 9.36%
Word error rate (WER): 16,000 · 9.36%
Word error rate (WER): 17,000 · 9.35%
Word error rate (WER): 17,000 · 9.35%
Word error rate (WER): 18,000 · 9.36%
Word error rate (WER): 18,000 · 9.36%
Word error rate (WER): 19,000 · 9.24%
Word error rate (WER): 19,000 · 9.24%
Word error rate (WER): 19,369 · 9.41%
Word error rate (WER): 19,369 · 9.41%
Character error rate (CER): 1,000 · 4.24%
Character error rate (CER): 1,000 · 4.24%
Character error rate (CER): 2,000 · 3.85%
Character error rate (CER): 2,000 · 3.85%
Character error rate (CER): 3,000 · 3.47%
Character error rate (CER): 3,000 · 3.47%
Character error rate (CER): 4,000 · 3.13%
Character error rate (CER): 4,000 · 3.13%
Character error rate (CER): 5,000 · 3.01%
Character error rate (CER): 5,000 · 3.01%
Character error rate (CER): 6,000 · 2.94%
Character error rate (CER): 6,000 · 2.94%
Character error rate (CER): 7,000 · 2.87%
Character error rate (CER): 7,000 · 2.87%
Character error rate (CER): 8,000 · 2.89%
Character error rate (CER): 8,000 · 2.89%
Character error rate (CER): 9,000 · 2.89%
Character error rate (CER): 9,000 · 2.89%
Character error rate (CER): 10,000 · 2.85%
Character error rate (CER): 10,000 · 2.85%
Character error rate (CER): 11,000 · 2.88%
Character error rate (CER): 11,000 · 2.88%
Character error rate (CER): 12,000 · 2.81%
Character error rate (CER): 12,000 · 2.81%
Character error rate (CER): 13,000 · 2.92%
Character error rate (CER): 13,000 · 2.92%
Character error rate (CER): 14,000 · 2.93%
Character error rate (CER): 14,000 · 2.93%
Character error rate (CER): 15,000 · 2.80%
Character error rate (CER): 15,000 · 2.80%
Character error rate (CER): 16,000 · 2.83%
Character error rate (CER): 16,000 · 2.83%
Character error rate (CER): 17,000 · 2.77%
Character error rate (CER): 17,000 · 2.77%
Character error rate (CER): 18,000 · 2.80%
Character error rate (CER): 18,000 · 2.80%
Character error rate (CER): 19,000 · 2.72%
Character error rate (CER): 19,000 · 2.72%
Character error rate (CER): 19,369 · 2.82%
Character error rate (CER): 19,369 · 2.82%
Lower is better. Measured on the validation set throughout training.
Show values as a table
Word error rate (WER)
1,000 15.03
2,000 13.22
3,000 12.06
4,000 10.78
5,000 10.51
6,000 10.01
7,000 9.60
8,000 9.72
9,000 9.52
10,000 9.43
11,000 9.36
12,000 9.35
13,000 9.38
14,000 9.52
15,000 9.23
16,000 9.36
17,000 9.35
18,000 9.36
19,000 9.24
19,369 9.41
Character error rate (CER)
1,000 4.24
2,000 3.85
3,000 3.47
4,000 3.13
5,000 3.01
6,000 2.94
7,000 2.87
8,000 2.89
9,000 2.89
10,000 2.85
11,000 2.88
12,000 2.81
13,000 2.92
14,000 2.93
15,000 2.80
16,000 2.83
17,000 2.77
18,000 2.80
19,000 2.72
19,369 2.82
Call center evaluation · Per-language word error rate (%)
v3
v4
0%
20%
40%
60%
80%
Arabic
German
English
French
Italian
Turkish
Arabic · v3: 67.6%
67.6%
Arabic · v4: 13.9%
13.9%
German · v3: 54.6%
54.6%
German · v4: 15.4%
15.4%
English · v3: 59.9%
59.9%
English · v4: 12.6%
12.6%
French · v3: 62.4%
62.4%
French · v4: 15.6%
15.6%
Italian · v3: 38.9%
38.9%
Italian · v4: 8.4%
8.4%
Turkish · v3: 25.7%
25.7%
Turkish · v4: 6.3%
6.3%
Lower is better. 300 samples per language.
Show values as a table
v3 v4
Arabic 67.59 13.86
German 54.58 15.37
English 59.92 12.58
French 62.36 15.57
Italian 38.88 8.42
Turkish 25.70 6.32
Call center evaluation · Per-language character error rate (%)
v3
v4
0%
20%
40%
60%
Arabic
German
English
French
Italian
Turkish
Arabic · v3: 48.6%
48.6%
Arabic · v4: 5.8%
5.8%
German · v3: 46.0%
46.0%
German · v4: 7.2%
7.2%
English · v3: 44.4%
44.4%
English · v4: 6.2%
6.2%
French · v3: 47.9%
47.9%
French · v4: 7.3%
7.3%
Italian · v3: 26.9%
26.9%
Italian · v4: 3.5%
3.5%
Turkish · v3: 10.5%
10.5%
Turkish · v4: 2.0%
2.0%
Lower is better. 300 samples per language.
Show values as a table
v3 v4
Arabic 48.62 5.76
German 46.00 7.23
English 44.41 6.23
French 47.92 7.34
Italian 26.92 3.45
Turkish 10.47 1.96
Read Turkish speech · Per-language word error rate (%)
v3
v4
0%
2%
4%
6%
Turkish
Turkish · v3: 4.7%
4.7%
Turkish · v4: 4.5%
4.5%
Lower is better. 800 samples per language.
Show values as a table
Read Turkish speech · Per-language character error rate (%)
v3
v4
0.0%
0.5%
1.0%
1.5%
Turkish
Turkish · v3: 1.1%
1.1%
Turkish · v4: 1.0%
1.0%
Lower is better. 800 samples per language.
Show values as a table
Technical sheet
Version v4
Release 8 September 2026
Input Audio recording, single or dual channel
Output Speaker-labeled, timestamped text
Language detection Automatic per channel
Runs on Servers managed by Callmenta
Open technical sheet
Previous versions
CALLAII ASR v3 · Previous version
CALLAII ASR v3
Previous version
Released August 2026
Version with extensive multilingual training. Phone line simulation and silence detection were added in this version.
What improved in this version
Turkish word error rate dropped from 8.87% to 7.11% on the open benchmark set
Arabic dropped from 7.96% to 7.82%
Learned to leave silent sections blank; hallucinated sentences decreased
No degradation observed at the end of long calls (571-second real call)
Automatic language detection per channel has begun
Limitations and responsible use
The open benchmark set consists of read news sentences; it does not represent absolute success in phone calls
Error rates were high in languages other than Turkish in call center scenarios; resolved in v4
Training and measurements
11.540 Step
1 Epoch
0,1315 Final validation loss
%10,49 Final word error rate
%3,01 Final character error rate
Training data 1,477,006 records, 2,190.9 hours of audio
Silence samples 25.7 hours
Audio types phone band simulation (8 kHz), cross-mixing, dialogue segmentation
Steps 11,540 · 1 epoch
Training date August 2026
Training loss
0
1
2
3
2,500
5,000
7,500
10,000
Step
Training loss
Training loss: 100 · 2.63
Training loss: 200 · 1.90
Training loss: 300 · 1.80
Training loss: 400 · 1.82
Training loss: 500 · 1.72
Training loss: 600 · 1.67
Training loss: 700 · 1.67
Training loss: 800 · 1.68
Training loss: 900 · 1.67
Training loss: 1,000 · 1.66
Training loss: 1,100 · 1.60
Training loss: 1,200 · 1.57
Training loss: 1,300 · 1.54
Training loss: 1,400 · 1.56
Training loss: 1,500 · 1.56
Training loss: 1,600 · 1.56
Training loss: 1,700 · 1.53
Training loss: 1,800 · 1.50
Training loss: 1,900 · 1.52
Training loss: 2,000 · 1.51
Training loss: 2,100 · 1.52
Training loss: 2,200 · 1.47
Training loss: 2,300 · 1.48
Training loss: 2,400 · 1.45
Training loss: 2,500 · 1.44
Training loss: 2,600 · 1.43
Training loss: 2,700 · 1.45
Training loss: 2,800 · 1.44
Training loss: 2,900 · 1.44
Training loss: 3,000 · 1.42
Training loss: 3,100 · 1.41
Training loss: 3,200 · 1.46
Training loss: 3,300 · 1.37
Training loss: 3,400 · 1.41
Training loss: 3,500 · 1.46
Training loss: 3,600 · 1.35
Training loss: 3,700 · 1.37
Training loss: 3,800 · 1.35
Training loss: 3,900 · 1.39
Training loss: 4,000 · 1.40
Training loss: 4,100 · 1.38
Training loss: 4,200 · 1.38
Training loss: 4,300 · 1.36
Training loss: 4,400 · 1.38
Training loss: 4,500 · 1.34
Training loss: 4,600 · 1.35
Training loss: 4,700 · 1.36
Training loss: 4,800 · 1.31
Training loss: 4,900 · 1.30
Training loss: 5,000 · 1.34
Training loss: 5,100 · 1.33
Training loss: 5,200 · 1.31
Training loss: 5,300 · 1.30
Training loss: 5,400 · 1.31
Training loss: 5,500 · 1.33
Training loss: 5,600 · 1.33
Training loss: 5,700 · 1.27
Training loss: 5,800 · 1.32
Training loss: 5,900 · 1.33
Training loss: 6,000 · 1.31
Training loss: 6,100 · 1.30
Training loss: 6,200 · 1.27
Training loss: 6,300 · 1.26
Training loss: 6,400 · 1.33
Training loss: 6,500 · 1.29
Training loss: 6,600 · 1.29
Training loss: 6,700 · 1.31
Training loss: 6,800 · 1.22
Training loss: 6,900 · 1.25
Training loss: 7,000 · 1.31
Training loss: 7,100 · 1.27
Training loss: 7,200 · 1.23
Training loss: 7,300 · 1.26
Training loss: 7,400 · 1.27
Training loss: 7,500 · 1.25
Training loss: 7,600 · 1.26
Training loss: 7,700 · 1.24
Training loss: 7,800 · 1.25
Training loss: 7,900 · 1.24
Training loss: 8,000 · 1.24
Training loss: 8,100 · 1.26
Training loss: 8,200 · 1.23
Training loss: 8,300 · 1.24
Training loss: 8,400 · 1.24
Training loss: 8,500 · 1.23
Training loss: 8,600 · 1.27
Training loss: 8,700 · 1.23
Training loss: 8,800 · 1.22
Training loss: 8,900 · 1.20
Training loss: 9,000 · 1.22
Training loss: 9,100 · 1.22
Training loss: 9,200 · 1.22
Training loss: 9,300 · 1.24
Training loss: 9,400 · 1.23
Training loss: 9,500 · 1.21
Training loss: 9,600 · 1.23
Training loss: 9,700 · 1.18
Training loss: 9,800 · 1.23
Training loss: 9,900 · 1.21
Training loss: 10,000 · 1.18
Training loss: 10,100 · 1.22
Training loss: 10,200 · 1.21
Training loss: 10,300 · 1.26
Training loss: 10,400 · 1.20
Training loss: 10,500 · 1.20
Training loss: 10,600 · 1.21
Training loss: 10,700 · 1.21
Training loss: 10,800 · 1.23
Training loss: 10,900 · 1.17
Training loss: 11,000 · 1.19
Training loss: 11,100 · 1.18
Training loss: 11,200 · 1.18
Training loss: 11,300 · 1.20
Training loss: 11,400 · 1.20
Training loss: 11,500 · 1.17
Each point is the average of two consecutive records.
Show values as a table
Training loss
100 2.6340
600 1.6663
1,100 1.6001
1,600 1.5598
2,100 1.5177
2,600 1.4338
3,100 1.4080
3,600 1.3531
4,100 1.3821
4,600 1.3530
5,100 1.3306
5,600 1.3333
6,100 1.3021
6,600 1.2923
7,100 1.2736
7,600 1.2613
8,100 1.2606
8,600 1.2679
9,100 1.2166
9,600 1.2256
10,100 1.2165
10,600 1.2068
11,100 1.1835
11,500 1.1665
Validation loss
0.13
0.14
0.15
0.16
0.17
2,000
4,000
6,000
8,000
10,000
Step
Validation loss
Validation loss: 2,000 · 0.16
Validation loss: 2,000 · 0.16
Validation loss: 4,000 · 0.15
Validation loss: 4,000 · 0.15
Validation loss: 6,000 · 0.15
Validation loss: 6,000 · 0.15
Validation loss: 8,000 · 0.14
Validation loss: 8,000 · 0.14
Validation loss: 10,000 · 0.13
Validation loss: 10,000 · 0.13
Validation loss: 11,540 · 0.13
Validation loss: 11,540 · 0.13
Measured on examples never seen in training; a falling curve shows the model learns rather than memorises.
Show values as a table
Validation loss
2,000 0.1633
4,000 0.1528
6,000 0.1456
8,000 0.1383
10,000 0.1340
11,540 0.1316
Error rate on validation (%)
Word error rate (WER)
Character error rate (CER)
0%
5%
10%
15%
20%
2,000
4,000
6,000
8,000
10,000
Step
Word error rate (WER)
Character error rate (CER)
Word error rate (WER): 2,000 · 12.60%
Word error rate (WER): 2,000 · 12.60%
Word error rate (WER): 4,000 · 11.94%
Word error rate (WER): 4,000 · 11.94%
Word error rate (WER): 6,000 · 19.10%
Word error rate (WER): 6,000 · 19.10%
Word error rate (WER): 8,000 · 10.71%
Word error rate (WER): 8,000 · 10.71%
Word error rate (WER): 10,000 · 18.35%
Word error rate (WER): 10,000 · 18.35%
Word error rate (WER): 11,540 · 10.49%
Word error rate (WER): 11,540 · 10.49%
Character error rate (CER): 2,000 · 3.64%
Character error rate (CER): 2,000 · 3.64%
Character error rate (CER): 4,000 · 3.33%
Character error rate (CER): 4,000 · 3.33%
Character error rate (CER): 6,000 · 10.35%
Character error rate (CER): 6,000 · 10.35%
Character error rate (CER): 8,000 · 2.94%
Character error rate (CER): 8,000 · 2.94%
Character error rate (CER): 10,000 · 10.79%
Character error rate (CER): 10,000 · 10.79%
Character error rate (CER): 11,540 · 3.01%
Character error rate (CER): 11,540 · 3.01%
Lower is better. Measured on the validation set throughout training.
Show values as a table
Word error rate (WER)
2,000 12.60
4,000 11.94
6,000 19.10
8,000 10.71
10,000 18.35
11,540 10.49
Character error rate (CER)
2,000 3.64
4,000 3.33
6,000 10.35
8,000 2.94
10,000 10.79
11,540 3.01
Open benchmark set (FLEURS) · Word error rate (%)
v2
v3
0.0%
2.5%
5.0%
7.5%
10.0%
Turkish
Arabic
Turkish · v2: 8.9%
8.9%
Turkish · v3: 7.1%
7.1%
Arabic · v2: 8.0%
8.0%
Arabic · v3: 7.8%
7.8%
Lower is better. 150 records per language, read news sentences. Valid for ranking; does not represent absolute success in phone calls.
Show values as a table
v2 v3
Turkish 8.87 7.11
Arabic 7.96 7.82
Open benchmark set (FLEURS) · Character error rate (%)
v2
v3
0%
1%
2%
3%
Turkish
Arabic
Turkish · v2: 2.8%
2.8%
Turkish · v3: 1.7%
1.7%
Arabic · v2: 2.7%
2.7%
Arabic · v3: 2.5%
2.5%
Lower is better. 150 records per language.
Show values as a table
v2 v3
Turkish 2.83 1.67
Arabic 2.65 2.46
Internal test set · Language-based word error rate (%)
0%
5%
10%
15%
20%
Arabic
German
English
French
Italian
Turkish
Arabic · v3: 19.7%
19.7%
German · v3: 6.8%
6.8%
English · v3: 19.1%
19.1%
French · v3: 12.7%
12.7%
Italian · v3: 8.1%
8.1%
Turkish · v3: 10.5%
10.5%
Lower is better. 200 samples per language.
Show values as a table
v3
Arabic 19.72
German 6.80
English 19.10
French 12.74
Italian 8.11
Turkish 10.49
Internal test set · Language-based character error rate (%)
0%
5%
10%
15%
Arabic
German
English
French
Italian
Turkish
Arabic · v3: 7.4%
7.4%
German · v3: 2.0%
2.0%
English · v3: 11.9%
11.9%
French · v3: 3.8%
3.8%
Italian · v3: 2.2%
2.2%
Turkish · v3: 3.0%
3.0%
Lower is better. 200 samples per language.
Show values as a table
v3
Arabic 7.41
German 1.95
English 11.89
French 3.75
Italian 2.22
Turkish 3.01
Technical sheet
Version v3
Release August 25, 2026
Status Superseded by v4
Open technical sheet
CALLAII ASR v2 · Previous version
CALLAII ASR v2
Previous version
Released June 2026
Second version adapted to call center Turkish . The error rate on real recordings dropped to half of the first version.
What improved in this version
Word error rate on 10 real recordings dropped from %14.25 to %6.51
Character error rate dropped from %8.68 to %4.57
Domain prompt added for call center expressions (announcements and institution names)
Limitations and responsible use
Could enter a repetition loop at the end of long calls; fixed in v3
Output was corrupted when the language label was incorrectly assigned in Arabic recordings; fixed in v3 with automatic language detection
Training and measurements
Turkish validationword error rate %7.02, character error rate %2.15
Error rate (%) on 10 real recordings
v1
v2
0%
5%
10%
15%
Word error rat…
Character erro…
Word error rate (WER) · v1: 14.3%
14.3%
Word error rate (WER) · v2: 6.5%
6.5%
Character error rate (CER) · v1: 8.7%
8.7%
Character error rate (CER) · v2: 4.6%
4.6%
Lower is better. The same 10 real call recordings were fed to both versions.
Show values as a table
v1 v2
Word error rate (WER) 14.25 6.51
Character error rate (CER) 8.68 4.57
Technical sheet
Version v2
Release June 2026
Status Replaced by v3
Open technical sheet
CALLAII ASR v1 · Previous version
CALLAII ASR v1
Previous version
Released April 2026
First CALLAII ASR version: The initial model that converts Turkish call recordings into text.
Technical sheet
Version v1
Release April 2026
Status Replaced by v2
Open technical sheet
Product release notes