Ogni versione dei modelli CALLAII che alimentano l'intelligenza artificiale di Callmenta: cosa fa, cosa è migliorato in questa versione, dove si trova il limite.
I dati dei clienti non vengono utilizzati per l'addestramento dei modelli.
CALLAII®by CALLMENTA
CALLAII
Modello linguistico
Il modello linguistico che alimenta le interfacce di intelligenza artificiale nel pannello Callmenta: analisi delle chiamate, coaching, supporto live, CRM e CALLAII Hukuk.
CALLAII v7In produzionePubblicazione settembre 2026
CALLAII v7 è online. La versione precedente in produzione, v6, è stata sottoposta allo stesso esame con le stesse impostazioni di produzione. Nelle domande giuridiche verifica quasi sempre la procedura: tribunale competente e giurisdizione, condizioni di ammissibilità e termini. Funziona insieme a un controllo aggiuntivo che individua e estrae informazioni non menzionate dall'avvocato nei ricorsi.
Novità di questa versione
Controllo procedurale in modalità giuridica: lo esegue in 69 domande su 70; la v6 in produzione non lo eseguiva in nessuna delle stesse domande.
I punti di controllo procedurale sono passati da 8 a 57 su 70 domande.
Anche in modalità generale con ragionamento disattivato, il controllo procedurale è passato da 0 a 23.
Le risposte sono più ordinate: in modalità generale, le risposte troncate per limite sono passate da 40 a 11.
La lettura di testo da immagini e la descrizione visiva sono state pienamente mantenute anche dopo l'addestramento.
Limiti e uso responsabile
La conoscenza giuridica non proviene dalla memoria del modello; leggi, regolamenti e decisioni vengono recuperati ogni volta dalla biblioteca aggiornata.
Il testo generato è una bozza; ricorsi, contratti e documenti ufficiali devono essere approvati da una persona autorizzata.
Numeri e date devono essere verificati.
La qualità nelle lingue diverse dal turco non è stata misurata con lo stesso livello di dettaglio del turco.
Addestramento e misurazioni
0,629 → 0,513Perdita di validazione
69 domande su 70Controllo procedurale · giuridico
0 domande su 70v6 in produzione nello stesso esame
8 → 57Punti procedurali · giuridico
Dati di addestramento
45.847 esempi
Set di validazione
200 esempi mai visti durante l'addestramento
Passo
2.859 · 1 epoca · 16 esempi per passo
Contesto di addestramento
4.096 token
Perdita di validazione
0,629 → 0,513
Esame
70 domande procedurali; stesse domande della v6 in produzione, stesse impostazioni di produzione
Data di addestramento
settembre 2026
Perdita di addestramento e di validazione
Perdita di addestramentoPerdita di validazione
Ogni punto è la media di 5 registrazioni consecutive.
Mostra i valori in tabella
Perdita di addestramento
0,01
0,8421
0,05
0,6483
0,10
0,5975
0,14
0,5828
0,18
0,5622
0,23
0,5602
0,27
0,5509
0,31
0,5387
0,36
0,5504
0,40
0,5220
0,45
0,5358
0,49
0,5406
0,53
0,5296
0,58
0,5333
0,62
0,5053
0,66
0,5165
0,71
0,5090
0,75
0,5308
0,80
0,5334
0,84
0,5043
0,88
0,5118
0,93
0,5051
0,97
0,5022
1,00
0,4946
Perdita di validazione
0,07
0,6293
0,14
0,5990
0,21
0,5781
0,28
0,5642
0,35
0,5544
0,42
0,5433
0,49
0,5368
0,56
0,5298
0,63
0,5238
0,70
0,5194
0,77
0,5163
0,84
0,5139
0,91
0,5129
0,98
0,5127
1
0,5126
v6 in produzione vs v7: esame procedurale
v6 in produzionev7
Stesse 70 domande giuridiche, con le impostazioni di produzione. In modalità giuridica il ragionamento è attivo, in modalità generale è disattivato.
Mostra i valori in tabella
v6 in produzione
v7
Controllo procedurale · giuridico
0,00
98,60
Punti procedurali · giuridico
11,40
81,40
Controllo procedurale · generale
0,00
32,90
Punti procedurali · generale
11,40
45,70
Scheda tecnica
Versione
v7
Pubblicazione
settembre 2026
Input
testo e immagini
Output
testo
Lingua
focalizzata sul turco; risposta nella stessa lingua per le altre lingue
CALLAII v6Versione precedentePubblicazione settembre 2026
CALLAII v6, tutte le interfacce di intelligenza artificiale del pannello Callmenta. Addestrato su dati generati ex novo per questo scopo; ogni esempio è stato sottoposto a controlli delle regole e a una valutazione di un giudice.
Novità di questa versione
Lo stile delle petizioni e dei contratti è stato appreso dai documenti reali dello studio legale con cui collaboriamo
Aggiunta la preparazione dei contratti e l'esame delle prove
Potenziati il dialogo multi-turno e l'utilizzo degli strumenti
L'addestramento è stato regolarmente testato su 740 esempi mai visti prima; l'errore di validazione è diminuito a ogni misurazione, il modello non ha memorizzato
Cosa fa
Analisi delle chiamate: riassunto dalla trascrizione, azioni, opportunità perse, scheda criteri
Coaching: feedback basato su evidenze per le prestazioni degli agenti
Supporto live: risponde alle domande dei visitatori, trasferisce a un operatore umano se necessario
CRM e report: riepilogo della scheda cliente, lettura delle metriche, commenti
CALLAII Hukuk: preparazione di petizioni e contratti, analisi dei documenti, domande su normativa e giurisprudenza
Mascheramento KVKK: rimozione dei dati personali dal testo
Utilizzo degli strumenti: ricerca, apertura di registri, recupero di documenti all'interno del pannello
Lettura visiva: comprensione di documenti e screenshot
Limiti e uso responsabile
La conoscenza giuridica non proviene dalla memoria del modello; leggi, regolamenti e sentenze vengono recuperati ogni volta dalla biblioteca aggiornata
Il testo generato è una bozza; petizioni, contratti e corrispondenza ufficiale devono essere approvati da una persona autorizzata
Numeri e date devono essere verificati; il modello è stato addestrato a dichiarare l'assenza di informazioni anziché inventarle
I documenti molto lunghi vengono elaborati in sezioni
La qualità nelle lingue diverse dal turco non è stata misurata con lo stesso livello di dettaglio del turco
Addestramento e misurazioni
3.101Passo
2Epoca
0,4729Perdita di validazione finale
Dati di addestramento
37.102 esempi, 118 milioni di token
Selezione qualità
37.600 dei 47.872 esempi generati sono stati accettati
Set di validazione
740 esempi mai visti durante l'addestramento
Passo
3.101 · 2 epoche · 96.000 token per passo
Contesto di addestramento
12.288 token
Perdita di validazione
0,7435 → 0,4729
Data di addestramento
Settembre 2026
Perdita di addestramento e di validazione
Perdita di addestramentoPerdita di validazione
Solo i punti misurati; non è stato conservato il registro degli step intermedi.
Mostra i valori in tabella
Perdita di addestramento
0
0,7800
2.700
0,3951
3.101
0,3763
Perdita di validazione
0
0,7435
2.700
0,4730
3.101
0,4729
Selezione dei dati di addestramento (esempio)
Ogni esempio generato è stato sottoposto a un controllo delle regole e a una valutazione di un giudice; quelli non superati sono stati scartati.
Mostra i valori in tabella
Campioni
Generati
47.872,00
Accettati
37.600,00
Addestramento
37.102,00
Validazione
740,00
Scheda tecnica
Versione
v6
Pubblicazione
Settembre 2026
Input
Testo e immagini
Output
Testo
Lingua
focalizzata sul turco; risposta nella stessa lingua per le altre lingue
Dati del cliente
non entrano nell'addestramento
Ambiente di esecuzione
server gestiti da Callmenta; i vostri dati non vengono inviati a un fornitore di intelligenza artificiale di terze parti
Modello linguistico CALLAII progettato per funzionare sul server interno dell'organizzazione.
CALLAII Edge v1In addestramento
CALLAII Edge è attualmente in fase di addestramento. L'obiettivo è consolidare le competenze di CALLAII in ambito legale e di contact center in un modello che operi sul server interno dell'organizzazione. Il grafico sottostante viene aggiornato regolarmente durante l'addestramento.
Novità di questa versione
Obiettivo: identificare il tribunale competente e giurisdizionale, i requisiti di ammissibilità e i termini di prescrizione in una questione legale
Obiettivo: presentarsi sempre come CALLAII in qualsiasi circostanza
I risultati verranno pubblicati qui dopo l'addestramento, sottoponendo il modello allo stesso esame pre-addestramento
Addestramento e misurazioni
0,49Epoca
0,6186Perdita di validazione finale
Stato
in addestramento
Dati di addestramento
45.847 esempi
Set di validazione
200 esempi mai visti durante l'addestramento
Contesto di addestramento
4.096 token
Data di addestramento
settembre 2026
Perdita di addestramento e di validazione
Perdita di addestramentoPerdita di validazione
Ogni punto rappresenta la media di 3 registrazioni consecutive.
Modello linguistico CALLAII compatto, progettato per funzionare sull'hardware delle piccole imprese.
CALLAII Edge Small Business v1In produzionePubblicazione settembre 2026
CALLAII Edge Small Business è stato progettato per le aziende che desiderano un CALLAII compatto da far funzionare sul proprio server. Controlla automaticamente la procedura nelle questioni legali e legge le immagini dei documenti.
Novità di questa versione
Prima versione
Controllo procedurale nelle domande legali: lo esegue in 67 su 70 domande dell'esame, prima dell'addestramento non lo faceva in nessuna
Il tasso di conformità ai punti di controllo procedurale è passato da 9 a 57 su 70 domande
La lettura del testo dalle immagini dei documenti e la descrizione delle immagini sono state pienamente mantenute anche dopo l'addestramento
Cosa fa
Legale: bozza di petizione e contratto, risposta a domande legali con controllo procedurale
Controllo procedurale: tribunale competente e giurisdizione, condizioni di ammissibilità e termini
Centro di contatto: riepilogo della chiamata, risposta al cliente e valutazione della qualità
Lettura visiva: comprensione del testo e del contenuto nei documenti e negli screenshot
Limiti e uso responsabile
Il testo generato è una bozza; petizioni, contratti e corrispondenza ufficiale devono essere approvati da una persona autorizzata
Per leggi, regolamenti e decisioni aggiornati, deve essere utilizzato insieme alla biblioteca normativa; la memoria del modello non è aggiornata
Le registrazioni audio vengono trascritte con CALLAII ASR; questo modello non viene utilizzato per il riconoscimento vocale
La qualità nelle lingue diverse dal turco non è stata misurata con lo stesso livello di dettaglio del turco
Addestramento e misurazioni
1Epoca
0,810 → 0,605Perdita di validazione
In 67 su 70 domandeControllo procedurale
Dati di addestramento
45.847 esempi
Set di validazione
200 esempi mai visti durante l'addestramento
Passo
2.861 · 1 epoca · 16 esempi per passo
Contesto di addestramento
4.096 token
Perdita di validazione
0,810 → 0,605
Esame
70 domande procedurali, stesse domande prima e dopo l'addestramento
Data di addestramento
settembre 2026
Perdita di addestramento e di validazione
Perdita di addestramentoPerdita di validazione
Ogni punto è la media di 5 registrazioni consecutive.
Mostra i valori in tabella
Perdita di addestramento
0,01
2,0882
0,05
0,8227
0,10
0,7656
0,14
0,7346
0,18
0,6991
0,23
0,6836
0,27
0,6616
0,31
0,6667
0,36
0,6545
0,40
0,6291
0,45
0,6276
0,49
0,6401
0,53
0,6182
0,58
0,6186
0,62
0,6388
0,66
0,5980
0,71
0,6144
0,75
0,6025
0,80
0,6273
0,84
0,6025
0,88
0,6050
0,93
0,5961
0,97
0,6281
1,00
0,5878
Perdita di validazione
0,14
0,7797
0,21
0,7025
0,28
0,6809
0,35
0,6608
0,42
0,6528
0,49
0,6549
0,56
0,6427
0,63
0,6439
0,70
0,6169
0,77
0,6117
0,84
0,6079
0,91
0,6055
0,98
0,6049
1
0,6050
Esame prima e dopo l'addestramento
Prima dell'addestramentoDopo l'addestramento
70 domande procedurali, stesse domande prima e dopo l'addestramento.
Mostra i valori in tabella
Prima dell'addestramento
Dopo l'addestramento
Tribunale e competenza
0,00
95,70
Punti procedurali
12,90
81,40
Scheda tecnica
Versione
v1
Pubblicazione
settembre 2026
Input
testo e immagini
Output
testo
Lingua
focalizzata sul turco; risposta nella stessa lingua per le altre lingue
Modello di riconoscimento vocale che separa le registrazioni di chiamate in canali parlanti e le converte in testo. L'analisi, il coaching e la valutazione della qualità si basano su questa trascrizione.
CALLAII ASR v4In produzionePubblicazione settembre 2026
Separa le registrazioni delle chiamate in canali parlanti e le converte in testo. Questa versione è stata addestrata su dieci lingue e su audio simulato alle condizioni della linea telefonica; il tasso di errore nelle conversazioni del contact center è diminuito in modo significativo.
Novità di questa versione
Nei scenari del contact center, il tasso di errore delle parole in turco è sceso dal 25,70% al 6,32%
In arabo, tedesco, francese, inglese e italiano, il tasso di errore è sceso a un quarto e a un quinto; i risultati per lingua sono nel grafico
Anche nel parlato turco letto c'è stato un miglioramento: 4,72% → 4,47% (800 registrazioni)
Lo stesso testo è stato addestrato con versioni su linea telefonica, ambiente rumoroso e studio
I dati della versione precedente sono stati inclusi nell'addestramento; per evitare che l'apprendimento venga compromesso quando si aggiungono nuovi dati
Cosa fa
In una registrazione a due canali, trascrive separatamente il cliente e l'operatore
Rileva autonomamente la lingua di ciascun canale
Genera una trascrizione con timestamp e etichette dei parlanti
Lascia vuoti i segmenti silenziosi; è stata addestrata per non generare frasi inventate
Limiti e uso responsabile
Le misurazioni sono state effettuate su set di test; il tasso di errore di riferimento in una vera chiamata telefonica non è ancora stato misurato
Il tasso di errore aumenta con il parlato sovrapposto e con registrazioni di qualità molto bassa
Il ritardo della trascrizione in tempo reale non è stato misurato
Addestramento e misurazioni
19.369Passo
1Epoca
0,0981Perdita di validazione finale
%9,41Tasso di errore sulle parole finale
%2,82Tasso di errore sui caratteri finale
Dati di addestramento
2.479.180 registrazioni, 3.654 ore di audio
Quota di nuovi dati
26,5%; il resto proviene dai dati della versione precedente
CALLAII ASR v3Versione precedentePubblicazione agosto 2026
Versione con ampio addestramento multilingue. La simulazione della linea telefonica e il riconoscimento delle sezioni silenziose sono stati aggiunti in questa versione.
Novità di questa versione
Nel set di benchmark pubblico, il tasso di errore delle parole in turco è sceso dall'8,87% al 7,11%
In arabo è sceso dal 7,96% al 7,82%
Ha imparato a lasciare vuote le sezioni silenziose; le frasi inventate sono diminuite
Nessun degrado osservato alla fine di una chiamata lunga (in una chiamata reale di 571 secondi)
Iniziato il rilevamento automatico della lingua per ogni canale
Limiti e uso responsabile
Il set di benchmark pubblico è composto da frasi di notizie lette ad alta voce; non rappresenta il successo assoluto nelle chiamate telefoniche
Nei scenari di contact center, il tasso di errore nelle lingue diverse dal turco era elevato; risolto in v4
Addestramento e misurazioni
11.540Passo
1Epoca
0,1315Perdita di validazione finale
%10,49Tasso di errore sulle parole finale
%3,01Tasso di errore sui caratteri finale
Dati di addestramento
1.477.006 registrazioni, 2.190,9 ore di audio
Esempio di silenzio
25,7 ore
Tipi di audio
simulazione banda telefonica (8 kHz), miscelazione incrociata, frammentazione del dialogo
Passi
11.540 · 1 epoca
Data di addestramento
Agosto 2026
Perdita di addestramento
Ogni punto è la media di 2 registrazioni consecutive.
Mostra i valori in tabella
Perdita di addestramento
100
2,6340
600
1,6663
1.100
1,6001
1.600
1,5598
2.100
1,5177
2.600
1,4338
3.100
1,4080
3.600
1,3531
4.100
1,3821
4.600
1,3530
5.100
1,3306
5.600
1,3333
6.100
1,3021
6.600
1,2923
7.100
1,2736
7.600
1,2613
8.100
1,2606
8.600
1,2679
9.100
1,2166
9.600
1,2256
10.100
1,2165
10.600
1,2068
11.100
1,1835
11.500
1,1665
Perdita di validazione
Misurata su esempi mai visti durante l'addestramento; una curva in discesa indica che il modello impara invece di memorizzare.
Mostra i valori in tabella
Perdita di validazione
2.000
0,1633
4.000
0,1528
6.000
0,1456
8.000
0,1383
10.000
0,1340
11.540
0,1316
Tasso di errore in validazione (%)
Tasso di errore sulle parole (WER)Tasso di errore sui caratteri (CER)
Più basso è meglio. Misurato sul set di validazione durante l'addestramento.
Mostra i valori in tabella
Tasso di errore sulle parole (WER)
2.000
12,60
4.000
11,94
6.000
19,10
8.000
10,71
10.000
18,35
11.540
10,49
Tasso di errore sui caratteri (CER)
2.000
3,64
4.000
3,33
6.000
10,35
8.000
2,94
10.000
10,79
11.540
3,01
Set di benchmark pubblico (FLEURS) · Tasso di errore delle parole (%)
v2v3
Più basso è meglio. 150 registrazioni per lingua, frasi di notizie lette ad alta voce. Valido per il confronto; non rappresenta il successo assoluto nelle chiamate telefoniche.
Mostra i valori in tabella
v2
v3
Turco
8,87
7,11
Arabo
7,96
7,82
Set di benchmark pubblico (FLEURS) · Tasso di errore dei caratteri (%)
v2v3
Più basso è meglio. 150 registrazioni per lingua.
Mostra i valori in tabella
v2
v3
Turco
2,83
1,67
Arabo
2,65
2,46
Set di test interno · Tasso di errore delle parole per lingua (%)
Più basso è meglio. 200 campioni per lingua.
Mostra i valori in tabella
v3
Arabo
19,72
Tedesco
6,80
Inglese
19,10
Francese
12,74
Italiano
8,11
Turco
10,49
Set di test interno · Tasso di errore dei caratteri per lingua (%)
CALLAII ASR v2Versione precedentePubblicazione giugno 2026
Seconda versione adattata al turco del centro di contatto. Il tasso di errore nelle registrazioni reali è sceso alla metà rispetto alla prima versione.
Novità di questa versione
Su 10 registrazioni reali, il tasso di errore a livello di parola è sceso dal 14,25% al 6,51%
Il tasso di errore a livello di carattere è sceso dall'8,68% al 4,57%
Aggiunto un prompt di dominio per le espressioni del centro di contatto (annunci e nomi delle istituzioni)
Limiti e uso responsabile
Le chiamate lunghe potevano entrare in un ciclo ripetitivo alla fine; risolto in v3
Quando l'etichetta linguistica era errata in una registrazione araba, l'output si corrompeva; risolto in v3 con il rilevamento automatico della lingua
Addestramento e misurazioni
Validazione turca
tasso di errore a livello di parola 7,02%, tasso di errore a livello di carattere 2,15%
Tasso di errore (%) su 10 registrazioni reali
v1v2
Più basso è meglio. Le stesse 10 registrazioni reali di chiamate sono state fornite a entrambe le versioni.