Punteggio di confidenza
Un punteggio di confidenza è un valore tra 0 e 1 con cui un modello di IA esprime quanto è sicuro della propria risposta. Nei chatbot, il punteggio decide se l'IA risponde da sola, fa una domanda di chiarimento o passa la mano a un agente umano.
Cos'è un punteggio di confidenza?
Un punteggio di confidenza è l'autovalutazione quantificata di un modello di IA: quanto sono sicuro di questa risposta? I valori vanno tipicamente da 0 (incerto) a 1 (molto sicuro) e rappresentano una probabilità, non una misura assoluta.
In un contesto di bot di messaging, il punteggio di confidenza guida cosa succede dopo una domanda dell'utente: alta confidenza → il bot risponde; media → domanda di chiarimento; bassa → passaggio a un agente umano.
Come nasce un punteggio di confidenza
Diversi tipi di bot producono punteggi in modo diverso:
| Tipo di bot | Come si misura la confidenza |
|---|---|
| Bot per parole chiave (autoresponder) | Match o no — niente vero punteggio di confidenza. La regola scatta o no. |
| Bot NLU (classificazione di intent) | Probabilità che l'input utente appartenga all'intent X. Output: distribuzione di probabilità su tutti gli intent. |
| Bot RAG (retrieval-augmented generation) | Similarità tra la domanda dell'utente e il miglior chunk della knowledge base, combinata con l'autovalutazione del modello. |
| Agente IA | Multi-step: confidenza nella scelta dello strumento, confidenza nel risultato, totale pesato. |
Soglie
In pratica si lavora con soglie che guidano il comportamento del sistema:
- ≥ 0,80 — l'IA risponde da sola. Alta certezza.
- Da 0,50 a 0,80 — l'IA fa una domanda di chiarimento («Intendevi X o Y?»).
- < 0,50 — passaggio a un agente umano.
Le soglie esatte dipendono dal modello e dal caso d'uso. Per i temi critici (salute, legale, finanza) le soglie sono più alte.
Punteggio di confidenza e logica di passaggio
I bot IA di SendSeven supportano una logica di escalation configurabile: dopo max_failed_attempts risposte consecutive a bassa confidenza, il bot passa automaticamente a un umano. Il valore di default è tipicamente 2 o 3 — affinché il cliente non resti bloccato in un loop.
Importante: i bot basati su parole chiave (autoresponder) non usano questa logica di escalation perché non hanno un vero punteggio di confidenza. O fanno match o restituiscono un testo di fallback.
Cause comuni di bassa confidenza
- Domanda fuori dalla knowledge base: Il cliente chiede di un argomento non ingerito.
- Formulazione ambigua: «Ho un problema con l'app» calza in 15 argomenti.
- Lingua sbagliata: L'utente scrive in inglese, il bot è addestrato in italiano.
- Ortografia/gergo: Refusi o gergo che il modello non riconosce.
- Multi-intent: Il cliente fa due domande in una volta — il modello non sa a quale rispondere prima.
Visibilità della confidenza
Nella vista agente, SendSeven mostra il punteggio di confidenza che il bot ha assegnato a una risposta. Le risposte a bassa confidenza sono contrassegnate come avvisi — gli agenti possono correggere in linea e segnalare la lacuna al responsabile della knowledge base. Così il sistema impara da ogni passaggio.
Confidenza vs correttezza
Lezione importante: alta confidenza non significa alta correttezza. Un modello può essere molto confidente e tuttavia sbagliare («allucinazione»). La confidenza è un segnale, non una garanzia. Quindi una configurazione produttiva include sempre: un test set con ground truth, campionamenti regolari e un loop di feedback dagli agenti ai responsabili della knowledge base.