Punteggio di confidenza

Un punteggio di confidenza è un valore tra 0 e 1 con cui un modello di IA esprime quanto è sicuro della propria risposta. Nei chatbot, il punteggio decide se l'IA risponde da sola, fa una domanda di chiarimento o passa la mano a un agente umano.

Cos'è un punteggio di confidenza?

Un punteggio di confidenza è l'autovalutazione quantificata di un modello di IA: quanto sono sicuro di questa risposta? I valori vanno tipicamente da 0 (incerto) a 1 (molto sicuro) e rappresentano una probabilità, non una misura assoluta.

In un contesto di bot di messaging, il punteggio di confidenza guida cosa succede dopo una domanda dell'utente: alta confidenza → il bot risponde; media → domanda di chiarimento; bassa → passaggio a un agente umano.

Come nasce un punteggio di confidenza

Diversi tipi di bot producono punteggi in modo diverso:

Tipo di botCome si misura la confidenza
Bot per parole chiave (autoresponder)Match o no — niente vero punteggio di confidenza. La regola scatta o no.
Bot NLU (classificazione di intent)Probabilità che l'input utente appartenga all'intent X. Output: distribuzione di probabilità su tutti gli intent.
Bot RAG (retrieval-augmented generation)Similarità tra la domanda dell'utente e il miglior chunk della knowledge base, combinata con l'autovalutazione del modello.
Agente IAMulti-step: confidenza nella scelta dello strumento, confidenza nel risultato, totale pesato.

Soglie

In pratica si lavora con soglie che guidano il comportamento del sistema:

  • ≥ 0,80 — l'IA risponde da sola. Alta certezza.
  • Da 0,50 a 0,80 — l'IA fa una domanda di chiarimento («Intendevi X o Y?»).
  • < 0,50 — passaggio a un agente umano.

Le soglie esatte dipendono dal modello e dal caso d'uso. Per i temi critici (salute, legale, finanza) le soglie sono più alte.

Punteggio di confidenza e logica di passaggio

I bot IA di SendSeven supportano una logica di escalation configurabile: dopo max_failed_attempts risposte consecutive a bassa confidenza, il bot passa automaticamente a un umano. Il valore di default è tipicamente 2 o 3 — affinché il cliente non resti bloccato in un loop.

Importante: i bot basati su parole chiave (autoresponder) non usano questa logica di escalation perché non hanno un vero punteggio di confidenza. O fanno match o restituiscono un testo di fallback.

Cause comuni di bassa confidenza

  • Domanda fuori dalla knowledge base: Il cliente chiede di un argomento non ingerito.
  • Formulazione ambigua: «Ho un problema con l'app» calza in 15 argomenti.
  • Lingua sbagliata: L'utente scrive in inglese, il bot è addestrato in italiano.
  • Ortografia/gergo: Refusi o gergo che il modello non riconosce.
  • Multi-intent: Il cliente fa due domande in una volta — il modello non sa a quale rispondere prima.

Visibilità della confidenza

Nella vista agente, SendSeven mostra il punteggio di confidenza che il bot ha assegnato a una risposta. Le risposte a bassa confidenza sono contrassegnate come avvisi — gli agenti possono correggere in linea e segnalare la lacuna al responsabile della knowledge base. Così il sistema impara da ogni passaggio.

Confidenza vs correttezza

Lezione importante: alta confidenza non significa alta correttezza. Un modello può essere molto confidente e tuttavia sbagliare («allucinazione»). La confidenza è un segnale, non una garanzia. Quindi una configurazione produttiva include sempre: un test set con ground truth, campionamenti regolari e un loop di feedback dagli agenti ai responsabili della knowledge base.