Il caso che ha cambiato tutto
Hong Kong, febbraio 2024. Un dipendente del settore finanza di una multinazionale partecipa a una videocall con quello che credeva essere il CFO insieme ad altri colleghi. Tutti i volti erano familiari, le voci identiche a quelle di sempre. Alla fine della call, esegue 15 bonifici per un totale di 25,6 milioni di dollari.
Erano tutti deepfake. CFO, colleghi, persino il sé stesso che parlava durante la riunione.
Il caso ha segnato il salto di scala dei deepfake da curiosità accademica a strumento di frode aziendale di massa. Da allora i CSIRT europei segnalano casi simili ogni settimana, anche su importi molto più piccoli.
E in Svizzera?
Non è un problema lontano. Nell’aprile 2024 l’Ufficio federale della cibersicurezza (UFCS) ha descritto un caso segnalato da un’azienda svizzera: il responsabile finanziario riceve la telefonata di un sedicente avvocato, che lo invita a una videoconferenza con il suo capo di lì a pochi minuti. Si collega, vede il suo capo sullo schermo e ci parla. Il capo gli chiede il numero di cellulare e di effettuare dei pagamenti. Il video era stato creato con l’intelligenza artificiale.
L’UFCS ritiene che per il video sia stato usato materiale pubblico, e che la voce possa essere stata copiata con telefonate fatte in precedenza all’azienda per chiedere informazioni.
Da allora il fenomeno è cresciuto. Nel rapporto semestrale 2026/I l’UFCS scrive che il phishing via telefono è diventato il tipo di phishing più segnalato in Svizzera, che in una truffa del CEO i criminali hanno imitato la voce del superiore per far eseguire pagamenti, e che nelle truffe sentimentali compaiono voci imitate e videochiamate deepfake. Da maggio 2026 è cresciuto anche il phishing su TWINT.
Come funziona tecnicamente

Tecnica che usa modelli AI (Tacotron, ElevenLabs, OpenAI Voice Engine e simili) per generare nuovo audio nella voce di una persona reale a partire da pochi secondi di registrazione. Nel 2026 alcuni servizi commerciali producono cloni indistinguibili a partire da 3-5 secondi.
Phishing condotto via canale vocale (telefonata, voicemail, audio WhatsApp/Telegram). Storicamente lo svolgeva una persona; oggi l’attaccante è un’AI che parla con voce clonata di qualcuno di cui ti fidi.
Cosa significa per chi?
I due casi letti con il Metodo 3V
Questi sono esattamente i casi per cui serve il Metodo 3V del libro «Sicurezza informatica per professionisti»: tre domande da farsi sempre, prima di agire.
| La chiamata della “figlia” | La videochiamata del “capo” | |
|---|---|---|
| Verifica: chi mi chiede questa cosa è davvero chi dice di essere? | La voce non basta più. Chiedi la parola d’ordine di famiglia, oppure riaggancia e richiama tua figlia sul numero che hai in rubrica. | Il volto e la voce sullo schermo non bastano più. Richiama il capo sul suo numero interno o di cellulare, quello che conosci già. |
| Validazione: anche se fosse lui o lei, la richiesta ha senso? | Perché soldi a un conto o a un numero TWINT che non conosci? Perché non può chiamare il papà, o scriverti dal suo telefono? | Perché un pagamento urgente e confidenziale fuori dalla procedura normale? Perché proprio ora, con un avvocato che non hai mai sentito? |
| Velocità controllata: chi mi sta mettendo fretta, e perché? | ”Subito, adesso” è la leva della truffa. Una vera emergenza sopporta 60 secondi di verifica. | ”Entro un’ora o perdiamo il cliente” è la stessa leva. Nessuna procedura seria vieta di richiamare. |
Se una sola delle tre risposte non torna, ti fermi. Il metodo è spiegato anche nella guida al social engineering.
Le tre difese che funzionano
1. Parola d’ordine familiare e aziendale
La soluzione più semplice è anche la più efficace: stabilisci una parola d’ordine condivisa solo a voce, in privato, mai scritta da nessuna parte digitale. Quando ricevi una richiesta urgente o anomala, chiedi la parola d’ordine. Se la persona dall’altro capo non la sa o esita, è un’AI.
2. Verifica fuori canale
Se la chiamata arriva da un numero, riaggancia e richiama sul numero che hai in rubrica (non sul numero da cui ti hanno chiamato: potrebbe essere spoofato). Se è un audio WhatsApp, scrivi un messaggio testuale all’altra persona separatamente e chiedi conferma.
3. Il “muro dei 60 secondi”
L’urgenza è la leva universale di queste truffe. Imponi a te stesso una regola fissa: nessuna decisione finanziaria sopra una soglia (100 franchi o 100 euro per i privati, 1.000 per l’azienda) viene presa nei primi 60 secondi dopo una telefonata o un audio. Sessanta secondi sono sufficienti per chiamare qualcun altro, riascoltare, ragionare. L’AI conta sul fatto che non lo farai.
Per le PMI: tre azioni da fare subito
- Aggiorna la procedura di autorizzazione bonifici con verifica fuori canale obbligatoria sopra una soglia (es. CHF 5.000).
- Simula un attacco vocale al team finanza una volta a trimestre (basta una telefonata sceneggiata).
- Documenta una parola d’ordine settimanale condivisa solo a voce nella riunione del lunedì.
FAQ
Domande frequenti
Quanto audio serve davvero per clonare una voce nel 2026?
Meno di quanto pensi. Ho fatto la prova di persona: con un campione di 25 secondi della mia voce e un modello open source che gira su un computer normale, senza servizi a pagamento e senza internet, la voce clonata era simile alla mia all'80-90%. I servizi commerciali dichiarano di riuscirci anche con meno. In ogni caso bastano pochi secondi di voce, e sui social se ne trovano quanti ne servono.
Come riconosco un audio o una chiamata generati da AI?
Segnali tipici: rumore di fondo assente o troppo pulito, respirazione regolare ma 'finta', leggera 'piattezza' emotiva nelle variazioni di tono, pause innaturali tra le frasi. Però i modelli migliorano ogni mese: la regola sicura non è cercare difetti tecnici nell'audio, ma verificare l'identità con un canale diverso.
I miei figli sono al sicuro se hanno account privati?
Parzialmente. Anche un account privato può essere visto da follower compromessi, hackerato, o avere video reshare su altri canali. Per i minori la difesa migliore è la parola d'ordine familiare: se 'mamma' chiede soldi e non sa la parola, allora non è mamma.
La mia banca riconosce la mia voce. È pericoloso?
Sì. Diverse banche europee stanno disattivando i sistemi di voice biometric authentication proprio per questo. Se la tua banca offre ancora 'voice ID' come unico fattore, contatta il supporto e chiedi di passare a MFA app o token hardware. Se è solo un fattore aggiuntivo, è meno grave ma comunque debole.
Come PMI devo segnalare il caso se mi capita?
In Svizzera all'Ufficio federale della cibersicurezza UFCS (report.ncsc.admin.ch). In Italia alla Polizia Postale (commissariatodips.it) e al CSIRT Italia. La segnalazione è importante anche se hai bloccato la frode: aiuta a costruire il pattern di attacco per gli altri.