Bastano tre-cinque secondi di audio originale e 30 dollari per creare un deepfake vocale con l'85% di corrispondenza con la voce reale. I deepfake complessivi sono aumentati del 900% in un anno; i crimini di clonazione vocale del 1.300%, con attacchi politici e frodi in crescita esponenziale.
Deepfake audio: bastano tre secondi di voce e 30 euro per clonare chiunque
Tre secondi di voce e trenta dollari per clonare chiunque
Perché Meloni ha registrato la voce all'Ufficio europeo per la proprietà intellettuale? Cosa le serve davvero?
È un tentativo di creare una prova di autenticità. Se registra la voce ufficialmente, ha un documento che dice: questa è la mia voce vera. Se poi circola un deepfake, almeno c'è un confronto possibile.
Ma il problema è che il 70% delle persone non sa distinguere una voce reale da una clonata. Una registrazione ufficiale aiuta solo se qualcuno la controlla davvero.
Allora il costo è il vero ostacolo? Trenta dollari per clonare una voce sembra incredibilmente basso.
È basso perché la tecnologia è matura. Non è più una ricerca di laboratorio. È un servizio. Puoi comprarlo come compri qualsiasi altra cosa online.
E il dato del 1.300% di aumento nei crimini di clonazione vocale — è basato su quanti casi effettivi? Perché se il numero di partenza era piccolissimo, anche il 1.300% potrebbe non significare migliaia di vittime.
Buon punto. Quindi non sappiamo davvero quanti deepfake audio vengono creati ogni giorno?
No. I dati di settore mostrano un trend in forte ascesa, ma non c'è una cifra precisa. Sappiamo che McAfee ha registrato il 900% di aumento complessivo nei deepfake, ma il numero assoluto di casi rimane opaco.
E i sistemi di rilevamento perdono il 45-50% di precisione su deepfake reali. Significa che anche se una banca volesse verificare una voce, fallirebbe quasi una volta su due.
Quindi siamo in una situazione dove la tecnologia per creare falsi è economica e facile, ma la tecnologia per rilevarli è inaffidabile?
Esattamente. E il 24,6% dei deepfake ha finalità politiche. Non è solo frode finanziaria. È interferenza elettorale.
Ma ancora: quanti casi concreti di interferenza elettorale abbiamo visto? O è una proiezione di rischio?
El Pulso
- Bastano tre-cinque secondi di audio originale e 30 dollari per creare un deepfake vocale con l'85% di corrispondenza
- I crimini di clonazione vocale sono aumentati del 1.300%; i deepfake complessivi del 900% in un anno
- Il 24,6% dei deepfake ha finalità politiche; il 20,1% mira alla frode finanziaria
- Il 70% delle persone non sa distinguere una voce reale da una clonata
- I sistemi di rilevamento automatizzato perdono il 45-50% di precisione su deepfake reali rispetto ai test di laboratorio
Bastano tre-cinque secondi di audio originale e 30 dollari per creare un deepfake vocale con l'85% di corrispondenza con la voce reale. I deepfake complessivi sono aumentati del 900% in un anno; i crimini di clonazione vocale del 1.300%, con attacchi politici e frodi in crescita esponenziale.
L'intelligenza artificiale generativa consente di creare deepfake audio realistici con soli tre secondi di voce vera e costi minimi. I crimini legati alla clonazione vocale sono aumentati del 1.300%, con finalità politiche nel 24,6% dei casi e frodi nel 20,1%.
Tre secondi di voce. È tutto quello che serve oggi per clonare la voce di chiunque. Aggiungete trenta dollari e avrete un deepfake audio indistinguibile dall'originale, con una corrispondenza vocale dell'85% rispetto alla voce vera. La tecnologia è così accessibile, così economica, che il premier italiano Giorgia Meloni ha deciso di registrare la propria voce presso l'Ufficio dell'Unione europea per la proprietà intellettuale — un tentativo di blindarsi contro i falsi sintetici prima ancora che diventino un problema.
L'intelligenza artificiale generativa ha trasformato il paesaggio del possibile. Da un lato, ha creato strumenti straordinari: l'attore Val Kilmer ha potuto tornare a parlare nel nuovo Top Gun grazie a una voce sintetica che replica le sue sfumature, l'intonazione, il timbro. Dall'altro lato, ha aperto le porte a un nuovo genere di crimine. Un manager della Fideuram è stato vittima di una frode vocale. Le celebrità vedono le loro immagini manipolate senza consenso. E i numeri dicono che il fenomeno sta accelerando in modo allarmante.
Secondo i dati della società di sicurezza McAfee, i deepfake complessivi — video, foto, audio — sono aumentati del 900% in un anno. Ma il dato più inquietante riguarda la clonazione vocale nello specifico: i crimini legati ai deepfake audio sono cresciuti del 1.300%. Nel 2026, gli attacchi sono aumentati del 700% anno su anno. Gli strumenti per creare questi falsi sono ovunque, spesso economici, reperibili anche sul dark web. Kaspersky ha calcolato che il costo è crollato: cinquanta dollari per un deepfake video, trenta per uno audio — circa 400 volte meno rispetto a pochi anni fa.
Criminali e attori malevoli hanno imparato a sfruttare questa tecnologia con precisione chirurgica. Un breve frammento vocale — a volte bastano tre o cinque secondi — è sufficiente per ottenere una corrispondenza vocale dell'85%. Secondo un rapporto di IdentifAI, i deepfake video rappresentano il 45,6% degli attacchi, i media misti il 25,2%, le immagini il 17,4%, e la clonazione vocale il 10,5%. Ma il vero problema è l'intenzione dietro questi falsi. Nel 24,6% dei casi, l'obiettivo è politico. Nel 20,1%, è la frode finanziaria. L'11,3% riguarda contenuti pornografici. Il 9,3% prende di mira le celebrità. Solo il 3,2% è satira.
Hollywood ha iniziato a organizzarsi. Matthew McConaughey ha brevettato la propria immagine per difendersi dall'uso improprio dell'intelligenza artificiale. Cate Blanchett e George Clooney, insieme ad altre star, hanno lanciato un registro pubblico gratuito dove gli artisti possono dare il consenso preventivo all'uso della loro voce e della loro immagine per scopi creativi. È una difesa, ma fragile.
Il vero problema è che la maggior parte delle persone non sa riconoscere un deepfake audio. Secondo i dati di security.org, il 70% degli intervistati ha ammesso di non essere sicuro di poter distinguere una voce reale da una clonata. E i sistemi di rilevamento automatizzato — quelli più avanzati — perdono il 45-50% della loro precisione quando si confrontano con deepfake reali, al di fuori delle condizioni controllate di laboratorio. È la lacuna tra la teoria e la pratica, tra quello che funziona nei test e quello che funziona nel mondo.
L'Itu, l'Unione internazionale delle telecomunicazioni delle Nazioni Unite, ha lanciato un appello alle aziende tecnologiche: usate strumenti avanzati per rilevare ed eliminare la disinformazione e i contenuti deepfake. Il rischio è duplice: interferenze elettorali su larga scala e frodi finanziarie. Non è una minaccia teorica. È già qui. E il tempo per agire si sta restringendo.
Citas Notables
I deepfake complessivi sono aumentati del 900% in un anno, con crimini di clonazione vocale cresciuti del 1.300%— McAfee, società di sicurezza
Il 70% delle persone ha affermato di non essere sicuro di poter distinguere tra una voce reale e una voce clonata— security.org