Clonación de Voz
Tecnología de inteligencia artificial que permite replicar la voz de una persona a partir de muestras de audio, generando síntesis vocal indistinguible del original. En el ámbito forense, su detección es crucial para verificar la autenticidad de grabaciones presentadas como prueba.
¿Qué es la Clonación de Voz?
La clonación de voz (voice cloning) es una tecnología de inteligencia artificial que utiliza redes neuronales para analizar y replicar las características únicas de la voz de una persona: tono, timbre, cadencia, acento e incluso patrones emocionales.
A diferencia de los sintetizadores de voz tradicionales (como los asistentes virtuales), la clonación de voz produce un resultado que un oyente no entrenado puede confundir con el hablante original. Conviene no pasarse de ahí: el estudio de Lavan et al. en PLOS One (2025) concluye que los clones «suenan tan reales como voces humanas» pero no observa un efecto de hiperrealismo — y en sus experimentos solo el 62 % de las voces humanas fueron etiquetadas como humanas, así que el oyente también se equivoca en la otra dirección. «Indistinguible» sería más de lo que nadie ha medido.
Amenaza Real en 2026
No hay una serie estadística pública que mida cuántos fraudes de este tipo se cometen —ni el INCIBE ni el Ministerio del Interior los desglosan como categoría propia—, pero sí hay casos documentados de empresas que transfirieron cantidades elevadas tras una llamada de un supuesto directivo cuya voz había sido sintetizada.
Cómo Funciona la Tecnología
Fase de Entrenamiento
- Recopilación de muestras: Se obtienen grabaciones de la voz objetivo (entrevistas públicas, vídeos, llamadas).
- Procesamiento: La IA analiza patrones acústicos, frecuencias, ritmo y características únicas.
- Modelo generativo: Se entrena un modelo TTS (Text-to-Speech) personalizado.
Fase de Síntesis
- Entrada de texto: El atacante escribe lo que quiere que “diga” la víctima.
- Generación: El modelo produce audio con la voz clonada.
- Post-procesamiento: Se añade ruido ambiental o distorsión telefónica para ocultar artefactos.
Usos maliciosos
| Tipo de fraude | Descripción | Qué lo respalda |
|---|---|---|
| Fraude del CEO | Llamada de un supuesto directivo ordenando una transferencia | Documentado: el caso británico de 2019 que recoge INCIBE |
| Vishing a particulares | Suplantación de un familiar pidiendo dinero urgente | Documentado: la FTC avisa de que basta «un clip corto de audio» publicado en internet |
| Manipulación procesal | Audios falsos aportados como confesión | Riesgo previsible, no medido: nadie publica cuántas resoluciones se han visto afectadas |
| Extorsión | Grabaciones comprometedoras fabricadas | Escenario que el consorcio ASVspoof 2021 describe como incentivo del atacante — «para chantajear a la víctima o denigrar su reputación» |
| Desinformación | Declaraciones falsas atribuidas a figuras públicas | Escenario. No se cita aquí ningún expediente concreto porque no se ha abierto ninguno |
Las dos primeras filas tienen un caso detrás que se puede abrir y leer; las tres últimas son riesgos plausibles que nadie cuantifica. Presentarlas juntas bajo una misma etiqueta de «impacto» —«pérdidas millonarias», «condenas injustas»— daría por medido lo que no lo está.
Caso Real
En 2019, una empresa de energía del Reino Unido fue estafada por 220.000 euros cuando un empleado recibió una llamada del «CEO» de la matriz ordenando una transferencia urgente, que acabó en una cuenta en Hungría. Lo recoge INCIBE, y Forbes da el par completo: «220.000 € (aprox. 243.000 $)» — la misma cantidad en dos monedas.
Las fuentes contemporáneas no sostienen ni que la voz se clonara a partir de entrevistas en YouTube ni que un análisis forense posterior lo confirmara: la aseguradora «cree que el estafador usó software comercial de generación de voz», y YouTube aparece solo como riesgo general de material público, no como origen peritado de este clon.
Detección Forense de Voz Clonada
Indicios que un perito puede explorar
No son propiedades de «la» voz sintética, y este matiz decide si el dictamen aguanta. Cada sistema de síntesis deja huellas distintas, y las que dejaba un modelo de hace dos años no son las de hoy. El consorcio ASVspoof 2021 habla de artefactos de codificación, vocoder, reverberación y ruido; no publica que la F0 sintética sea siempre más estable, ni que la banda de 4-8 kHz delate la síntesis, ni que falte la respiración como regla.
| Indicio | Qué mirar | Cuidado |
|---|---|---|
| Prosodia | Entonación y pausas con una regularidad que el habla espontánea no tiene | Un locutor profesional leyendo un guion también es regular |
| Respiración | Ausencia de respiraciones entre frases | Muchos sistemas ya las insertan, y una grabación editada las pierde |
| Frecuencia fundamental | Comparar la variabilidad de la F0 con una muestra de referencia del mismo hablante | Sin muestra de referencia, un valor aislado no dice nada |
| Artefactos espectrales | Distorsiones de codificación o de vocoder | Aparecen también por compresión del canal telefónico |
| Transiciones entre fonemas | Cambios que no encajan con la coarticulación | Depende del idioma y del sistema |
El espectrograma es la herramienta de trabajo, no el veredicto: Praat mide F0, formantes y espectro, y lo que se compara es esta grabación contra una referencia conocida, no contra una idea de cómo debería sonar una voz sintética.
Herramientas de Análisis
| Herramienta | Para qué sirve de verdad | Tipo |
|---|---|---|
| Praat | Análisis fonético: espectrograma, F0, formantes. Es el instrumento de medida, no un detector | Gratuita, académica (Universidad de Ámsterdam) |
| Resemblyzer | Representación vectorial de la voz para verificación de hablante. Su propio README califica de «modest» su detección de habla falsa | Open source |
| iZotope RX | Reparación y postproducción de audio. Los «artefactos» que nombra su fabricante son defectos que el procesado reduce, no síntesis que detecte | Profesional |
| Phonexia Voice Inspector | Biometría de locutor y detección de deepfakes, orientada a uso forense | Comercial |
De Phonexia no se reproduce aquí su porcentaje de acierto: es cifra de fabricante, y en un dictamen la contraparte la trata como publicidad, no como validación independiente.
Preservar el audio original: resumen SHA-256, metadatos y cadena de custodia. El hash es buena práctica forense, no exigencia legal: lo que dice el art. 383.2 LEC es que el material «habrá de conservarse […] de modo que no sufra alteraciones».
Análisis de metadatos: Verificar origen, formato, software de grabación, fecha de creación.
Análisis espectral: Examinar espectrograma buscando patrones artificiales.
Análisis de prosodia: Estudiar ritmo, entonación, pausas y respiraciones.
Comparación biométrica: Si existe audio auténtico de referencia, comparar características.
Herramientas de detección IA: Usar modelos entrenados para identificar síntesis.
Validez Judicial
Requisitos para la Prueba de Audio
Para que un audio tenga validez como prueba judicial en España:
- Cadena de custodia: Documentar origen y manipulaciones.
- Integridad verificable: Hash criptográfico del archivo.
- Autenticidad acreditada: Peritaje si hay impugnación.
- Licitud de obtención: Respetar derechos fundamentales.
Impugnación por Clonación
Si sospechas que un audio presentado como prueba es sintético:
- Solicitar pericial de voz forense.
- Argumentar indicios técnicos de manipulación.
- Aportar muestras de referencia de la voz auténtica.
- Cuestionar cadena de custodia del audio.
Estrategia Procesal
La impugnación debe ser técnica y fundamentada. Argumentar genéricamente que “puede ser falso” no basta: la STS 116/2025, de 13 de febrero (Sala 2.ª — ROJ STS 634/2025 · ECLI:ES:TS:2025:634) exige que la impugnación se apoye en indicios concretos de manipulación para que resulte exigible la prueba pericial.
Protección y Prevención
Para Empresas
- Protocolos de verificación: Confirmar órdenes sensibles por segundo canal.
- Palabras clave: Establecer códigos secretos para autenticar llamadas críticas.
- Formación: Concienciar sobre riesgos de voice cloning.
- Grabación autorizada: Grabar llamadas importantes con consentimiento.
Para Particulares
- Limitar exposición vocal: Cuidar audios públicos en redes sociales.
- Verificar llamadas sospechosas: Colgar y llamar al número oficial.
- Palabras clave familiares: Establecer códigos con seres queridos.
- Desconfiar de urgencias: Los fraudes siempre tienen componente de urgencia.
Ejemplo de Análisis Pericial
Escenario
Se aporta un audio de WhatsApp donde supuestamente el acusado confiesa un delito. La defensa solicita verificar su autenticidad.
Metodología
1. Preservación
Hash SHA-256: a3f2b9c4e8d1...
Formato: OPUS, 16kHz, mono
Duración: 47 segundos
Metadatos: Codificado por WhatsApp2. Hallazgos en espectrograma
- Armónicos excesivamente regulares en frecuencias 200-400 Hz
- Ausencia de respiraciones naturales
- Transición abrupta en segundo 0:23
- Patrón de ruido inconsistente con grabación telefónica3. Análisis de prosodia
- F0 media: 142 Hz (estable, desviación 3.2 Hz)
- F0 referencia voz auténtica: 145 Hz (desviación 12.7 Hz)
- Pausas: Intervalos demasiado regulares
- Respiración: No detectada4. Conclusión El audio presenta múltiples indicadores consistentes con síntesis vocal mediante clonación de voz. Con alto grado de probabilidad, el audio ha sido generado artificialmente y no corresponde a una grabación auténtica del acusado.
Futuro de la Tecnología
La tendencia es constante y va en una sola dirección: la cantidad de audio necesaria para clonar una voz no deja de reducirse —de minutos a segundos en pocos años— y la síntesis en tiempo real durante una llamada ha dejado de ser un supuesto teórico. No conviene fijar la frontera en una cifra concreta, porque cada modelo nuevo la mueve.
Esto hace que la detección forense especializada sea cada vez más necesaria y que la presunción de autenticidad de grabaciones de voz ya no sea sostenible sin verificación técnica.
¿Dudas de que ese audio o ese vídeo sean auténticos?
El análisis de autenticidad examina el fichero, sus metadatos y sus huellas de codificación para decir qué se puede afirmar y con qué límites.
Referencias y fuentes
- INCIBE — ¿Qué es el voice hacking? (act. 27-11-2024). Recoge el fraude británico de 2019 por 220.000 € mediante voz clonada del CEO de la matriz, y los casos de vishing a familiares.
- Forbes — A Voice Deepfake Was Used To Scam A CEO Out Of $243,000 (3-9-2019). Da el par «220.000 € (aprox. 243.000 $)» y la fuente: Rüdiger Kirsch, de Euler Hermes.
- Federal Trade Commission — Scammers use AI to enhance their family emergency schemes (3-2023). Basta «un clip corto de audio» publicado en internet para clonar la voz de un allegado.
- Lavan, Irvine, Rosi y McGettigan — Voice clones sound realistic but not (yet) hyperrealistic, PLOS One, 24-9-2025. Los clones suenan tan reales como voces humanas, pero no se observa hiperrealismo: solo el 62 % de las voces humanas fueron etiquetadas como humanas.
- Wang, Liu et al. (Microsoft) — Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers (VALL-E). Síntesis personalizada de calidad «con solo 3 segundos de grabación» de un hablante no visto.
- Consorcio ASVspoof — ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection. Artefactos de codificación, vocoder, reverberación y ruido; describe el chantaje como incentivo del atacante.
- Jefatura del Estado — Ley 1/2000, de Enjuiciamiento Civil. Arts. 287 (ilicitud de la prueba), 382 (reproducción de palabras y sonidos, y dictámenes cuando se cuestiona su autenticidad y exactitud), 383.2 (conservación sin alteraciones) y 348 (sana crítica).
- Jefatura del Estado — Ley Orgánica 6/1985, del Poder Judicial, art. 11.1. No surtirán efecto las pruebas obtenidas violentando derechos o libertades fundamentales.
- Tribunal Supremo, Sala de lo Penal — STS 116/2025, de 13 de febrero (ROJ STS 634/2025 · ECLI:ES:TS:2025:634), ponente Lamela Díaz. La impugnación debe apoyarse en «sospechas o indicios de manipulación, pero no de forma genérica y retóricamente», y cuestionar una prueba «no implica que tales pruebas deban ser expulsadas automáticamente». Resuelve sobre mensajería y una fotografía, no sobre audio clonado: la analogía es procesal.
- Boersma y Weenink — Praat: doing Phonetics by Computer, Universidad de Ámsterdam. Espectrograma, análisis de F0 y de formantes.
Conclusión
La clonación de voz representa una de las amenazas más serias para la autenticidad de la prueba de audio. Su detección requiere análisis forense especializado, combinando técnicas acústicas tradicionales con herramientas de inteligencia artificial. Para abogados y tribunales, la época en que un audio “hablaba por sí mismo” ha terminado.
Última actualización: 20 de agosto de 2026 Categoría: Técnico Código: CLV-001
Preguntas Frecuentes
¿Cuánto audio se necesita para clonar una voz?
Cada vez menos. La cantidad de audio necesaria ha caído de minutos a segundos en muy pocos años, y hoy una muestra breve y limpia basta para obtener un clon convincente. La calidad mejora cuanto más material haya y menos ruido tenga, pero la barrera de entrada es ya muy baja.
¿Se puede detectar una voz clonada?
Se puede analizar, que no es lo mismo que detectar con certeza. Un perito compara espectrograma, prosodia, frecuencia fundamental y artefactos de codificación contra una muestra de referencia del mismo hablante. No hay un indicador que valga para todos los sistemas de síntesis, y las huellas que dejaba un modelo de hace dos años no son las de hoy.
¿Un audio clonado vale como prueba judicial?
No hay rechazo automático. La STS 116/2025 (Sala 2.ª) recuerda que cuestionar una prueba digital «no implica que tales pruebas deban ser expulsadas automáticamente»: rige la libre valoración del art. 382.3 LEC, y el tribunal examina el dictamen junto al resto de la prueba. Un informe que concluya que el audio es sintético es un medio más, valorado por sana crítica; no demuestra fraude por sí solo.
Términos Relacionados
Deepfake y Detección
Contenido multimedia sintético generado mediante inteligencia artificial que manipula rostros, voces o cuerpos de personas reales. La detección forense de deepfakes es crucial para verificar la autenticidad de evidencia audiovisual.
Evidencia Digital
Información digital (archivos, logs, mensajes) con valor probatorio en juicio. Su peso depende de que se pueda sostener su autenticidad e integridad, y la licitud de la obtención se juzga aparte, por el art. 11.1 LOPJ.
Análisis Forense Digital
Conjunto de procedimientos científicos y técnicos para identificar, preservar y analizar evidencias digitales admisibles en juicios civiles, penales o laborales.
¿Necesitas un peritaje forense?
Si necesitas ayuda profesional con análisis forense digital, estoy aquí para ayudarte.
Solicitar Consulta Gratuita
