Técnico

Clonación de Voz

Tecnología de inteligencia artificial que permite replicar la voz de una persona a partir de muestras de audio, generando síntesis vocal indistinguible del original. En el ámbito forense, su detección es crucial para verificar la autenticidad de grabaciones presentadas como prueba.

10 min de lectura

¿Qué es la Clonación de Voz?

La clonación de voz (voice cloning) es una tecnología de inteligencia artificial que utiliza redes neuronales para analizar y replicar las características únicas de la voz de una persona: tono, timbre, cadencia, acento e incluso patrones emocionales.

A diferencia de los sintetizadores de voz tradicionales (como los asistentes virtuales), la clonación de voz produce un resultado que un oyente no entrenado puede confundir con el hablante original. Conviene no pasarse de ahí: el estudio de Lavan et al. en PLOS One (2025) concluye que los clones «suenan tan reales como voces humanas» pero no observa un efecto de hiperrealismo — y en sus experimentos solo el 62 % de las voces humanas fueron etiquetadas como humanas, así que el oyente también se equivoca en la otra dirección. «Indistinguible» sería más de lo que nadie ha medido.

Amenaza Real en 2026

No hay una serie estadística pública que mida cuántos fraudes de este tipo se cometen —ni el INCIBE ni el Ministerio del Interior los desglosan como categoría propia—, pero sí hay casos documentados de empresas que transfirieron cantidades elevadas tras una llamada de un supuesto directivo cuya voz había sido sintetizada.

Cómo Funciona la Tecnología

Fase de Entrenamiento

  1. Recopilación de muestras: Se obtienen grabaciones de la voz objetivo (entrevistas públicas, vídeos, llamadas).
  2. Procesamiento: La IA analiza patrones acústicos, frecuencias, ritmo y características únicas.
  3. Modelo generativo: Se entrena un modelo TTS (Text-to-Speech) personalizado.

Fase de Síntesis

  1. Entrada de texto: El atacante escribe lo que quiere que “diga” la víctima.
  2. Generación: El modelo produce audio con la voz clonada.
  3. Post-procesamiento: Se añade ruido ambiental o distorsión telefónica para ocultar artefactos.

Usos maliciosos

Tipo de fraudeDescripciónQué lo respalda
Fraude del CEOLlamada de un supuesto directivo ordenando una transferenciaDocumentado: el caso británico de 2019 que recoge INCIBE
Vishing a particularesSuplantación de un familiar pidiendo dinero urgenteDocumentado: la FTC avisa de que basta «un clip corto de audio» publicado en internet
Manipulación procesalAudios falsos aportados como confesiónRiesgo previsible, no medido: nadie publica cuántas resoluciones se han visto afectadas
ExtorsiónGrabaciones comprometedoras fabricadasEscenario que el consorcio ASVspoof 2021 describe como incentivo del atacante — «para chantajear a la víctima o denigrar su reputación»
DesinformaciónDeclaraciones falsas atribuidas a figuras públicasEscenario. No se cita aquí ningún expediente concreto porque no se ha abierto ninguno

Las dos primeras filas tienen un caso detrás que se puede abrir y leer; las tres últimas son riesgos plausibles que nadie cuantifica. Presentarlas juntas bajo una misma etiqueta de «impacto» —«pérdidas millonarias», «condenas injustas»— daría por medido lo que no lo está.

Caso Real

En 2019, una empresa de energía del Reino Unido fue estafada por 220.000 euros cuando un empleado recibió una llamada del «CEO» de la matriz ordenando una transferencia urgente, que acabó en una cuenta en Hungría. Lo recoge INCIBE, y Forbes da el par completo: «220.000 € (aprox. 243.000 $)» — la misma cantidad en dos monedas.

Las fuentes contemporáneas no sostienen ni que la voz se clonara a partir de entrevistas en YouTube ni que un análisis forense posterior lo confirmara: la aseguradora «cree que el estafador usó software comercial de generación de voz», y YouTube aparece solo como riesgo general de material público, no como origen peritado de este clon.

Detección Forense de Voz Clonada

Indicios que un perito puede explorar

No son propiedades de «la» voz sintética, y este matiz decide si el dictamen aguanta. Cada sistema de síntesis deja huellas distintas, y las que dejaba un modelo de hace dos años no son las de hoy. El consorcio ASVspoof 2021 habla de artefactos de codificación, vocoder, reverberación y ruido; no publica que la F0 sintética sea siempre más estable, ni que la banda de 4-8 kHz delate la síntesis, ni que falte la respiración como regla.

IndicioQué mirarCuidado
ProsodiaEntonación y pausas con una regularidad que el habla espontánea no tieneUn locutor profesional leyendo un guion también es regular
RespiraciónAusencia de respiraciones entre frasesMuchos sistemas ya las insertan, y una grabación editada las pierde
Frecuencia fundamentalComparar la variabilidad de la F0 con una muestra de referencia del mismo hablanteSin muestra de referencia, un valor aislado no dice nada
Artefactos espectralesDistorsiones de codificación o de vocoderAparecen también por compresión del canal telefónico
Transiciones entre fonemasCambios que no encajan con la coarticulaciónDepende del idioma y del sistema

El espectrograma es la herramienta de trabajo, no el veredicto: Praat mide F0, formantes y espectro, y lo que se compara es esta grabación contra una referencia conocida, no contra una idea de cómo debería sonar una voz sintética.

Herramientas de Análisis

HerramientaPara qué sirve de verdadTipo
PraatAnálisis fonético: espectrograma, F0, formantes. Es el instrumento de medida, no un detectorGratuita, académica (Universidad de Ámsterdam)
ResemblyzerRepresentación vectorial de la voz para verificación de hablante. Su propio README califica de «modest» su detección de habla falsaOpen source
iZotope RXReparación y postproducción de audio. Los «artefactos» que nombra su fabricante son defectos que el procesado reduce, no síntesis que detecteProfesional
Phonexia Voice InspectorBiometría de locutor y detección de deepfakes, orientada a uso forenseComercial

De Phonexia no se reproduce aquí su porcentaje de acierto: es cifra de fabricante, y en un dictamen la contraparte la trata como publicidad, no como validación independiente.

  1. Preservar el audio original: resumen SHA-256, metadatos y cadena de custodia. El hash es buena práctica forense, no exigencia legal: lo que dice el art. 383.2 LEC es que el material «habrá de conservarse […] de modo que no sufra alteraciones».

  2. Análisis de metadatos: Verificar origen, formato, software de grabación, fecha de creación.

  3. Análisis espectral: Examinar espectrograma buscando patrones artificiales.

  4. Análisis de prosodia: Estudiar ritmo, entonación, pausas y respiraciones.

  5. Comparación biométrica: Si existe audio auténtico de referencia, comparar características.

  6. Herramientas de detección IA: Usar modelos entrenados para identificar síntesis.

Validez Judicial

Requisitos para la Prueba de Audio

Para que un audio tenga validez como prueba judicial en España:

  1. Cadena de custodia: Documentar origen y manipulaciones.
  2. Integridad verificable: Hash criptográfico del archivo.
  3. Autenticidad acreditada: Peritaje si hay impugnación.
  4. Licitud de obtención: Respetar derechos fundamentales.

Impugnación por Clonación

Si sospechas que un audio presentado como prueba es sintético:

  • Solicitar pericial de voz forense.
  • Argumentar indicios técnicos de manipulación.
  • Aportar muestras de referencia de la voz auténtica.
  • Cuestionar cadena de custodia del audio.
Estrategia Procesal

La impugnación debe ser técnica y fundamentada. Argumentar genéricamente que “puede ser falso” no basta: la STS 116/2025, de 13 de febrero (Sala 2.ª — ROJ STS 634/2025 · ECLI:ES:TS:2025:634) exige que la impugnación se apoye en indicios concretos de manipulación para que resulte exigible la prueba pericial.

Protección y Prevención

Para Empresas

  • Protocolos de verificación: Confirmar órdenes sensibles por segundo canal.
  • Palabras clave: Establecer códigos secretos para autenticar llamadas críticas.
  • Formación: Concienciar sobre riesgos de voice cloning.
  • Grabación autorizada: Grabar llamadas importantes con consentimiento.

Para Particulares

  • Limitar exposición vocal: Cuidar audios públicos en redes sociales.
  • Verificar llamadas sospechosas: Colgar y llamar al número oficial.
  • Palabras clave familiares: Establecer códigos con seres queridos.
  • Desconfiar de urgencias: Los fraudes siempre tienen componente de urgencia.

Ejemplo de Análisis Pericial

Escenario

Se aporta un audio de WhatsApp donde supuestamente el acusado confiesa un delito. La defensa solicita verificar su autenticidad.

Metodología

1. Preservación

Hash SHA-256: a3f2b9c4e8d1...
Formato: OPUS, 16kHz, mono
Duración: 47 segundos
Metadatos: Codificado por WhatsApp

2. Hallazgos en espectrograma

- Armónicos excesivamente regulares en frecuencias 200-400 Hz
- Ausencia de respiraciones naturales
- Transición abrupta en segundo 0:23
- Patrón de ruido inconsistente con grabación telefónica

3. Análisis de prosodia

- F0 media: 142 Hz (estable, desviación 3.2 Hz)
- F0 referencia voz auténtica: 145 Hz (desviación 12.7 Hz)
- Pausas: Intervalos demasiado regulares
- Respiración: No detectada

4. Conclusión El audio presenta múltiples indicadores consistentes con síntesis vocal mediante clonación de voz. Con alto grado de probabilidad, el audio ha sido generado artificialmente y no corresponde a una grabación auténtica del acusado.

Futuro de la Tecnología

La tendencia es constante y va en una sola dirección: la cantidad de audio necesaria para clonar una voz no deja de reducirse —de minutos a segundos en pocos años— y la síntesis en tiempo real durante una llamada ha dejado de ser un supuesto teórico. No conviene fijar la frontera en una cifra concreta, porque cada modelo nuevo la mueve.

Esto hace que la detección forense especializada sea cada vez más necesaria y que la presunción de autenticidad de grabaciones de voz ya no sea sostenible sin verificación técnica.

¿Dudas de que ese audio o ese vídeo sean auténticos?

El análisis de autenticidad examina el fichero, sus metadatos y sus huellas de codificación para decir qué se puede afirmar y con qué límites.

Referencias y fuentes

  1. INCIBE¿Qué es el voice hacking? (act. 27-11-2024). Recoge el fraude británico de 2019 por 220.000 € mediante voz clonada del CEO de la matriz, y los casos de vishing a familiares.
  2. ForbesA Voice Deepfake Was Used To Scam A CEO Out Of $243,000 (3-9-2019). Da el par «220.000 € (aprox. 243.000 $)» y la fuente: Rüdiger Kirsch, de Euler Hermes.
  3. Federal Trade CommissionScammers use AI to enhance their family emergency schemes (3-2023). Basta «un clip corto de audio» publicado en internet para clonar la voz de un allegado.
  4. Lavan, Irvine, Rosi y McGettiganVoice clones sound realistic but not (yet) hyperrealistic, PLOS One, 24-9-2025. Los clones suenan tan reales como voces humanas, pero no se observa hiperrealismo: solo el 62 % de las voces humanas fueron etiquetadas como humanas.
  5. Wang, Liu et al. (Microsoft)Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers (VALL-E). Síntesis personalizada de calidad «con solo 3 segundos de grabación» de un hablante no visto.
  6. Consorcio ASVspoofASVspoof 2021: accelerating progress in spoofed and deepfake speech detection. Artefactos de codificación, vocoder, reverberación y ruido; describe el chantaje como incentivo del atacante.
  7. Jefatura del EstadoLey 1/2000, de Enjuiciamiento Civil. Arts. 287 (ilicitud de la prueba), 382 (reproducción de palabras y sonidos, y dictámenes cuando se cuestiona su autenticidad y exactitud), 383.2 (conservación sin alteraciones) y 348 (sana crítica).
  8. Jefatura del EstadoLey Orgánica 6/1985, del Poder Judicial, art. 11.1. No surtirán efecto las pruebas obtenidas violentando derechos o libertades fundamentales.
  9. Tribunal Supremo, Sala de lo PenalSTS 116/2025, de 13 de febrero (ROJ STS 634/2025 · ECLI:ES:TS:2025:634), ponente Lamela Díaz. La impugnación debe apoyarse en «sospechas o indicios de manipulación, pero no de forma genérica y retóricamente», y cuestionar una prueba «no implica que tales pruebas deban ser expulsadas automáticamente». Resuelve sobre mensajería y una fotografía, no sobre audio clonado: la analogía es procesal.
  10. Boersma y WeeninkPraat: doing Phonetics by Computer, Universidad de Ámsterdam. Espectrograma, análisis de F0 y de formantes.

Conclusión

La clonación de voz representa una de las amenazas más serias para la autenticidad de la prueba de audio. Su detección requiere análisis forense especializado, combinando técnicas acústicas tradicionales con herramientas de inteligencia artificial. Para abogados y tribunales, la época en que un audio “hablaba por sí mismo” ha terminado.

Última actualización: 20 de agosto de 2026 Categoría: Técnico Código: CLV-001

Preguntas Frecuentes

¿Cuánto audio se necesita para clonar una voz?

Cada vez menos. La cantidad de audio necesaria ha caído de minutos a segundos en muy pocos años, y hoy una muestra breve y limpia basta para obtener un clon convincente. La calidad mejora cuanto más material haya y menos ruido tenga, pero la barrera de entrada es ya muy baja.

¿Se puede detectar una voz clonada?

Se puede analizar, que no es lo mismo que detectar con certeza. Un perito compara espectrograma, prosodia, frecuencia fundamental y artefactos de codificación contra una muestra de referencia del mismo hablante. No hay un indicador que valga para todos los sistemas de síntesis, y las huellas que dejaba un modelo de hace dos años no son las de hoy.

¿Un audio clonado vale como prueba judicial?

No hay rechazo automático. La STS 116/2025 (Sala 2.ª) recuerda que cuestionar una prueba digital «no implica que tales pruebas deban ser expulsadas automáticamente»: rige la libre valoración del art. 382.3 LEC, y el tribunal examina el dictamen junto al resto de la prueba. Un informe que concluya que el audio es sintético es un medio más, valorado por sana crítica; no demuestra fraude por sí solo.

¿Necesitas un peritaje forense?

Si necesitas ayuda profesional con análisis forense digital, estoy aquí para ayudarte.

Solicitar Consulta Gratuita
Jonathan Izquierdo

Jonathan Izquierdo · Perito Forense

+15 años experiencia · AWS Certified

WhatsApp