Análisis Forense

Formante de Audio

Frecuencia de resonancia del tracto vocal (F1, F2, F3) que aporta información útil para comparar habla, identificar locutores y detectar voz sintética (deepfakes). No es una huella vocal única: los formantes varían dentro de un mismo hablante y se solapan entre hablantes, por lo que la comparación forense exige un método validado y una conclusión que exprese incertidumbre.

20 min de lectura

Formante de Audio

Algunos sistemas experimentales han sintetizado habla personalizada a partir de una muestra de apenas tres segundos; la semejanza depende de la duración y calidad de la muestra, el ruido y el modelo, y por eso una llamada telefónica ya no puede valorarse por sí sola sin comprobaciones. Frente a ello, un estudio de 2025 (Yang et al.) encontró que ciertas características segmentales del habla —entre ellas los formantes vocálicos— rindieron mejor que las características globales probadas para distinguir voz real de sintética; es un resultado prometedor, pero speaker-specific y sin tasa de error poblacional, no un detector general ya validado para tribunal.


Definición técnica

Un formante es un pico de concentración de energía acústica en el espectro de frecuencias de un sonido del habla, producido por la resonancia del tracto vocal (faringe, cavidad oral, cavidad nasal, labios). Cada configuración del tracto vocal genera frecuencias de resonancia específicas denominadas F1, F2, F3, F4 y superiores.

Los formantes principales:

FormanteRango frecuencia típicoDeterminado porFunción lingüística
F1 (primer formante)250-900 HzApertura mandibular (altura vocal)Distingue vocales abiertas (/a/) de cerradas (/i/, /u/)
F2 (segundo formante)850-2.500 HzPosición anterior-posterior de la lenguaDistingue vocales anteriores (/i/, /e/) de posteriores (/o/, /u/)
F3 (tercer formante)1.800-3.500 HzLongitud del tracto vocal y configuración labialAporta información sobre el timbre individual del hablante
F4 (cuarto formante)3.000-4.500 HzResonancia subglótica y dimensiones laríngeasInformación adicional sobre anatomía del hablante

Diferencia clave entre formantes y frecuencia fundamental (F0):

  • F0 (pitch): Frecuencia de vibración de las cuerdas vocales. Determina si la voz suena grave o aguda. Se puede modificar voluntariamente y los deepfakes la replican con facilidad
  • Formantes (F1-F4): Resonancias del tracto vocal. Dependen de la anatomía física del hablante (longitud del tracto, forma de la mandíbula, posición de la lengua). Son mucho más difíciles de falsificar
No es una huella vocal

La analogía de la “huella vocal” (voiceprint) está desacreditada por la comunidad científica: los formantes no son un identificador individual invariante. La combinación F1-F4 aporta información discriminante —dos personas con la misma F0 pueden tener formantes distintos—, pero esos valores varían dentro de un mismo hablante y se solapan entre hablantes. La comparación forense debe usar un método validado, muestras comparables, una población de referencia adecuada y una conclusión que exprese incertidumbre.


Cómo funcionan los formantes en el habla humana

Producción de formantes

El proceso de generación de formantes sigue el modelo fuente-filtro de la producción del habla:

  1. Fuente (cuerdas vocales): Las cuerdas vocales vibran generando una onda sonora compleja rica en armónicos, con frecuencia fundamental F0
  2. Filtro (tracto vocal): La onda viaja por faringe, cavidad oral y nasal. Cada cavidad actúa como resonador que amplifica ciertas frecuencias (formantes) y atenúa otras
  3. Articulación: La posición de lengua, mandíbula y labios modifica la geometría del tracto vocal, cambiando las frecuencias de resonancia
  4. Resultado: El sonido que sale de los labios contiene los formantes específicos que identifican cada vocal y caracterizan al hablante individual

Mapa de formantes vocálicos del español

Las cinco vocales del español se distinguen principalmente por F1 y F2:

          F2 alto (anterior)    F2 medio    F2 bajo (posterior)
          ~2.200 Hz             ~1.500 Hz   ~800 Hz
          ┌─────────────────────────────────────────┐
F1 bajo   │  /i/ (F1:300,F2:2200)          /u/ (F1:300,F2:800)  │ (cerradas)
~300 Hz   │                                                       │
          │      /e/ (F1:450,F2:1900)  /o/ (F1:500,F2:900)      │
          │                                                       │
F1 alto   │            /a/ (F1:800,F2:1300)                      │ (abierta)
~800 Hz   │                                                       │
          └─────────────────────────────────────────┘

Valores orientativos para hablante masculino español (varían por individuo, sexo y dialecto):

VocalF1 (Hz)F2 (Hz)F3 (Hz)
/a/750-8501.200-1.4002.400-2.600
/e/400-5001.800-2.0002.500-2.700
/i/270-3202.100-2.4002.800-3.100
/o/450-550800-1.0002.400-2.600
/u/280-340700-9002.300-2.500

Variabilidad individual: por qué los formantes identifican hablantes

La combinación de formantes aporta información discriminante entre personas porque depende de factores anatómicos individuales, aunque varía dentro de un mismo hablante y se solapa entre hablantes:

  • Longitud del tracto vocal: Hombres (17,5 cm promedio) vs mujeres (14,5 cm) produce diferentes frecuencias de resonancia
  • Forma de la mandíbula: Afecta directamente a F1
  • Posición habitual de la lengua: Afecta a F2 (dialectos regionales crean patrones formánticos distintivos)
  • Configuración nasal: Modifica formantes en consonantes nasales
  • Tensión muscular laríngea: Influye en F3 y F4

Formantes y detección de deepfakes de voz

Por qué los deepfakes fallan en los formantes

Un estudio speaker-specific de 2025 (Yang et al.), con seis voces reales y clones creados con dos generadores en inglés estadounidense, encontró que ciertas características segmentales —entre ellas los formantes vocálicos— rindieron mejor que las características globales probadas (MFCC, LTFD, LTF0) para distinguir voz real de sintética. No estableció una tasa de error poblacional ni evaluó telefonía.

Diferencias que pueden aparecer entre voz real y sintética (tendencias observadas que deben validarse en cada caso, no invariantes garantizados):

AspectoVoz humana realVoz sintética (deepfake)
Micro-variaciones F1-F3Fluctuaciones naturales continuas (jitter formántico)Patrones demasiado regulares, estabilidad artificial
Transiciones entre vocalesMovimientos suaves y complejos entre formantesTransiciones abruptas o sobre-suavizadas
Co-articulaciónFormantes se modifican por consonantes adyacentesCo-articulación simplificada o ausente
Respiración y fatigaFormantes cambian sutilmente con la fatiga vocalSin degradación natural a lo largo del discurso
EmocionesFormantes se desplazan con el estado emocionalDesplazamiento emocional ausente o artificial
F0-Formant coherenceCorrelación natural entre pitch y resonanciaIncoherencia entre F0 manipulado y formantes base
Incoherencia pitch-formante: un indicio, no una firma universal

Algunas manipulaciones de voz alteran la frecuencia fundamental (F0) para cambiar el tono percibido sin ajustar coherentemente los formantes, que dependen del filtro del tracto vocal. Esa incoherencia entre F0 y formantes puede dejar indicios medibles, pero no constituye una firma universal de deepfake: hay herramientas (el propio Praat entre ellas) capaces de modificar el filtro formántico, y que un caso concreto sea detectable depende del generador, el canal y el método de validación empleado. Es una hipótesis que debe contrastarse, no un detector categórico.

Hallazgos clave del estudio 2025

El estudio Forensic deepfake audio detection using segmental speech features (Yang et al., arXiv:2505.13847) encontró:

  1. Formantes midpoint (MF) superan a MFCC: Los formantes vocálicos medidos en el punto medio de la vocal proporcionan mejor valor evidencial que los coeficientes cepstrales en la distinción real vs sintético
  2. Variabilidad pronunciada: Los modelos deepfake muestran variabilidad pronunciada en la precisión de replicación de formantes vocálicos individuales
  3. Interpretabilidad: Los formantes son interpretables por su relación directa con los procesos articulatorios humanos, lo que ayuda a explicar el análisis (no equivale por sí solo a validación judicial)
  4. Accent drift detectable: El análisis formántico puede detectar “drift” de acento, es decir, desviaciones en los patrones formánticos esperados para un dialecto específico, que algunos modelos de síntesis introducen inadvertidamente
  5. Reproducibilidad forense: Al anclarse a unidades fonéticas identificables (vocales específicas), el análisis formántico es transparente y reproducible; son cualidades que refuerzan su fiabilidad, aunque la admisibilidad depende del método validado, las muestras y el caso concreto

Herramientas de análisis formántico

Praat (herramienta principal)

Praat es un software libre desarrollado por Paul Boersma y David Weenink de la Universidad de Amsterdam, una de las herramientas más utilizadas para el análisis acústico del habla en fonética forense. No existe un método único aceptado por todos los profesionales: OSAC describe varios enfoques y el propio manual de Praat advierte de sus supuestos y de que se ofrece «sin garantía».

Capacidades:

  • Visualización de espectrograma con formantes superpuestos
  • Medición automática de F1, F2, F3, F4, F5 (algoritmo Burg)
  • Tracking de formantes a lo largo del tiempo
  • Análisis de pitch (F0), intensidad, jitter, shimmer
  • Scripts automatizables para análisis masivo de muestras
  • Exportación de datos para análisis estadístico

Procedimiento de análisis formántico en Praat:

  1. Cargar audio: Abrir archivo WAV/AIFF en Praat (recomendado 44.1 kHz, 16-bit mínimo)
  2. Visualizar espectrograma: View > Show spectrogram (ventana efectiva de 0,025 s con paso temporal de 0,005 s, rango 0-5000 Hz)
  3. Configurar tracking formantes: Formant > Formant settings (5 formantes; techo orientativo 5.500 Hz para mujer adulta y 5.000 Hz para hombre adulto, ajustable por hablante)
  4. Segmentar vocales: Identificar y etiquetar segmentos vocálicos en TextGrid
  5. Extraer mediciones: Formant > Get formant (F1, F2, F3) en punto medio de cada vocal
  6. Comparar muestras: Contrastar valores formánticos de muestra cuestionada vs muestra de referencia
  7. Analizar coherencia F0-formante: Verificar correlación natural entre pitch y resonancias
## Script Praat: Extraer formantes de vocales segmentadas
## Uso forense: comparación de muestras de voz
form Configuracion analisis
    text archivo_audio "muestra_cuestionada.wav"
    text archivo_textgrid "segmentacion.TextGrid"
    integer num_formantes 5
    real techo_formantes 5500
endform

Read from file: archivo_audio$
Read from file: archivo_textgrid$

selectObject: "Sound " + replace$(archivo_audio$, ".wav", "", 1)
To Formant (burg): 0.0, num_formantes, techo_formantes, 0.025, 50

## Iterar por intervalos del TextGrid
selectObject: "TextGrid " + replace$(archivo_textgrid$, ".TextGrid", "", 1)
num_intervalos = Get number of intervals: 1

for i from 1 to num_intervalos
    label$ = Get label of interval: 1, i
    if label$ <> ""
        inicio = Get start time of interval: 1, i
        fin = Get end time of interval: 1, i
        medio = (inicio + fin) / 2

        selectObject: "Formant " + replace$(archivo_audio$, ".wav", "", 1)
        f1 = Get value at time: 1, medio, "hertz", "linear"
        f2 = Get value at time: 2, medio, "hertz", "linear"
        f3 = Get value at time: 3, medio, "hertz", "linear"

        appendInfoLine: label$, tab$, fixed$(f1,1), tab$, fixed$(f2,1), tab$, fixed$(f3,1)
        selectObject: "TextGrid " + replace$(archivo_textgrid$, ".TextGrid", "", 1)
    endif
endfor

Otras herramientas de análisis

HerramientaTipoCosteUso forense
PraatAnálisis acústico generalGratuito (open source)Ampliamente utilizada para medición de formantes, espectrogramas y análisis de habla
iZotope RXRestauración y análisis audioComercial (de pago, varias ediciones)Spectral editing, de-noise, detección ediciones, análisis espectral avanzado
AudacityEditor audio generalGratuito (open source)Espectrograma básico, análisis de frecuencia por ventana
VOCALISESpeaker recognitionComercial (Oxford Wave Research)Comparación automática de hablantes con ratio de verosimilitud
Adobe AuditionEdición audio profesionalComercial (suscripción)Espectrograma multicanal, análisis de frecuencia en tiempo real
BATVOXIdentificación forense de locutoresComercial (Agnitio)Comparación automática de hablantes (producto histórico de Agnitio)
SIS IIToolkit de reconocimiento de locutorComercial (Speech Technology Center)Producto distinto de BATVOX, de otro fabricante
Praat en fonética forense

Praat se cita en numerosas publicaciones de fonética forense y es una de las herramientas más usadas por profesionales. El acceso al código y a los parámetros facilita la auditoría y la reproducción, pero la admisión y el peso de la prueba dependen del método, su validación, las muestras y el caso concreto: una herramienta no queda judicialmente validada por su licencia. VOCALISE y BATVOX complementan el análisis cuando se requiere comparación automatizada de grandes volúmenes de muestras.


Escenario ilustrativo: deepfake de voz de un CEO detectado por análisis formántico

Escenario ilustrativo

El supuesto siguiente es ficticio y sirve únicamente para mostrar un flujo de trabajo posible. No corresponde a un cliente, expediente, resolución judicial ni resultado económico real. Las cifras y mediciones no son resultados de una validación y no predicen el desenlace de un caso.

Contexto

Una empresa recibe una llamada telefónica que aparenta ser de su CEO (de viaje) dirigida al director financiero, con la orden de una transferencia urgente de una cantidad elevada a un proveedor internacional. Se ejecuta la transferencia y, horas después, el CEO real niega haber realizado esa llamada.

Análisis forense de la grabación

Suponiendo que la empresa conservara la grabación del sistema de telefonía IP, un flujo de trabajo posible sería:

  1. Extracción preservando cadena de custodia: Grabación extraída del servidor VoIP con hash SHA-256 para documentar su integridad
  2. Análisis espectral inicial: Búsqueda en el espectrograma de posibles artefactos de síntesis. Ver espectrograma audio
  3. Segmentación vocálica: Identificación y etiquetado de los segmentos vocálicos de la grabación cuestionada
  4. Extracción de formantes: Medición de F1, F2, F3 en el punto medio de cada vocal con Praat (algoritmo Burg, 5 formantes)
  5. Muestra de referencia: Obtención de grabaciones legítimas del CEO (entrevistas, presentaciones) y extracción de formantes equivalentes
  6. Comparación estadística: Análisis de la distribución formántica entre la muestra cuestionada y la referencia, con un método validado

Qué indicadores se compararían

En un análisis así, los indicadores que orientarían la conclusión —siempre bajo un método validado y con la incertidumbre expresada— podrían ser:

  • Una variabilidad natural de los formantes (jitter) mayor en la voz real que en una síntesis demasiado estable.
  • Transiciones entre vocales más rápidas o regulares en la muestra sintética.
  • Una correlación F0-formante más baja en la muestra manipulada.

Ninguno de estos indicadores es concluyente por sí solo, y su valor probatorio depende del generador, el canal y la validación del método. El informe expresaría el resultado con su grado de incertidumbre, no como una certeza categórica ni con un ratio de verosimilitud que no se haya calibrado para el caso.


Prueba pericial de audio forense

LECrim (Ley de Enjuiciamiento Criminal):

  1. Art. 456 LECrim - Prueba pericial (penal)

    • El juez puede acordar informe pericial cuando sean necesarios o convenientes conocimientos científicos o artísticos para valorar un hecho
    • El art. 299 LECrim no enumera los medios de prueba: define el sumario. En el proceso civil, el art. 299.2 LEC admite los medios de reproducción de la palabra, el sonido y la imagen
  2. Art. 456-485 LECrim - Prueba pericial

    • El art. 478 LECrim exige describir el objeto, las operaciones, los resultados y las conclusiones
    • Las partes pueden nombrar perito de parte para contrainforme
    • El tribunal valora la prueba según su conciencia (art. 741 LECrim); la fórmula de la sana crítica para los dictámenes periciales está en el art. 348 LEC del proceso civil

Buenas prácticas que refuerzan la fiabilidad

Estas prácticas refuerzan la fiabilidad y la trazabilidad del análisis formántico; sus defectos se valoran en el caso concreto y no determinan por sí solos una inadmisión automática:

  • Cadena de custodia: preservar la grabación íntegra con hash criptográfico desde su obtención
  • Metodología validada: usar un método validado; el análisis de formantes con Praat está reconocido en la comunidad científica, sin que exista un método único obligatorio
  • Reproducibilidad: documentar scripts y configuraciones para permitir la replicación por otro perito
  • Expresión de la incertidumbre: expresar los resultados con su grado de certeza; el ratio de verosimilitud es una forma de hacerlo, no un requisito legal universal de admisión

Delitos relacionados con deepfakes de voz

Código Penal español:

  1. Art. 248-250 CP - Estafa / estafa agravada

    • Uso de voz sintética como parte del engaño para obtener una transferencia patrimonial
    • El art. 250.1 agrava por la cuantía (más de 50.000 €) o el número de afectados, con pena de 1 a 6 años; el art. 250.2 eleva la pena a 4 a 8 años cuando la defraudación supera los 250.000 €
    • La calificación depende de todos los hechos, no del mero uso de voz sintética
  2. Arts. 197 y 401 CP - Intimidad y usurpación de estado civil

    • El art. 197 protege secretos e intimidad (apoderamiento o interceptación sin consentimiento; pena de 1 a 4 años); no tipifica en sí una “usurpación de identidad”
    • La usurpación de estado civil se regula en el art. 401 (prisión de 6 meses a 3 años) y no se produce automáticamente por clonar una voz
  3. Arts. 390-396 CP - Falsedad documental

    • La pena de 3 a 6 años del art. 390 corresponde a autoridad o funcionario público. Para un particular, el art. 392 fija 6 meses a 3 años en documento público, oficial o mercantil, y el art. 395, 6 meses a 2 años en documento privado; el uso consciente en juicio recibe la pena inferior en grado (art. 393)
    • Habrá que justificar que el objeto y la conducta encajan en el tipo documental aplicable

RGPD y biometría vocal

La voz o los formantes pasan a ser datos biométricos de categoría especial (art. 9 RGPD) cuando proceden de un tratamiento técnico dirigido a permitir o confirmar la identificación unívoca de una persona; no lo son por su mera existencia. En un encargo forense debe identificarse una base del art. 6 y, cuando aplique el art. 9, una excepción como la necesidad para formular, ejercer o defender reclamaciones (art. 9.2.f), junto con la minimización y las garantías adecuadas.


Aplicaciones forenses del análisis de formantes

1. Identificación de hablantes

Comparación de formantes entre grabación cuestionada y muestra de referencia de un sospechoso. Se miden F1, F2, F3 en vocales específicas y se calcula distancia estadística (Mahalanobis, likelihood ratio).

2. Detección de deepfakes de voz

Análisis de regularidad formántica, coherencia F0-formante, naturalidad de transiciones vocálicas y presencia de artefactos espectrales. Ver detección de deepfakes.

3. Verificación de grabaciones judiciales

Determinación de si una grabación ha sido editada, manipulada o generada artificialmente, analizando continuidad formántica en puntos de corte sospechosos.

4. Análisis dialectal y sociofonético

Los formantes varían según el dialecto regional del hablante. Un perito puede determinar si los patrones formánticos de una grabación son consistentes con el dialecto atribuido al hablante.

5. Efectos del estado emocional en el habla

El estrés, la ansiedad, el esfuerzo vocal y el contexto pueden alterar la producción del habla y degradar una comparación. Sus efectos varían entre emociones y entre hablantes, y clasificarlos es una decisión subjetiva y proclive a sesgo: inferir una emoción concreta no está validado y no permite concluir por sí solo que un hablante estuviera bajo coacción.


Preguntas frecuentes

¿Qué es exactamente un formante y por qué es importante en fonética forense?

Un formante es una concentración de energía acústica en una frecuencia específica, producida por la resonancia del tracto vocal. Los tres primeros formantes (F1, F2, F3) son especialmente relevantes en fonética forense porque dependen de la anatomía individual del hablante (longitud del tracto vocal, forma de la mandíbula, posición de la lengua). Esta dependencia anatómica hace que la combinación de formantes aporte información discriminante entre personas —útil para comparar hablantes y detectar voces sintéticas—, aunque los valores varían dentro de un mismo hablante y se solapan entre hablantes: no constituyen una huella vocal única.

¿Puede el análisis de formantes detectar todos los deepfakes de voz?

El análisis de formantes es actualmente una de las técnicas más prometedoras para detectar voz sintética, pero no es infalible. Los modelos de síntesis de voz más avanzados mejoran continuamente en la replicación de patrones formánticos. La investigación de 2025 (Yang et al.) muestra, en un protocolo speaker-specific, que ciertas características segmentales —entre ellas los formantes vocálicos— rindieron mejor que las globales probadas; aun así, los detectores entrenados en tipos específicos de síntesis pueden generalizar mal ante arquitecturas nuevas. La combinación de análisis formántico con otras técnicas (espectrograma, MFCC, análisis temporal) proporciona los mejores resultados.

¿Es admisible el análisis de formantes como prueba judicial en España?

Sí. El análisis acústico de voz, incluido el análisis formántico, es admisible como prueba pericial: en el proceso penal, el art. 456 LECrim permite acordar el informe pericial (el art. 299 LECrim define el sumario, no los medios de prueba). El perito informático forense debe usar un método validado —Praat es una de las herramientas más utilizadas, sin ser un estándar único obligatorio—, documentar el procedimiento para permitir su replicación y expresar las conclusiones con su grado de incertidumbre. Los tribunales valoran la prueba según su conciencia (art. 741 LECrim); la fórmula de la sana crítica para los dictámenes está en el art. 348 LEC del proceso civil.

¿Qué diferencia hay entre un espectrograma y un análisis de formantes?

El espectrograma es una representación visual completa de todas las frecuencias del audio a lo largo del tiempo, mostrando la distribución general de energía. El análisis de formantes se centra específicamente en las frecuencias de resonancia del tracto vocal (F1, F2, F3), que aparecen como bandas horizontales de mayor energía en el espectrograma. El espectrograma es la herramienta de visualización; el análisis de formantes es la técnica de medición específica que se aplica sobre él para identificar hablantes y detectar síntesis.

¿Cuánto cuesta un peritaje forense de audio con análisis de formantes?

El alcance y el precio dependen de la calidad y la duración de las muestras, el número de audios, la comparación requerida, la validación del método y la ratificación. Puedes consultar las tarifas orientativas vigentes y solicitar un presupuesto cerrado para el caso concreto; la ratificación se presupuesta por separado según la modalidad.


Conceptos relacionados

  • Espectrograma audio: Representación visual donde se observan los formantes como bandas de energía
  • Detección de deepfakes: Disciplina que utiliza el análisis formántico como técnica de detección
  • Clonación de voz: Tecnología de síntesis de voz cuyos artefactos detecta el análisis de formantes
  • Contenido sintético: Categoría general de contenido generado por IA que incluye deepfakes de audio
  • Cadena de custodia: Práctica esencial para documentar la integridad y la trazabilidad del análisis formántico; sus defectos se valoran en el caso concreto

¿Dudas de que ese audio o ese vídeo sean auténticos?

El análisis de autenticidad examina el fichero, sus metadatos y sus huellas de codificación para decir qué se puede afirmar y con qué límites.

Referencias y fuentes

  1. Yang et al. (2025). “Forensic deepfake audio detection using segmental speech features”. Disponible en: sciencedirect.com / arxiv.org (v3)

    • Estudio speaker-specific (seis voces reales, dos generadores, inglés estadounidense): ciertas características segmentales, entre ellas los formantes vocálicos, rindieron mejor que las globales probadas. No establece una tasa de error poblacional ni un sistema LR para uso judicial
  2. Zhang et al. (2025). “Audio Deepfake Detection: What Has Been Achieved and What Lies Ahead”. Sensors 25(7), 1989. DOI 10.3390/s25071989

    • Revisión de técnicas de detección y de sus tasas de error (EER); advierte de que la generalización a nuevos idiomas, dominios o ataques sigue siendo limitada
  3. Deloitte Center for Financial Services (29 de mayo de 2024) — proyección de que las pérdidas por fraude facilitado por IA generativa en Estados Unidos pasen de 12.300 millones de dólares en 2023 a 40.000 millones en 2027 (32 % de crecimiento anual compuesto). Cubre el fraude con IA generativa en su conjunto, no solo las estafas de voz.

  4. CSIC. “La fonética forense: qué es y cuáles son sus principales aplicaciones”. Disponible en: digital.csic.es

    • Referencia académica española sobre fonética forense y análisis de formantes
  5. SciELO. “Comparación forense de voces mediante el análisis multidimensional de las pausas llenas”. Disponible en: scielo.conicyt.cl

    • Estudio sobre pausas llenas: en ese corpus, las variables de calidad de voz discriminaron más que la estructura de formantes, y la combinación de variables rindió mejor
  6. ResearchGate. “A case for formant analysis in forensic speaker identification”. Disponible en: researchgate.net

    • Argumentación científica del uso de formantes en identificación forense de locutores
  7. Oxford Wave Research. “VOCALISE - Automatic Speaker Recognition Software”. Disponible en: oxfordwaveresearch.com

    • Software comercial de comparación automática de hablantes
  8. Praat. Boersma, P. y Weenink, D. (2025). “Praat: doing Phonetics by Computer”. Universidad de Amsterdam. Disponible en: fon.hum.uva.nl

    • Software open-source estándar para análisis acústico del habla
  9. Resemble AI. (2025). “Top 10 Deepfake Audio Detection Tools”. Disponible en: resemble.ai

    • Herramientas de detección de deepfakes de audio disponibles en 2025
  10. Springer. (2025). “The Future of Audio Forensics: Exploring the Effect of Generative AI”. Disponible en: link.springer.com

    • Impacto de la IA generativa en la fonética forense
  11. Código Penal español (BOE): arts. 197 (secretos e intimidad), 248-250 (estafa), 401 (usurpación de estado civil), 390-396 (falsedad documental)

  12. LECrim (BOE): art. 299 (define el sumario), arts. 456-485 (prueba pericial), art. 741 (valoración «según su conciencia»); la sana crítica de los dictámenes está en el art. 348 LEC del proceso civil


Última actualización: 6 de septiembre de 2026 Categoría: Análisis Forense (FOR-009) Nivel técnico: Avanzado Relevancia: Muy Alta (deepfake audio en auge 2025-2026)

¿Necesitas un peritaje forense?

Si necesitas ayuda profesional con análisis forense digital, estoy aquí para ayudarte.

Solicitar Consulta Gratuita
Jonathan Izquierdo

Jonathan Izquierdo · Perito Forense

+15 años experiencia · AWS Certified

WhatsApp