Técnico

Detección de Texto IA

Conjunto de técnicas, herramientas y metodologías diseñadas para identificar si un texto fue generado total o parcialmente por un modelo de inteligencia artificial, distinguiendo la marca de agua —SynthID— de las credenciales de procedencia —C2PA—, que no son lo mismo. Incluye métodos estadísticos (perplejidad, burstiness, entropía), clasificadores de aprendizaje automático, marcas de agua digitales (C2PA, SynthID), análisis estilométrico y análisis de metadatos de documentos.

19 min de lectura

¿Qué es la detección de texto IA?

La detección de texto IA es el campo técnico dedicado a determinar si un fragmento de texto fue producido total o parcialmente por un modelo de inteligencia artificial generativa (como GPT-4, Claude, Gemini, Llama o Mistral). Este campo combina técnicas estadísticas, aprendizaje automático, lingüística computacional y análisis de metadatos para identificar las huellas que los modelos de lenguaje dejan en el texto que generan.

La necesidad de detectar texto generado por IA ha crecido exponencialmente desde la popularización de ChatGPT en noviembre de 2022. En solo tres años, la detección de texto IA ha pasado de ser un problema académico a una necesidad práctica en educación, justicia, periodismo, empresa y administración pública.

Campo en constante evolución

La detección de texto IA es una carrera armamentística: a medida que los modelos de lenguaje mejoran y producen texto más “humano”, las herramientas de detección deben evolucionar. Las técnicas y precisiones descritas en este artículo reflejan el estado del arte en marzo de 2026 y pueden cambiar significativamente en meses.

Categorías de métodos de detección

Los métodos de detección se clasifican en tres grandes familias:

CategoríaEnfoqueVentajasLimitaciones
EstadísticosAnalizar propiedades matemáticas del textoInterpretables, no requieren entrenamientoPrecisión limitada en textos cortos
Basados en MLClasificadores entrenados con textos humanos/IAAlta precisión en condiciones óptimasCaja negra, necesitan datos de entrenamiento
WatermarkingMarcas invisibles insertadas durante la generaciónMuy alta precisión si están presentesRequieren cooperación del proveedor
HíbridosCombinación de las anterioresRobustez por triangulaciónMayor complejidad y coste

Métodos estadísticos

Perplejidad

La perplejidad es la métrica más fundamental para la detección de texto IA. Mide cuán “sorprendente” resulta un texto para un modelo de lenguaje de referencia:

Definición matemática:

PPL(X) = exp(-1/N × Σ log P(x_i | x_1, ..., x_{i-1}))

donde:
- X = secuencia de tokens del texto
- N = número total de tokens
- P(x_i | ...) = probabilidad del token i dado el contexto

¿Por qué funciona?

Los LLM generan texto seleccionando tokens de alta probabilidad según su distribución aprendida. Por tanto, el texto generado por IA tiende a tener perplejidad baja cuando se evalúa con un modelo similar, porque sigue el camino de máxima probabilidad. Los humanos, en cambio, hacen elecciones menos predecibles: usan palabras inesperadas, construcciones idiomáticas personales y expresiones coloquiales que un modelo no priorizaría.

Perplejidad por tipo de texto — con una advertencia sin la cual la tabla engaña: la perplejidad no es una propiedad del texto, sino del texto medido con un modelo evaluador concreto. Cambiar de modelo, de tokenizador o de idioma mueve todos los números. Los rangos siguientes son órdenes de magnitud ilustrativos, no umbrales de decisión: un dictamen que clasifique por ellos sin declarar con qué modelo los obtuvo no es reproducible.

Tipo de textoPerplejidad típicaInterpretación
Texto ChatGPT (temperature 0.3)5-12Muy baja: fuerte indicador de IA
Texto ChatGPT (temperature 0.7)12-25Baja: indicador moderado de IA
Texto ChatGPT (temperature 1.0)20-40Zona ambigua
Texto legal/normativo humano15-30Baja por formalidad (falso positivo)
Escritura periodística humana30-60Media: zona normal humana
Escritura creativa/literaria50-120Alta: fuerte indicador humano
Conversación informal humana60-150Muy alta: indicador claro de humano
Poesía/escritura experimental100-300+Extrema: patrón humano
Perplejidad no es prueba absoluta

Un texto legal muy formal escrito por un abogado puede tener perplejidad tan baja como texto generado por IA, porque los textos legales siguen fórmulas y estructuras predecibles. La perplejidad siempre debe combinarse con otras métricas para evitar falsos positivos.

Burstiness (Explosividad)

La burstiness mide la variabilidad en la complejidad y longitud de las oraciones a lo largo del texto:

Cálculo de burstiness:

Burstiness = σ(S) / μ(S)

donde:
- S = {s_1, s_2, ..., s_n} (longitudes de oraciones)
- σ(S) = desviación estándar
- μ(S) = media

Variantes más sofisticadas incluyen:
- Burstiness de complejidad sintáctica (profundidad de árbol)
- Burstiness de riqueza léxica por ventana
- Burstiness multi-escala (oración, párrafo, sección)

Visualización comparativa:

LONGITUD DE ORACIONES — TEXTO HUMANO

│    ██
│    ██                          ████
│    ██  ██              ██      ████
│    ██  ██  ██      ██  ██  ██  ████  ██
│ ██ ██  ██  ██  ██  ██  ██  ██  ████  ██  ██
│ ██ ██  ██  ██  ██  ██  ██  ██  ████  ██  ██
└──────────────────────────────────────────────→
  1  2   3   4   5   6   7   8   9    10  11
  (Número de oración → altura = longitud)

Burstiness = 0.82 (alta variabilidad)

LONGITUD DE ORACIONES — TEXTO LLM


│    ██  ██  ██  ██  ██  ██  ██  ██  ██  ██
│    ██  ██  ██  ██  ██  ██  ██  ██  ██  ██
│ ██ ██  ██  ██  ██  ██  ██  ██  ██  ██  ██
│ ██ ██  ██  ██  ██  ██  ██  ██  ██  ██  ██
└──────────────────────────────────────────────→
  1  2   3   4   5   6   7   8   9    10  11

Burstiness = 0.21 (baja variabilidad)

Interpretación forense:

BurstinessHacia dónde apuntaQué lo confunde
Muy bajaUniformidad compatible con generación automáticaTexto legal, normativo o administrativo humano, que también es muy uniforme
IntermediaNo discriminaCasi cualquier cosa
AltaVariación compatible con escritura humanaUn texto de IA con temperatura alta o reescrito a mano

Los umbrales numéricos concretos que suelen acompañar a esta métrica dependen del corpus y del preprocesado, y no se reproducen aquí como puntos de corte: sin declarar tokenizador, longitud de ventana y corpus de referencia, un umbral no es verificable.

Entropía

La entropía mide la cantidad de información y la imprevisibilidad del texto a nivel de token:

Entropía de Shannon:

H(X) = -Σ P(x_i) × log₂ P(x_i)

Entropía por posición (análisis secuencial):
H_j = -Σ P(x_j | contexto) × log₂ P(x_j | contexto)

La entropía se analiza:
- Globalmente (media del texto completo)
- Por ventanas deslizantes (variación local)
- En puntos de transición (inicio de párrafos/secciones)

Patrones de entropía característicos:

ENTROPÍA POR POSICIÓN — TEXTO HUMANO

H │
  │ ╱╲    ╱╲         ╱╲╱╲
  │╱  ╲  ╱  ╲╱╲     ╱    ╲      ╱╲
  │    ╲╱    ╲  ╲   ╱      ╲    ╱  ╲
  │              ╲╱╲        ╲╱╲╱    ╲╱╲
  └──────────────────────────────────────→
  (Alta variabilidad, picos en transiciones)

ENTROPÍA POR POSICIÓN — TEXTO LLM

H │

  │ ──────────────────────────────────


  └──────────────────────────────────────→
  (Baja variabilidad, entropía casi constante)

Análisis combinado de las tres métricas:

PerplejidadBurstinessEntropíaDiagnóstico
BajaBajaConstanteIA con alta probabilidad
BajaAltaVariableTexto humano formal (legal, técnico)
AltaBajaConstanteIA con temperature alta + edición
AltaAltaVariableHumano con alta probabilidad
MediaMediaMixtaZona ambigua — requiere análisis adicional

Análisis de distribución de vocabulario

Ley de Zipf:

La Ley de Zipf establece que en textos naturales, la frecuencia de una palabra es inversamente proporcional a su rango:

f(r) ≈ C / r^α

donde:
- f(r) = frecuencia de la palabra de rango r
- C = constante
- α ≈ 1 para textos humanos naturales

Los textos generados por IA tienden a desviarse sutilmente de esta ley:

CaracterísticaTexto humanoTexto IA
Exponente αPróximo al Zipf puroSuele desviarse a la baja
Cola de distribuciónMás palabras rarasMenos palabras raras
Hapax legomenaProporción mayorProporción menor
Type-Token RatioVariable por autorMás consistente

Riqueza léxica (Type-Token Ratio):

TTR = Tipos únicos / Total de tokens

TTR por ventanas (más robusto):
MATTR = Media de TTR en ventanas de N palabras

El MATTR es útil porque **es comparable entre textos de distinta longitud**, que es lo que rompe al TTR simple. Lo que no existe es una tabla de valores «típicos» de IA frente a humano: la riqueza léxica depende del **género, del dominio, del idioma y del preprocesado** mucho más que de quién escribió. Se usa comparando el texto dudoso **contra un corpus del propio autor**, no contra un umbral universal.

Análisis de n-gramas

El estudio de secuencias de n palabras consecutivas revela patrones diferenciadores:

MétricaQué mideIndicador IA
Repetición de bigramasPares de palabras que se repitenMayor repetición en IA
Originalidad de trigramasSecuencias de 3 palabras únicasMenor originalidad en IA
Cobertura de 4-gramas% de 4-gramas encontrados en corpus de IAAlta cobertura = indicador IA
Diversidad de inicios de oraciónVariedad en las primeras palabrasMenor diversidad en IA

Frases formulaicas típicas de LLM en español:

CONECTORES SOBREUTILIZADOS POR LLM:
- "Es importante señalar que..."
- "Cabe destacar que..."
- "En este sentido..."
- "A modo de conclusión..."
- "Resulta fundamental..."
- "No obstante lo anterior..."
- "Dicho esto..."
- "En definitiva..."
- "Desde esta perspectiva..."
- "Es preciso mencionar..."
- "Conviene recordar que..."
- "En el marco de..."
- "Por consiguiente..."
- "En primer lugar... en segundo lugar..."

ESTRUCTURAS TÍPICAS:
- Párrafos de longitud similar (~100-150 palabras)
- Listas con "En primer lugar / En segundo lugar / Finalmente"
- Transiciones equilibradas entre párrafos
- Conclusiones que resumen los puntos anteriores
- Uso frecuente de voz pasiva impersonal
Los conectores por sí solos no prueban nada

Muchos escritores humanos también usan conectores formulaicos, especialmente en textos académicos y legales. La presencia de estas frases es un indicador complementario, nunca una prueba aislada. Lo relevante es la acumulación de múltiples indicadores.

Métodos basados en aprendizaje automático

Clasificadores supervisados

Los clasificadores ML se entrenan con grandes conjuntos de textos etiquetados como “humano” o “IA”:

ARQUITECTURA TÍPICA DE CLASIFICADOR

ENTRADA: Texto a analizar


┌──────────────────────┐
│  TOKENIZACIÓN        │ → Tokens, subpalabras
└──────────────────────┘


┌──────────────────────┐
│  EXTRACCIÓN DE       │ → Perplejidad, burstiness,
│  CARACTERÍSTICAS     │   entropía, n-gramas, TTR,
│                      │   longitud oraciones, etc.
└──────────────────────┘


┌──────────────────────┐
│  MODELO              │ → Transformer fine-tuned,
│  CLASIFICADOR        │   Random Forest, o ensemble
└──────────────────────┘


┌──────────────────────┐
│  SALIDA              │ → Probabilidad IA: 0.0 - 1.0
│                      │   + Desglose por sección
└──────────────────────┘

Tipos de clasificadores:

TipoEjemploVentajaLimitación
Transformer fine-tunedRoBERTa, DeBERTaMuy alta precisiónRequiere GPU, opaco
Ensemble de featuresRandom Forest + estadísticasInterpretableMenor precisión
Zero-shotDetectGPT, BinocularsNo requiere entrenamientoMenor precisión general
Few-shotClasificador con pocos ejemplosAdaptable a nuevos modelosNecesita ejemplos del modelo

DetectGPT (método de perturbaciónes)

DetectGPT es un método zero-shot que no necesita un clasificador entrenado:

ALGORITMO DETECTGPT

1. Dado un texto T, calcular log-probabilidad: logP(T)
2. Generar N perturbaciónes de T usando un modelo auxiliar:
   T'_1, T'_2, ..., T'_N
   (Cada T'_i es T con algunas palabras reemplazadas
   por sinónimos/paráfrasis)
3. Calcular log-probabilidad de cada perturbación:
   logP(T'_1), logP(T'_2), ..., logP(T'_N)
4. Calcular puntuacion:
   d = (logP(T) - mu(logP(T'_i))) / sigma(logP(T'_i))

NOTA SOBRE LAS PERTURBACIONES: el metodo original no sustituye
palabras a mano por sinonimos. Genera las variantes con OTRO
modelo preentrenado de enmascarado, que reescribe fragmentos del
texto. La diferencia importa: una sustitución manual introduce
criterio del perito donde el metodo pide una perturbación
automática y reproducible.

INTERPRETACIÓN:
- d > umbral → Texto probablemente generado por máquina
  (el texto original tiene probabilidad más alta que
  sus perturbaciónes, indicando que está en un "pico"
  de la distribución del modelo)
- d < umbral → Texto probablemente humano
  (las perturbaciónes tienen probabilidad similar,
  indicando una región "plana" de la distribución)

Ventajas de DetectGPT:

  • No requiere datos de entrenamiento etiquetados
  • Basado en principio estadístico fundamentado
  • Adaptable a nuevos modelos sin reentrenamiento

Limitaciones:

  • Computacionalmente costoso (N perturbaciónes por texto)
  • Menor precisión que clasificadores supervisados
  • Sensible al modelo auxiliar elegido para perturbaciónes

Binoculars

Binoculars es un método open source reciente que compara dos modelos de referencia:

ALGORITMO BINOCULARS

1. Usar DOS MODELOS CERCANOS entre sí (p. ej. la variante base y la
   variante instruida de la misma familia), no uno grande y uno pequeño.

2. Calcular dos magnitudes sobre el mismo texto:
   - PERPLEJIDAD: cuánto sorprende el texto al primer modelo.
   - PERPLEJIDAD CRUZADA: cuánto sorprenden al primer modelo las
     predicciones del segundo. Es el término que normaliza, y es lo
     que da nombre a la técnica: mira el texto "con los dos ojos".

3. La puntuación es el COCIENTE de ambas:
   B = perplejidad / perplejidad_cruzada

INTERPRETACIÓN — y este es el sentido que suele contarse al revés:
- B BAJO  → indicio de texto generado por máquina.
- B ALTO  → indicio de texto humano.

La intuición: un texto de máquina sorprende poco al modelo (perplejidad
baja) EN RELACIÓN con lo poco que los dos modelos se sorprenden entre sí.
Es la relación, no la perplejidad suelta, lo que discrimina.

Sobre los resultados publicados: circula una tabla con precisiones por modelo fuente —93,7 % para GPT-4, 91,2 % para Claude 3, y así con cinco filas—. No está en el trabajo original, cuyas evaluaciones usan otros conjuntos, otro número de muestras y otras cifras. No se reproduce aquí: una tabla de precisión sin corpus, sin versión de modelo y sin umbral no significa nada en un dictamen, y es lo primero que desmonta un contraperito.

Lo que sí puede sostenerse: la técnica se propone como detector zero-shot que no requiere entrenar sobre el generador concreto, y su rendimiento depende del dominio y de la longitud del texto.

GLTR (Giant Language model Test Room)

GLTR no es un clasificador sino una herramienta de visualización:

FUNCIONAMIENTO DE GLTR

Para cada palabra del texto, GLTR calcula su ranking
en la distribución de probabilidad del modelo:

Colores:
🟢 Verde  → Top 10 palabras más probables
🟡 Amarillo → Top 100
🔴 Rojo   → Top 1000
🟣 Púrpura → Fuera del top 1000

TEXTO HUMANO típico:
"El 🟢gato🟢 🟣saltó🟣 por 🟢la🟢 🔴ventana🟡 hacia 🟡el🟢 🟣enmarañado🟣 jardín"
→ Mezcla de colores: muchas elecciones inesperadas

TEXTO IA típico:
"El 🟢gato🟢 🟢saltó🟢 por 🟢la🟢 🟢ventana🟢 hacia 🟢el🟢 🟢bonito🟢 🟢jardín🟢"
→ Predominio de verde: palabras de alta probabilidad

Uso forense de GLTR:

  • Visualizar secciones sospechosas de un documento
  • Identificar transiciones entre texto humano y texto IA
  • Herramienta pedagógica para explicar al tribunal cómo funciona la detección
  • Complementar resultados de herramientas automatizadas

Métodos de watermarking (marcas de agua)

C2PA (Coalition for Content Provenance and Authenticity)

C2PA es un estándar abierto para la procedencia de contenido digital:

ESTÁNDAR C2PA

Objetivo:
Proporcionar una cadena de procedencia verificable
para contenido digital, incluyendo texto generado por IA.

Funcionamiento:
1. El sistema que genera el contenido firma digitalmente
   los metadatos de procedencia
2. Los metadatos incluyen:
   - Quién creó el contenido
   - Con qué herramienta
   - Cuándo se creó
   - Si intervino IA en su generación
   - Cadena de modificaciones posteriores
3. Los metadatos están criptográficamente vinculados
   al contenido (no se pueden alterar sin invalidarlos)

Adopción (marzo 2026):
- Adobe: Photoshop, Premiere, Firefly
- Microsoft: Bing Image Creator, Copilot
- Google: Gemini (parcial)
- OpenAI: DALL-E, GPT (parcial)
- Sony, Nikon, Canon (en cámaras)
- BBC, New York Times (en publicaciones)

Aplicación a documentos de texto:

FormatoSoporte C2PAEstado
PDFSí (Adobe Acrobat)Implementado
DOCXParcial (Microsoft 365)En desarrollo
Imágenes con textoSí (PNG, JPEG, AVIF)Implementado
HTMLEn desarrolloPropuesta de estándar
Texto planoNoNo aplicable directamente
EmailEn desarrolloPropuesta

Limitaciones de C2PA para texto:

  • Solo funciona si el proveedor implementa el estándar
  • Copiar-pegar texto elimina los metadatos C2PA
  • No protege contra captura de pantalla y retranscripción
  • Adopción aún parcial en generadores de texto

SynthID (Google DeepMind)

SynthID es el sistema de marca de agua de Google DeepMind. Conviene matizar lo de «propietario»: la integración en sus productos incluye componentes no públicos, pero existe implementación de referencia con licencia Apache-2.0 de la técnica de marcado y detección, demostrada sobre modelos abiertos. No es un secreto cerrado.

SYNTHID PARA TEXTO

Funcionamiento:
1. Durante la generación de texto, SynthID modifica
   sutilmente la distribución de probabilidad de
   los tokens seleccionados
2. La modificación sigue un patrón pseudoaleatorio
   determinado por una clave secreta
3. Un detector con la clave puede identificar
   el patrón estadístico
4. Sin la clave, el patrón es invisible

Propiedades:
- Imperceptible: no afecta la calidad del texto
- Robusto: resiste edición menor y parafraseo parcial
- Estadístico: detección probabilística, no binaria
- Escalable: aplicable en tiempo de generación sin coste

Limitaciones:
- En producción, aplicado a los modelos de Google; la técnica en sí no está atada a ellos
- La detección requiere la clave de marcado, que Google no publica para sus modelos productivos
- Vulnerable a parafraseo extensivo
- No es estándar abierto

Comparativa de sistemas de watermarking:

SistemaProveedorEstándarDetecciónRobustez
C2PACoalición abiertaAbiertoVerificación de metadatosMedia (copy-paste elimina)
SynthIDGooglePropietarioAnálisis estadísticoAlta (resiste edición menor)
KirchenbauerAcadémicoAbiertoTest estadísticoMedia-alta
Distillation-basedVariosVaríaClasificadorVariable
Marcado de OpenAI para textoOpenAINo publicado⚠️ No consta desplegado ni documentado públicamente para texto; se ha descrito trabajo interno, no un producto verificable
El watermarking es complementario, no sustitutivo

El watermarking solo funciona si el generador del texto implementa la marca de agua. Para texto generado por modelos sin watermarking, modelos locales (Llama, Mistral) o texto generado antes de la implementación, se necesitan métodos estadísticos y basados en ML.

Precisión por herramienta e idioma

Qué se sabe realmente sobre la precisión de estas herramientas

Circulan tablas comparativas que asignan a cada detector una precisión con un decimal frente a cada familia de modelos —GPTZero un 97,2 % contra GPT-4, un 94,8 % contra Claude—, y suelen venir por duplicado, en inglés y en español. No existe ese benchmark. Ningún evaluador independiente publica esa matriz, y menos aún para español.

Lo que sí hay, y conviene distinguir:

Qué esQuién lo publicaCómo leerlo
Cifras de fabricanteCada herramienta, sobre su propio corpusNo son comparables entre sí: cada una elige qué textos mide y qué llama acierto
Trabajo académicoMétodos como Binoculars publican su AUROC sobre conjuntos de datos identificadosEs reproducible, pero mide sobre ese conjunto, no sobre un escrito judicial en español
Evaluación sobre texto jurídico en españolNadieEs justo el caso de uso que interesaría a un perito, y está sin medir

Y hay un dato que vale más que cualquier porcentaje: OpenAI retiró en 2023 su propio clasificador de texto generado por IA por tasa de acierto insuficiente. Quien fábrica los modelos no consiguió construir el detector.

Por qué esto importa en un peritaje

Un perito no puede sostener la autoría de un texto sobre la salida de un detector, y menos citando una precisión que nadie ha medido. Lo que sí se acredita es distinto y mucho más sólido: que las fuentes citadas en el escrito no existen. Comprobar una sentencia en el CENDOJ es binario, reproducible y gratuito; estimar si un párrafo «parece» generado no es ninguna de las tres cosas.

Factores que afectan la precisión

FactorImpacto en precisiónDirección
Longitud del textoMuy altoMás largo = más preciso
IdiomaAltoInglés > español > otros
Modelo generadorAltoModelos grandes más detectables
TemperatureMedio-altoTemperature baja más detectable
Edición humana posteriorAltoReduce detección significativamente
Dominio temáticoMedioTexto técnico/legal más difícil
Mezcla humano/IAMuy altoReduce drásticamente la detección
Herramientas de parafraseoAltoReduce detección
TraducciónMedioIntroduce artefactos pero reduce patrones IA
Fecha del modeloMedioModelos más nuevos más difíciles

Sobre las tablas de precisión por longitud y las de tasas de error

Circulan tres tablas con decimales: precisión de GPTZero en español por tramos de longitud, tasas de falso positivo por tipo de texto humano y tasas de falso negativo por técnica de evasión. Aquí no se reproducen, y conviene explicar por qué, porque el motivo es el mismo que hace inservible casi toda cifra de este campo.

Ninguna identifica qué versión del detector se midió, sobre qué corpus, con qué umbral ni quién hizo la medición. La referencia que las sostenía —«Tian, 2023-2026»— no es una publicación identificable. Y los detectores se reentrenan cada pocos meses: una precisión medida hace un año no describe al producto de hoy.

Lo que sí se sostiene, y es lo que un dictamen puede afirmar sin quedar en evidencia:

HechoPor qué importa en un peritaje
La longitud del texto condiciona el resultadoPor debajo de un par de párrafos, cualquier detector es poco fiable. No hace falta un porcentaje para saber que un texto corto no sostiene una conclusión
El texto formal y formulaico dispara falsos positivosLo académico, lo legal y lo administrativo son uniformes por naturaleza, que es justo el rasgo que estos detectores leen como artificial
El texto de hablantes no nativos tambiénEstá documentado como sesgo del método, no como anécdota: vocabulario más acotado y estructuras más simples se parecen a lo que el detector busca
Editar el texto degrada la detecciónReescritura, traducción de ida y vuelta o ajuste fino del modelo reducen la señal, y no hay contramedida que lo resuelva

La conclusión operativa no cambia por retirar los números: ningún detector automático sostiene por sí solo una conclusión pericial, y menos sobre texto corto, formal o traducido. Por eso el peso recae en el resto del cuadro —metadatos del documento, historial de edición y contraste estilométrico contra escritos previos del autor—, que es lo que un informe pericial puede documentar y ratificar.

Este análisis lo firma Jonathan Izquierdo, perito informático forense.

Análisis de metadatos de documentos

Microsoft Word (.docx)

Los documentos Word contienen metadatos ricos que pueden revelar el uso de IA:

<!-- core.xml — Metadatos básicos -->
<cp:coreProperties>
  <dc:creator>Juan García</dc:creator>
  <cp:lastModifiedBy>Juan García</cp:lastModifiedBy>
  <dcterms:created>2026-03-15T10:22:00Z</dcterms:created>
  <dcterms:modified>2026-03-15T10:47:00Z</dcterms:modified>
  <cp:revision>3</cp:revision>
</cp:coreProperties>

<!-- app.xml — Metadatos de aplicación -->
<Properties>
  <Application>Microsoft Word 365</Application>
  <TotalTime>25</TotalTime>  <!-- 25 minutos de edición -->
  <Pages>15</Pages>
  <Words>5247</Words>
  <Characters>29912</Characters>
  <Paragraphs>73</Paragraphs>
</Properties>

<!-- ANÁLISIS FORENSE -->
<!-- 5247 palabras en 25 minutos = 210 palabras/minuto -->
<!-- Velocidad promedio de escritura humana: 30-40 pal/min -->
<!-- Velocidad promedio de copy-paste: 200+ pal/min -->
<!-- → INDICADOR DE COPY-PASTE (probable IA) -->

Indicadores clave en Word:

IndicadorValor normal (humano)Sospechoso (IA)
Tiempo de edición1-2 min/100 palabras< 0.3 min/100 palabras
Número de revisiones20-100+ por documento< 10
Bloques rsidMuchos, variadosPocos, grandes
Número de guardadosMúltiples (autoguardado)1-3
Track changesPresentes si hay revisiónAusentes
ComentariosPosiblesGeneralmente ausentes

PDF

ANÁLISIS FORENSE DE PDF

1. METADATOS ESTÁNDAR
   /Title: (título del documento)
   /Author: (autor)
   /Creator: (aplicación que creó el PDF)
   /Producer: (software que generó el PDF)
   /CreationDate: (fecha de creación)
   /ModDate: (fecha de modificación)

2. ANÁLISIS DE FUENTES
   - Fuentes embebidas vs. referenciadas
   - Tipo de fuente (indica origen):
     · Calibri, Aptos → Microsoft Word
     · Liberation Sans → LibreOffice
     · Roboto, Open Sans → Google Docs/web
     · Times New Roman → Múltiples orígenes

3. ESTRUCTURA DE CONTENIDO
   - Texto como stream vs. texto como imagen
   - Capas de contenido (originales vs. añadidas)
   - Marcadores y estructura de navegación
   - Formularios y campos editables

4. INDICADORES DE COPY-PASTE EN PDF
   - Texto sin estructura de párrafos nativa
   - Inconsistencias en el interlineado
   - Mezcla de fuentes o tamaños sin justificación
   - Ausencia de estilos de documento

Google Docs

Google Docs mantiene un historial de revisiones más granular que un procesador de escritorio, pero conviene acotar qué contiene realmente:

HISTORIAL DE REVISIONES — GOOGLE DOCS

El historial NO registra pulsacion a pulsacion. Agrupa cambios
en versiónes y puede FUSIONAR ediciones próximas en el tiempo,
de modo que lo que se ve es una reconstrucción aproximada. Con
todo, la granularidad basta para distinguir escritura de pegado:


ESCRITURA HUMANA TÍPICA:
14:22:01 - "E" (1 carácter)
14:22:01 - "l" (1 carácter)
14:22:01 - " " (1 carácter)
14:22:02 - "a" (1 carácter)
14:22:02 - "n" (1 carácter)
14:22:02 - "á" (1 carácter)  ← pausa para tilde
14:22:03 - "l" (1 carácter)
... (continúa carácter a carácter con pausas naturales)
14:22:15 - Backspace x3     ← corrección humana típica
14:22:17 - "isi" (3 caracteres, corrección)
→ Patrón: 2-5 caracteres/segundo, con pausas y correcciones

PEGADO DE TEXTO IA:
14:22:01 - Pegado: "El análisis forense digital es una
  disciplina que se encarga de la identificación,
  preservación, análisis y presentación de evidencia
  digital en procedimientos judiciales. Esta disciplina
  ha cobrado una importancia creciente en el contexto
  actual de digitalización..." (847 caracteres de una vez)
14:22:30 - Sin actividad (29 segundos, leyendo lo pegado)
14:23:05 - Pegado: "Los principales métodos de análisis
  incluyen..." (623 caracteres de una vez)
→ Patrón: Bloques grandes pegados con pausas entre ellos

ANALISIS FORENSE — y una limitación que hay que declarar:
la API de Google Docs devuelve la VERSIÓN ACTUAL del documento,
no el flujo de ediciones. La lista de revisiones de Drive puede
ser incompleta y no expone un registro de teclas ni de pegados.
Lo utilizable es la exportacion del historial que ofrece la
interfaz, solicitada al titular de la cuenta.
- Detectar bloques de pegado (>50 caracteres de una vez)
- Medir velocidad de "escritura" por sección
- Identificar patrones de corrección (humanos corrigen más)
- Mapear timeline: pegado → lectura → pequeña edición → pegado
Google Docs: la mejor evidencia de metadatos

El historial de revisiones de Google Docs suele ser la evidencia de metadatos más útil para esta cuestión, porque conserva una secuencia temporal que un documento de escritorio no guarda. Pero no registra «cada acción individual»: agrupa y fusiona versiónes, de modo que permite reconstruir aproximadamente cómo se escribió el documento.

Estilometría computacional

Fundamentos

La estilometría es la ciencia de analizar el estilo de escritura para atribuir autoría. Aplicada a la detección de texto IA, permite comparar el estilo de un texto sospechoso con el estilo conocido de un autor humano:

PROCESO ESTILOMÉTRICO

1. CORPUS DE REFERENCIA
   Recopilar textos verificados del supuesto autor:
   - Emails anteriores
   - Documentos de trabajo previos
   - Escritos académicos
   - Mensajes de chat
   Mínimo: 5.000-10.000 palabras de referencia

2. EXTRACCIÓN DE CARACTERÍSTICAS
   Para cada texto (referencia y sospechoso):
   a) Léxicas: vocabulario, riqueza, frecuencias
   b) Sintácticas: longitud oraciones, complejidad
   c) Caracteres: uso puntuación, mayúsculas, espacios
   d) Funcionales: preposiciones, artículos, conjunciones
   e) Estructurales: párrafos, listas, organización

3. COMPARACIÓN
   Medir distancia entre perfiles estilísticos:
   - Delta de Burrows (la más usada)
   - Distancia coseno
   - Divergencia de Kullback-Leibler
   - Distancia euclidiana normalizada

4. CONCLUSIÓN
   ¿El texto sospechoso está más cerca del perfil
   del autor humano o de un perfil típico de LLM?

Delta de Burrows

El Delta de Burrows es la métrica estilométrica más utilizada y validada:

Delta de Burrows:

Δ(A, B) = (1/n) × Σ |z_A(f_i) - z_B(f_i)|

donde:
- f_i = frecuencia de la palabra funcional i
- z_A(f_i) = z-score de f_i en el texto A
- z_B(f_i) = z-score de f_i en el texto B
- n = número de palabras funcionales analizadas

Interpretación:
- Δ bajo = estilos similares (mismo autor probable)
- Δ alto = estilos diferentes (autores diferentes)

En detección IA:
- Calcular Δ(texto_sospechoso, corpus_autor)
- Calcular Δ(texto_sospechoso, corpus_LLM)
- Si Δ_autor >> Δ_LLM → probable IA
- Si Δ_autor << Δ_LLM → probable humano

Herramientas de estilometría

HerramientaLenguajeCaracterísticasUso forense
StyloRDelta de Burrows, PCA, clusteringInvestigación académica
JGAAPJavaMúltiples métricas y clasificadoresAnálisis forense
pyStylometryPythonFlexible, scriptableAutomatización
Stylometry.orgWebAccesible, sin instalaciónAnálisis rápido
LIWCMultiplataformaAnálisis psicológico del lenguajePerfil de autor
SignaturePythonEspecializado en atribuciónAtribución de autoría

Cómo se estructura un análisis estilométrico

Ejemplo metodológico

Lo que sigue no es un caso real ni un expediente: es la forma que tiene un análisis estilométrico y qué magnitudes se comparan. Las cifras son de ejemplo. Un análisis real exige declarar corpus, tokenizador, versiónes y el procedimiento completo para que otro perito pueda reproducirlo.

ANÁLISIS ESTILOMÉTRICO — ESQUEMA DE TRABAJO

Texto sospechoso: Artículo de opinión (2.100 palabras)
Corpus de referencia del autor: 15 artículos previos (31.000 palabras)
Corpus LLM de referencia: 50 textos GPT-4 (50.000 palabras)

RESULTADOS:

1. DELTA DE BURROWS
   Δ(sospechoso, autor_humano) = 1.42
   Δ(sospechoso, corpus_GPT4)  = 0.38
   → El texto está MUCHO más cerca del estilo GPT-4

2. LONGITUD DE ORACIONES
   Autor humano: μ=18.3, σ=12.7 (burstiness=0.69)
   Texto sospechoso: μ=21.1, σ=5.4 (burstiness=0.26)
   GPT-4 típico: μ=20.8, σ=5.1 (burstiness=0.25)
   → Burstiness del sospechoso coincide con GPT-4

3. PALABRAS FUNCIONALES (top 5 diferencias)
   Palabra  | Autor | Sospechoso | GPT-4
   "pero"   | 1.8%  | 0.4%       | 0.5%
   "además" | 0.2%  | 1.1%       | 1.3%
   "sin     | 0.9%  | 0.3%       | 0.4%
   embargo"
   "es      | 0.1%  | 0.8%       | 0.9%
   importante"
   "cabe"   | 0.0%  | 0.6%       | 0.7%
   → Perfil funcional coincide con GPT-4

4. VOCABULARIO ÚNICO
   Autor humano: 347 hapax (42% del vocabulario)
   Texto sospechoso: 189 hapax (29% del vocabulario)
   GPT-4 típico: 195 hapax (31% del vocabulario)
   → Riqueza léxica del sospechoso es típica de GPT-4

CONCLUSIÓN ESTILOMÉTRICA:
El perfil estilístico del texto sospechoso presenta
una distancia estadísticamente significativa respecto
al estilo habitual del autor, y coincide con los
patrones típicos de GPT-4 en todas las métricas
analizadas. Nivel de confianza: alto (>90%).

Metodología forense para detección de texto IA

Protocolo completo

  1. Recepción del encargo: Documentar por escrito qué se pide analizar, quién lo solicita (orden judicial, parte procesal, institución educativa), y cuáles son las preguntas concretas a responder.

  2. Preservación de evidencia: Obtener el documento original en su formato nativo. Calcular hash SHA-256. Crear copia de trabajo. Si es Google Docs, solicitar exportación del historial de revisiones vía API. Documentar toda la cadena de custodia.

  3. Análisis automatizado con varias herramientas: contrastar más de un detector ayuda, pero conviene saber por qué: no crea independencia estadística. Los detectores comparten arquitectura y datos de entrenamiento, y se equivocan de forma correlacionada —especialmente con texto no nativo—. No hay norma que fije un número mínimo; lo que el manual de buenas prácticas de ENFSI exige es validar el procedimiento concreto que se emplea. Documentar versión exacta de cada herramienta y fecha de análisis. Capturar pantalla de cada resultado con timestamp. Registrar configuración utilizada.

  4. Análisis de metadatos: Extraer metadatos con ExifTool/Apache Tika. Analizar tiempos de edición vs. extensión del documento. Examinar bloques de revisión (rsid en Word). Si disponible, analizar historial de Google Docs carácter por carácter.

  5. Análisis estilométrico: Si hay corpus de referencia del supuesto autor, calcular Delta de Burrows y métricas de distancia. Analizar perplejidad, burstiness y entropía manualmente. Comparar patrones de vocabulario funcional. Medir riqueza léxica y distribución de n-gramas.

  6. Verificación de contenido: Comprobar todas las citas, referencias y datos estadísticos. Buscar alucinaciones (información falsa pero plausible). Verificar coherencia interna del documento. Detectar inconsistencias con el conocimiento del supuesto autor.

  7. Análisis por secciones: No analizar solo el documento completo. Segmentar por secciones y analizar cada una individualmente. Detectar transiciones de estilo (posible mezcla humano/IA). Identificar secciones con perplejidad significativamente diferente.

  8. Triangulación de resultados: Consolidar hallazgos de todas las fuentes de análisis. Identificar convergencias (indicadores que apuntan en la misma dirección). Documentar divergencias (indicadores contradictorios). Determinar nivel de confianza global.

  9. Elaboración del informe: Redactar informe pericial con estructura clara. Incluir metodología, herramientas y versiónes. Documentar todas las limitaciones. Expresar conclusiones como probabilidad, no como certeza. Incluir anexos con datos brutos y capturas.

Nivel de confianza y comunicación de resultados

GRADACIÓN DE CONCLUSIONES — SIN PORCENTAJES

Advertencia previa: circula una escala que asigna a cada nivel
un porcentaje (>95%, 85-95%, 70-85%...). NO SE USA AQUI, y no
debe usarse en un dictamen. Esos números no salen de ningún
modelo probabilistico ni de calibracion alguna: convierten en
probabilidad el hecho de que varias herramientas coincidan, y
varias herramientas correlacionadas que se equivocan a la vez
no son evidencia independiente.

La gradación util es verbal y describe QUÉ sostiene cada nivel:

NIVEL 5 — MUY ALTA
"Con un alto grado de probabilidad, el texto fue generado
por un modelo de inteligencia artificial."
Requisitos: Convergencia de todas las herramientas + metadatos
+ estilometría + alucinaciones verificadas.

NIVEL 4 — ALTA
"Los indicios analizados son consistentes con la generación
por inteligencia artificial, con alta probabilidad."
Requisitos: Convergencia de herramientas + al menos 2
indicadores independientes adicionales.

NIVEL 3 — MEDIA
"Existen indicios significativos de que el texto fue
generado total o parcialmente por IA, aunque no es
posible afirmarlo con certeza."
Requisitos: Mayoría de herramientas coinciden pero
hay factores atenuantes.

NIVEL 2 — BAJA
"Los resultados del análisis no son concluyentes.
Existen indicios tanto a favor como en contra de
la generación por IA."
Nota: Documentar todos los factores y dejar la
valoración al tribunal.

NIVEL 1 — NO CONCLUYENTE
"El análisis no permite determinar si el texto fue
generado por IA. Las herramientas y técnicas utilizadas
no proporcionan resultados significativos."
Nota: Ser honesto. Un resultado no concluyente es
un resultado válido e importante.

Ámbito académico

SituaciónNormativa aplicableConsecuencia
TFG/TFM con IANormativa académica universitariaSuspenso, repetición, expediente
Examen con IAReglamento de evaluaciónAnulación, sanción disciplinaria
Tesis doctoral con IANormativa de doctoradoRevocación del título
Artículo científicoPolíticas editorialesRetracción, sanción ANECA
OposicionesLey del Estatuto del Empleado PúblicoExclusión del proceso selectivo

Ámbito judicial

SituaciónBase legalConsecuencia
Escrito procesal con IA no declaradaArt. 247 LEC (mala fe)Multa 180-6.000 €
Citas jurisprudenciales falsas (alucinación)Art. 247 LEC + responsabilidadMulta + posible inhabilitación
Informe pericial elaborado con asistencia de IA sin validación ni declaraciónArts. 335-352 LECNo hay nulidad automática ni delito automático. El art. 459 CP exige que el perito falte a la verdad maliciosamente en su dictamen; usar una herramienta no es faltar a la verdad. Lo que sí ocurre es que el dictamen pierde credibilidad en la valoración por sana crítica
Documento contractual defectuoso por IAArt. 1101 CC (daños)Indemnización por daños
Falsedad documentalArts. 390-395 CP6 meses-3 años prisión

Instrucción CGPJ 2/2026

INSTRUCCIÓN 2/2026 DEL CGPJ
Sobre el uso de inteligencia artificial en la
administración de justicia

Aspectos relevantes para detección de texto IA:

1. VALIDACION CRITICA (ordinal Octavo)
   - Prohibido incorporar contenidos generados por IA
     sin validacion critica personal
   - La Instrucción NO impone declarar el uso de IA

2. RESPONSABILIDAD
   - El profesional que usa IA es responsable del
     contenido generado
   - No puede delegar la responsabilidad en la herramienta

3. VERIFICACIÓN
   - Obligación de verificar la exactitud de los datos
     generados por IA
   - Especial atención a citas jurisprudenciales

NOTA DE ALCANCE
   - La Instrucción regula el uso de IA POR JUECES Y
     MAGISTRADOS. En su texto no aparecen las palabras
     "perito", "pericial" ni "dictamen".
   - No reconoce la validez de informes de detección de
     texto IA, ni impone metodología alguna para ello.

AI Act y obligaciones de transparencia

OBLIGACIONES DEL AI ACT PARA TEXTO GENERADO

Artículo 50.2 — obliga a los PROVEEDORES:
Quienes suministren sistemas que generen contenido
sintético de audio, imagen, vídeo O TEXTO deben garantizar
que las salidas queden marcadas en formato legible por
máquina y sean detectables como generadas o manipuladas
artificialmente. NO se limita al contenido de interés
público: esa restriccion no esta en el apartado.

Artículo 50.4 — obliga a los RESPONSABLES DEL DESPLIEGUE:
  · Parrafo primero: quien genere o manipule un DEEPFAKE
    —imagen, audio o vídeo— debe revelar que es artificial.
  · Parrafo separado: quien genere o manipule TEXTO que se
    publique para informar al público sobre asuntos de
    interés público debe revelarlo, salvo que haya control
    editorial humano y alguien asuma la responsabilidad.

Es este segundo parrafo, y no el 50.2, el que introduce el
criterio de "interés público". El artículo estaba contando
un apartado por el otro.

Sanciones (art. 99). El Reglamento no las clasifica por
gravedad, sino por el supuesto infringido:
- Prácticas prohibidas del art. 5: hasta 35 millones €
  o el 7% del volumen de negocios mundial
- Incumplimiento de las demás obligaciones: hasta 15
  millones € o el 3%

Falsedad documental (arts. 390-395 CP)

Una cita inventada no es, por sí sola, falsedad documental

Estos tipos no se activan porque un documento contenga un dato falso. Exigen una conducta falsaria de las descritas en el art. 390 —simular el documento, alterarlo en un elemento esencial, suponer intervenciones que no hubo, faltar a la verdad en la narración de los hechos—, y dependen además de la clase de documento, de quién es el autor y, en el art. 395, de la finalidad de perjudicar a otro.

Un escrito con una sentencia alucinada por un modelo se combate por la vía del art. 247 LEC, no automáticamente por la penal.

ArtículoSupuestoPenaCuándo podría entrar en juego
390Autoridad o funcionario que comete falsedad en documento público3-6 años + inhabilitaciónSolo si concurre una de las conductas falsarias del precepto y el autor tiene esa condición
392Particular que comete falsedad en documento público, oficial o mercantil6 meses-3 añosRequiere la conducta falsaria, no basta un contenido inexacto
395Falsedad en documento privado6 meses-2 añosExige además ánimo de perjudicar a otro
Mala fe procesal y detección de IA

Sobre el uso de IA por profesionales del derecho, este sitio analiza en detalle el caso del abogado multado por 48 sentencias falsas. El caso internacional identificado y documentado es Mata v. Avianca (Distrito Sur de Nueva York, 2023), donde el tribunal impuso una sanción de 5.000 dólares a los letrados por presentar citas inexistentes generadas con ChatGPT. Para España circula la afirmación de que «varios juzgados ya han sancionado» por lo mismo: no se reproduce aquí, porque no se ha localizado ninguna resolución con tribunal, fecha, número de procedimiento ni ROJ o ECLI que la sostenga. Y ninguna norma obliga hoy al abogado a declarar el uso de IA; la Instrucción CGPJ 2/2026 se dirige a jueces y magistrados y les exige validar críticamente —no declarar— el contenido generado por IA.

Estándares internacionales

ISO y normativa técnica

EstándarÁreaRelevancia
ISO 27037Evidencia digitalMarco de preservación aplicable
ISO/IEC 42001Gestión de IASistema de gestión para organizaciones que usan IA
ISO/IEC 23894Gestión de riesgos IAEvaluación de riesgos incluyendo detección
NIST AI RMFFramework de riesgos IAEstándar estadounidense complementario

ENFSI (European Network of Forensic Science Institutes)

BUENAS PRÁCTICAS DE ENFSI PARA EVIDENCIA DIGITAL (ed. 2015)

Alcance real: el manual NO trata de inteligencia artificial, ni
de texto generado, ni contiene una escala de detección. Lo que
aporta son principios generales de trabajo pericial, y son estos
los que se trasladan por analogía a este análisis:

1. COMPETENCIA DEL PERITO
   - Formación documentada en el área de análisis
   - Actualización continua de conocimientos
   - Participación en pruebas de competencia

2. VALIDACIÓN DE MÉTODOS
   - Toda herramienta de detección debe estar validada
   - Documentar precisión, falsos positivos/negativos
   - Realizar pruebas con muestras conocidas

3. ASEGURAMIENTO DE CALIDAD
   - Procedimientos documentados
   - Trazabilidad de todas las acciones
   - Control de versiónes de herramientas

4. EXPRESIÓN DE RESULTADOS
   - Expresar el alcance y las limitaciones del metodo
   - No atribuir al manual una escala de probabilidad para
     detección de IA: no la contiene
   - Comunicar incertidumbre y limitaciones
   - No hacer afirmaciones absolutas

Limitaciones y consideraciones éticas

Limitaciones técnicas fundamentales

LimitaciónDescripciónImpacto
Imposibilidad teóricaNo existe prueba de que la detección perfecta sea posibleSiempre habrá incertidumbre
Carrera armamentísticaModelos mejoran → detección mejora → evasión mejoraNunca será un problema “resuelto”
Sesgo de entrenamientoHerramientas entrenadas mayoritariamente en inglésMenor precisión en otros idiomas
Sesgo contra no nativosEscritores no nativos producen texto más “regular”Riesgo de discriminación
Edición humanaCualquier edición reduce la detectabilidadTextos mixtos son los más difíciles
Modelos futurosModelos aún no lanzados podrían ser indetectablesHerramientas actuales podrían quedar obsoletas

Consideraciones éticas

DILEMAS ÉTICOS EN DETECCIÓN DE TEXTO IA

1. PRESUNCIÓN DE INOCENCIA
   ¿Debe asumirse que un texto es humano hasta que
   se demuestre lo contrario?
   → En contexto judicial: SÍ (presunción de inocencia)
   → En contexto académico: depende de la política

2. DERECHO A LA HERRAMIENTA
   ¿Tiene un autor derecho a usar IA sin declararlo?
   → Depende del contexto y la normativa aplicable
   → El AI Act impone obligaciones de transparencia
   → Pero no todo uso de IA es ilegítimo

3. DISCRIMINACIÓN POR IDIOMA
   Las herramientas son menos precisas en español.
   ¿Es justo aplicar el mismo estándar?
   → El perito debe comunicar esta limitación
   → Ajustar las conclusiones al nivel de precisión real

4. ESTIGMATIZACIÓN
   Un falso positivo puede destruir una carrera académica
   o profesional. ¿Se debe usar detección de IA como
   única prueba?
   → NUNCA como prueba única
   → Siempre como parte de un análisis más amplio
   → Comunicar explícitamente la tasa de falsos positivos

5. ACCESO DESIGUAL
   Las herramientas de evasión son accesibles para
   quien pueda pagarlas. ¿Crea esto una inequidad?
   → La detección es más fácil contra texto IA "bruto"
   → La evasión sofisticada deja otros rastros
Nunca acusar basándose solo en una herramienta

Acusar a alguien de usar IA basándose únicamente en el resultado de una herramienta automatizada es irresponsable y potencialmente injusto. Los falsos positivos existen, y su magnitud no está medida de forma independiente: los rangos que publican los propios fabricantes proceden de parte interesada. Cualquier conclusión debe basarse en la convergencia de múltiples indicadores independientes, y el informe debe documentar la tasa de error de cada método utilizado.

Futuro de la detección de texto IA

Tendencias 2026-2028

TendenciaDescripciónImpacto esperado
Marcado técnico del contenido sintéticoEl art. 50.2 del AI Act exige que la salida sea marcada en formato legible por máquina y detectable; no impone una técnica concreta ni «marcas de agua» como talFacilitará la detección en la medida en que los proveedores lo implementen
Modelos más “humanos”GPT-5, Claude 5 producirán texto menos detectableTécnicas actuales perderán eficacia
Detección multimodalAnalizar texto + metadatos + comportamiento conjuntoMayor precisión por triangulación
IA para detectar IAClasificadores cada vez más sofisticadosCarrera armamentística continua
Estándares forensicsISO específico para detección de contenido IAMayor rigor metodológico
Regulación armonizadaAI Act + normativa nacionalMarco legal claro
Herramientas localesDetección sin enviar texto a la nubeMejor privacidad
Detección en españolModelos específicos para españolReducción de la brecha de precisión

Tecnologías emergentes

TECNOLOGÍAS EN DESARROLLO

1. DETECCIÓN POR EMBEDDING
   Análisis del espacio vectorial de embeddings:
   - Los textos IA ocupan regiones específicas
     del espacio de embeddings
   - Clasificación por posición geométrica
   - Prometedor pero aún experimental

2. ANÁLISIS TEMPORAL DE ESCRITURA
   Sensores que registran el proceso de escritura:
   - Dinámica de pulsaciones de teclado
   - Movimientos del ratón
   - Pausas y correcciones
   - OJO: es un indicio, no una garantía. El registro
     de tecleo son datos como cualesquiera otros y se
     pueden sintetizar o reproducir; lo que aporta es
     coherencia con el resto, no imposibilidad

3. BLOCKCHAIN DE CONTENIDO
   Registro inmutable de EXISTENCIA (no de autoría):
   - Hash del contenido en blockchain
   - Timestamp verificable
   - Cadena de modificaciones
   - Interoperable con C2PA
   - OJO: acredita que ESE contenido existía en ESE
     momento y que no se ha alterado desde entonces.
     NO acredita quién lo escribió: cualquiera puede
     registrar el hash de un documento ajeno

4. VERIFICACIÓN ZERO-KNOWLEDGE
   Demostrar autoría sin revelar el contenido:
   - Pruebas criptográficas de proceso de escritura
   - Privacidad del contenido preservada
   - Verificación por terceros

5. CLASSIFICADORES ESPECÍFICOS POR IDIOMA
   Modelos entrenados exclusivamente en español:
   - Mayor precisión para textos en español
   - Consideración de regionalismos
   - Adaptación a textos legales españoles

Recomendaciones prácticas

Para el perito informático

  1. Mantener un kit de herramientas actualizado: Revisar trimestralmente las herramientas de detección. Actualizar versiónes y calibrar con muestras conocidas. Incorporar nuevas herramientas a medida que se publiquen.

  2. Usar siempre múltiples métodos: nunca basar una conclusión en una sola herramienta. Y no por alcanzar un número: porque los detectores automáticos fallan de forma correlacionada, de modo que lo que aporta valor es cruzar familias distintas de indicio —automático, estilométrico y documental—, no acumular detectores. Combinar herramientas automatizadas con análisis de metadatos + análisis manual. Ideal: añadir estilometría si hay corpus de referencia.

  3. Documentar exhaustivamente: Versiones de herramientas, configuraciones, fechas de análisis. Capturas de pantalla con timestamp de cada resultado. Cadena de custodia completa de la evidencia.

  4. Comunicar limitaciones honestamente: Expresar resultados como probabilidad, no certeza. Incluir tasas de falsos positivos de cada herramienta. Señalar factores que podrían afectar la fiabilidad (idioma, longitud, dominio).

  5. Conocer el marco legal actualizado: AI Act, Instrucción CGPJ 2/2026, jurisprudencia reciente. Las obligaciones de transparencia evolucionan rápidamente.

  6. Formación continua: Asistir a conferencias de NLP y forense digital. Leer papers actualizados de ACL, EMNLP, NeurIPS. Practicar con muestras conocidas para calibrar el criterio.

  7. Ser imparcial: El perito trabaja para la verdad, no para quien le contrata. Si el análisis no es concluyente, debe decirlo claramente. Un resultado honesto de incertidumbre es más valioso que una conclusión forzada.

  8. Considerar el contexto completo: La detección técnica es solo una parte. El comportamiento del supuesto autor, el tiempo disponible, la consistencia con trabajos anteriores, y la verificación del contenido son complementos esenciales.

Para instituciones educativas

RecomendaciónPrioridadImplementación
Política clara de uso de IACríticaDefinir qué está permitido y qué no
Formación al profesoradoAltaTalleres sobre herramientas de detección
Evaluaciones adaptadasAltaDiseñar evaluaciones resistentes a IA
Herramienta institucionalMediaAntes de contratar una licencia, exigir al proveedor la versión evaluada, el corpus de validación y su tratamiento de los datos que se le suben: un detector al que se le envía prueba de un procedimiento es un tercero que la procesa
Protocolo de investigaciónAltaProcedimiento ante sospecha de uso de IA
Proporcionalidad de sancionesAltaNo criminalizar, educar

Para empresas

RecomendaciónPrioridadImplementación
Política de uso de IACríticaDefinir usos aceptables e inaceptables
Revisión de documentos críticosAltaVerificar contratos, informes regulatorios
Cumplimiento AI ActCríticaAuditar sistemas IA propios
Formación a empleadosAltaUso responsable de IA generativa
Cláusulas contractualesMediaRequisitos de autoría en contratos con proveedores

Para abogados

RecomendaciónPrioridadImplementación
Declarar uso de IARecomendable, no obligatorioNinguna norma española lo impone hoy; declararlo es la práctica que mejor resiste un interrogatorio
Verificar TODAS las citasCríticaComprobar sentencias y legislación citadas
Revisar coherenciaAltaLeer y verificar todo texto generado por IA
Conocer la Instrucción CGPJ 2/2026AltaSe dirige a jueces y magistrados, no al abogado, pero fija el listón con que el tribunal mirará el escrito
Contratar perito si es necesarioMediaPara casos que requieran análisis forense

Conclusión

La detección de texto generado por inteligencia artificial es un campo técnico complejo y en rápida evolución que se ha convertido en una necesidad práctica en múltiples ámbitos: educación, justicia, empresa y administración pública. Ninguna herramienta ni técnica es infalible, y la precisión varía según el idioma, la longitud del texto, el modelo generador y las técnicas de evasión empleadas. Que la detección funciona peor fuera del inglés es constatable; ponerle un decimal, no.

Para el perito informático, la detección de texto IA requiere un enfoque multidisciplinar que combine herramientas automatizadas, análisis de metadatos, estilometría computacional, verificación de contenido y análisis contextual. La honestidad sobre las limitaciones y la expresión de resultados en términos de probabilidad (no de certeza) son esenciales para que el informe pericial tenga valor y credibilidad ante tribunales.

El marco legal evoluciona rápidamente: el AI Act impone obligaciones de transparencia y marcado de contenido generado por IA, la Instrucción CGPJ 2/2026 regula el uso de IA en la administración de justicia, y la jurisprudencia comienza a abordar las consecuencias del uso no declarado de IA. El perito informático forense especializado en esta materia ocupa una posición cada vez más relevante en el sistema judicial.

¿Tienes un caso con evidencia digital de por medio?

Una valoración previa dice qué evidencia existe, en qué estado está y si es técnicamente preservable, antes de invertir en el procedimiento.

Referencias y fuentes

  1. Mitchell, E. et al. (2023). “DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature”. Proceedings of ICML 2023. Método estadístico de detección.

  2. Hans, A. et al. (2024). “Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text”. arXiv:2401.12070. Herramienta open source de detección.

  3. Weber-Wulff, D. et al. (2023). “Testing of Detection Tools for AI-Generated Text”. International Journal for Educational Integrity, 19(26). Evaluación comparativa de herramientas.

  4. Kirchenbauer, J. et al. (2023). “A Watermark for Large Language Models”. Proceedings of ICML 2023. Watermarking estadístico de texto IA.

  5. Sadasivan, V. et al. (2023). “Can AI-Generated Text be Reliably Detected?”. arXiv:2303.11156. Análisis de limitaciones fundamentales.

  6. C2PA (Coalition for Content Provenance and Authenticity). “Technical Specification v2.1” (2025). Estándar de procedencia de contenido digital.

  7. Google DeepMind (2024). “SynthID Text: Scalable Watermarking for Language Models”. Documentación técnica de SynthID.

  8. Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo (AI Act). Artículo 50 sobre obligaciones de transparencia.

  9. Instrucción 2/2026 del Consejo General del Poder Judicial. Directrices sobre uso de IA en la administración de justicia.

  10. Burrows, J. (2002). “‘Delta’: A Measure of Stylistic Difference and a Guide to Likely Authorship”. Literary and Linguistic Computing, 17(3), 267-287. Fundamento de la estilometría computacional.

  11. Liang, W. et al. (2024). “Monitoring AI-Modified Content at Scale”. arXiv:2403.07183. Detección a escala de contenido modificado por IA.

Última actualización: 27 de agosto de 2026 Categoría: Técnico Código: TEC-065

Preguntas Frecuentes

¿Cómo puedo saber si un texto fue escrito por ChatGPT?

Existen herramientas como GPTZero, Originality.ai y Copyleaks que analizan patrones estadísticos del texto. Sin embargo, ninguna es 100% fiable. Para un resultado más robusto, se recomienda combinar varias herramientas con análisis manual de estilo, verificación de contenido y, si está disponible, análisis de metadatos del documento.

¿Son fiables las herramientas de detección de texto IA en español?

No hay validación independiente que permita dar una cifra. Las tasas de acierto que publican los fabricantes proceden de sus propias pruebas, con sus propios corpus, y no se han replicado para el español. El dato más elocuente es otro: OpenAI retiró su propio clasificador en 2023 por su baja fiabilidad. En un dictamen, la detección automática se usa como indicio a contrastar, nunca como conclusión.

¿Se puede usar un informe de detección de texto IA como prueba en un juicio?

Puede aportarse como dictamen de perito de parte, pero conviene no prometer más: cumplir una lista de requisitos no predetermina que el tribunal lo admita ni el peso que le dé. El tribunal lo valorará por sana crítica (art. 348 LEC), y en esta materia la fuerza del dictamen depende sobre todo de que declare sus limitaciones. Lo exigible al perito es aplicar una metodología rigurosa, contrastar familias distintas de indicio, documentar las limitaciones y mantener la cadena de custodia. Los tribunales valoran la transparencia sobre tasas de error y falsos positivos.

¿Qué consecuencias legales tiene presentar como propio un texto generado por IA?

Depende del contexto: en el ámbito académico puede suponer la anulación del trabajo; en un procedimiento judicial, apreciarse mala fe procesal (art. 247 LEC) si concurren sus requisitos; y en una relación contractual, un posible incumplimiento. Lo que NO hace el AI Act es sancionar con carácter general a quien presenta como propio un texto asistido por IA: su art. 50 reparte obligaciones concretas entre proveedores y determinados responsables del despliegue, y las multas se dirigen a esos sujetos, no a cualquier autor.

¿Necesitas un peritaje forense?

Si necesitas ayuda profesional con análisis forense digital, estoy aquí para ayudarte.

Solicitar Consulta Gratuita
Jonathan Izquierdo

Jonathan Izquierdo · Perito Forense

+15 años experiencia · AWS Certified

WhatsApp