Detección de Texto IA
Conjunto de técnicas, herramientas y metodologías diseñadas para identificar si un texto fue generado total o parcialmente por un modelo de inteligencia artificial, distinguiendo la marca de agua —SynthID— de las credenciales de procedencia —C2PA—, que no son lo mismo. Incluye métodos estadísticos (perplejidad, burstiness, entropía), clasificadores de aprendizaje automático, marcas de agua digitales (C2PA, SynthID), análisis estilométrico y análisis de metadatos de documentos.
¿Qué es la detección de texto IA?
La detección de texto IA es el campo técnico dedicado a determinar si un fragmento de texto fue producido total o parcialmente por un modelo de inteligencia artificial generativa (como GPT-4, Claude, Gemini, Llama o Mistral). Este campo combina técnicas estadísticas, aprendizaje automático, lingüística computacional y análisis de metadatos para identificar las huellas que los modelos de lenguaje dejan en el texto que generan.
La necesidad de detectar texto generado por IA ha crecido exponencialmente desde la popularización de ChatGPT en noviembre de 2022. En solo tres años, la detección de texto IA ha pasado de ser un problema académico a una necesidad práctica en educación, justicia, periodismo, empresa y administración pública.
Campo en constante evolución
La detección de texto IA es una carrera armamentística: a medida que los modelos de lenguaje mejoran y producen texto más “humano”, las herramientas de detección deben evolucionar. Las técnicas y precisiones descritas en este artículo reflejan el estado del arte en marzo de 2026 y pueden cambiar significativamente en meses.
Categorías de métodos de detección
Los métodos de detección se clasifican en tres grandes familias:
| Categoría | Enfoque | Ventajas | Limitaciones |
|---|---|---|---|
| Estadísticos | Analizar propiedades matemáticas del texto | Interpretables, no requieren entrenamiento | Precisión limitada en textos cortos |
| Basados en ML | Clasificadores entrenados con textos humanos/IA | Alta precisión en condiciones óptimas | Caja negra, necesitan datos de entrenamiento |
| Watermarking | Marcas invisibles insertadas durante la generación | Muy alta precisión si están presentes | Requieren cooperación del proveedor |
| Híbridos | Combinación de las anteriores | Robustez por triangulación | Mayor complejidad y coste |
Métodos estadísticos
Perplejidad
La perplejidad es la métrica más fundamental para la detección de texto IA. Mide cuán “sorprendente” resulta un texto para un modelo de lenguaje de referencia:
Definición matemática:
PPL(X) = exp(-1/N × Σ log P(x_i | x_1, ..., x_{i-1}))
donde:
- X = secuencia de tokens del texto
- N = número total de tokens
- P(x_i | ...) = probabilidad del token i dado el contexto¿Por qué funciona?
Los LLM generan texto seleccionando tokens de alta probabilidad según su distribución aprendida. Por tanto, el texto generado por IA tiende a tener perplejidad baja cuando se evalúa con un modelo similar, porque sigue el camino de máxima probabilidad. Los humanos, en cambio, hacen elecciones menos predecibles: usan palabras inesperadas, construcciones idiomáticas personales y expresiones coloquiales que un modelo no priorizaría.
Perplejidad por tipo de texto — con una advertencia sin la cual la tabla engaña: la perplejidad no es una propiedad del texto, sino del texto medido con un modelo evaluador concreto. Cambiar de modelo, de tokenizador o de idioma mueve todos los números. Los rangos siguientes son órdenes de magnitud ilustrativos, no umbrales de decisión: un dictamen que clasifique por ellos sin declarar con qué modelo los obtuvo no es reproducible.
| Tipo de texto | Perplejidad típica | Interpretación |
|---|---|---|
| Texto ChatGPT (temperature 0.3) | 5-12 | Muy baja: fuerte indicador de IA |
| Texto ChatGPT (temperature 0.7) | 12-25 | Baja: indicador moderado de IA |
| Texto ChatGPT (temperature 1.0) | 20-40 | Zona ambigua |
| Texto legal/normativo humano | 15-30 | Baja por formalidad (falso positivo) |
| Escritura periodística humana | 30-60 | Media: zona normal humana |
| Escritura creativa/literaria | 50-120 | Alta: fuerte indicador humano |
| Conversación informal humana | 60-150 | Muy alta: indicador claro de humano |
| Poesía/escritura experimental | 100-300+ | Extrema: patrón humano |
Perplejidad no es prueba absoluta
Un texto legal muy formal escrito por un abogado puede tener perplejidad tan baja como texto generado por IA, porque los textos legales siguen fórmulas y estructuras predecibles. La perplejidad siempre debe combinarse con otras métricas para evitar falsos positivos.
Burstiness (Explosividad)
La burstiness mide la variabilidad en la complejidad y longitud de las oraciones a lo largo del texto:
Cálculo de burstiness:
Burstiness = σ(S) / μ(S)
donde:
- S = {s_1, s_2, ..., s_n} (longitudes de oraciones)
- σ(S) = desviación estándar
- μ(S) = media
Variantes más sofisticadas incluyen:
- Burstiness de complejidad sintáctica (profundidad de árbol)
- Burstiness de riqueza léxica por ventana
- Burstiness multi-escala (oración, párrafo, sección)Visualización comparativa:
LONGITUD DE ORACIONES — TEXTO HUMANO
│
│ ██
│ ██ ████
│ ██ ██ ██ ████
│ ██ ██ ██ ██ ██ ██ ████ ██
│ ██ ██ ██ ██ ██ ██ ██ ██ ████ ██ ██
│ ██ ██ ██ ██ ██ ██ ██ ██ ████ ██ ██
└──────────────────────────────────────────────→
1 2 3 4 5 6 7 8 9 10 11
(Número de oración → altura = longitud)
Burstiness = 0.82 (alta variabilidad)
LONGITUD DE ORACIONES — TEXTO LLM
│
│
│ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██
│ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██
│ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██
│ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██ ██
└──────────────────────────────────────────────→
1 2 3 4 5 6 7 8 9 10 11
Burstiness = 0.21 (baja variabilidad)Interpretación forense:
| Burstiness | Hacia dónde apunta | Qué lo confunde |
|---|---|---|
| Muy baja | Uniformidad compatible con generación automática | Texto legal, normativo o administrativo humano, que también es muy uniforme |
| Intermedia | No discrimina | Casi cualquier cosa |
| Alta | Variación compatible con escritura humana | Un texto de IA con temperatura alta o reescrito a mano |
Los umbrales numéricos concretos que suelen acompañar a esta métrica dependen del corpus y del preprocesado, y no se reproducen aquí como puntos de corte: sin declarar tokenizador, longitud de ventana y corpus de referencia, un umbral no es verificable.
Entropía
La entropía mide la cantidad de información y la imprevisibilidad del texto a nivel de token:
Entropía de Shannon:
H(X) = -Σ P(x_i) × log₂ P(x_i)
Entropía por posición (análisis secuencial):
H_j = -Σ P(x_j | contexto) × log₂ P(x_j | contexto)
La entropía se analiza:
- Globalmente (media del texto completo)
- Por ventanas deslizantes (variación local)
- En puntos de transición (inicio de párrafos/secciones)Patrones de entropía característicos:
ENTROPÍA POR POSICIÓN — TEXTO HUMANO
H │
│ ╱╲ ╱╲ ╱╲╱╲
│╱ ╲ ╱ ╲╱╲ ╱ ╲ ╱╲
│ ╲╱ ╲ ╲ ╱ ╲ ╱ ╲
│ ╲╱╲ ╲╱╲╱ ╲╱╲
└──────────────────────────────────────→
(Alta variabilidad, picos en transiciones)
ENTROPÍA POR POSICIÓN — TEXTO LLM
H │
│
│ ──────────────────────────────────
│
│
└──────────────────────────────────────→
(Baja variabilidad, entropía casi constante)Análisis combinado de las tres métricas:
| Perplejidad | Burstiness | Entropía | Diagnóstico |
|---|---|---|---|
| Baja | Baja | Constante | IA con alta probabilidad |
| Baja | Alta | Variable | Texto humano formal (legal, técnico) |
| Alta | Baja | Constante | IA con temperature alta + edición |
| Alta | Alta | Variable | Humano con alta probabilidad |
| Media | Media | Mixta | Zona ambigua — requiere análisis adicional |
Análisis de distribución de vocabulario
Ley de Zipf:
La Ley de Zipf establece que en textos naturales, la frecuencia de una palabra es inversamente proporcional a su rango:
f(r) ≈ C / r^α
donde:
- f(r) = frecuencia de la palabra de rango r
- C = constante
- α ≈ 1 para textos humanos naturalesLos textos generados por IA tienden a desviarse sutilmente de esta ley:
| Característica | Texto humano | Texto IA |
|---|---|---|
| Exponente α | Próximo al Zipf puro | Suele desviarse a la baja |
| Cola de distribución | Más palabras raras | Menos palabras raras |
| Hapax legomena | Proporción mayor | Proporción menor |
| Type-Token Ratio | Variable por autor | Más consistente |
Riqueza léxica (Type-Token Ratio):
TTR = Tipos únicos / Total de tokens
TTR por ventanas (más robusto):
MATTR = Media de TTR en ventanas de N palabras
El MATTR es útil porque **es comparable entre textos de distinta longitud**, que es lo que rompe al TTR simple. Lo que no existe es una tabla de valores «típicos» de IA frente a humano: la riqueza léxica depende del **género, del dominio, del idioma y del preprocesado** mucho más que de quién escribió. Se usa comparando el texto dudoso **contra un corpus del propio autor**, no contra un umbral universal.Análisis de n-gramas
El estudio de secuencias de n palabras consecutivas revela patrones diferenciadores:
| Métrica | Qué mide | Indicador IA |
|---|---|---|
| Repetición de bigramas | Pares de palabras que se repiten | Mayor repetición en IA |
| Originalidad de trigramas | Secuencias de 3 palabras únicas | Menor originalidad en IA |
| Cobertura de 4-gramas | % de 4-gramas encontrados en corpus de IA | Alta cobertura = indicador IA |
| Diversidad de inicios de oración | Variedad en las primeras palabras | Menor diversidad en IA |
Frases formulaicas típicas de LLM en español:
CONECTORES SOBREUTILIZADOS POR LLM:
- "Es importante señalar que..."
- "Cabe destacar que..."
- "En este sentido..."
- "A modo de conclusión..."
- "Resulta fundamental..."
- "No obstante lo anterior..."
- "Dicho esto..."
- "En definitiva..."
- "Desde esta perspectiva..."
- "Es preciso mencionar..."
- "Conviene recordar que..."
- "En el marco de..."
- "Por consiguiente..."
- "En primer lugar... en segundo lugar..."
ESTRUCTURAS TÍPICAS:
- Párrafos de longitud similar (~100-150 palabras)
- Listas con "En primer lugar / En segundo lugar / Finalmente"
- Transiciones equilibradas entre párrafos
- Conclusiones que resumen los puntos anteriores
- Uso frecuente de voz pasiva impersonalLos conectores por sí solos no prueban nada
Muchos escritores humanos también usan conectores formulaicos, especialmente en textos académicos y legales. La presencia de estas frases es un indicador complementario, nunca una prueba aislada. Lo relevante es la acumulación de múltiples indicadores.
Métodos basados en aprendizaje automático
Clasificadores supervisados
Los clasificadores ML se entrenan con grandes conjuntos de textos etiquetados como “humano” o “IA”:
ARQUITECTURA TÍPICA DE CLASIFICADOR
ENTRADA: Texto a analizar
│
▼
┌──────────────────────┐
│ TOKENIZACIÓN │ → Tokens, subpalabras
└──────────────────────┘
│
▼
┌──────────────────────┐
│ EXTRACCIÓN DE │ → Perplejidad, burstiness,
│ CARACTERÍSTICAS │ entropía, n-gramas, TTR,
│ │ longitud oraciones, etc.
└──────────────────────┘
│
▼
┌──────────────────────┐
│ MODELO │ → Transformer fine-tuned,
│ CLASIFICADOR │ Random Forest, o ensemble
└──────────────────────┘
│
▼
┌──────────────────────┐
│ SALIDA │ → Probabilidad IA: 0.0 - 1.0
│ │ + Desglose por sección
└──────────────────────┘Tipos de clasificadores:
| Tipo | Ejemplo | Ventaja | Limitación |
|---|---|---|---|
| Transformer fine-tuned | RoBERTa, DeBERTa | Muy alta precisión | Requiere GPU, opaco |
| Ensemble de features | Random Forest + estadísticas | Interpretable | Menor precisión |
| Zero-shot | DetectGPT, Binoculars | No requiere entrenamiento | Menor precisión general |
| Few-shot | Clasificador con pocos ejemplos | Adaptable a nuevos modelos | Necesita ejemplos del modelo |
DetectGPT (método de perturbaciónes)
DetectGPT es un método zero-shot que no necesita un clasificador entrenado:
ALGORITMO DETECTGPT
1. Dado un texto T, calcular log-probabilidad: logP(T)
2. Generar N perturbaciónes de T usando un modelo auxiliar:
T'_1, T'_2, ..., T'_N
(Cada T'_i es T con algunas palabras reemplazadas
por sinónimos/paráfrasis)
3. Calcular log-probabilidad de cada perturbación:
logP(T'_1), logP(T'_2), ..., logP(T'_N)
4. Calcular puntuacion:
d = (logP(T) - mu(logP(T'_i))) / sigma(logP(T'_i))
NOTA SOBRE LAS PERTURBACIONES: el metodo original no sustituye
palabras a mano por sinonimos. Genera las variantes con OTRO
modelo preentrenado de enmascarado, que reescribe fragmentos del
texto. La diferencia importa: una sustitución manual introduce
criterio del perito donde el metodo pide una perturbación
automática y reproducible.
INTERPRETACIÓN:
- d > umbral → Texto probablemente generado por máquina
(el texto original tiene probabilidad más alta que
sus perturbaciónes, indicando que está en un "pico"
de la distribución del modelo)
- d < umbral → Texto probablemente humano
(las perturbaciónes tienen probabilidad similar,
indicando una región "plana" de la distribución)Ventajas de DetectGPT:
- No requiere datos de entrenamiento etiquetados
- Basado en principio estadístico fundamentado
- Adaptable a nuevos modelos sin reentrenamiento
Limitaciones:
- Computacionalmente costoso (N perturbaciónes por texto)
- Menor precisión que clasificadores supervisados
- Sensible al modelo auxiliar elegido para perturbaciónes
Binoculars
Binoculars es un método open source reciente que compara dos modelos de referencia:
ALGORITMO BINOCULARS
1. Usar DOS MODELOS CERCANOS entre sí (p. ej. la variante base y la
variante instruida de la misma familia), no uno grande y uno pequeño.
2. Calcular dos magnitudes sobre el mismo texto:
- PERPLEJIDAD: cuánto sorprende el texto al primer modelo.
- PERPLEJIDAD CRUZADA: cuánto sorprenden al primer modelo las
predicciones del segundo. Es el término que normaliza, y es lo
que da nombre a la técnica: mira el texto "con los dos ojos".
3. La puntuación es el COCIENTE de ambas:
B = perplejidad / perplejidad_cruzada
INTERPRETACIÓN — y este es el sentido que suele contarse al revés:
- B BAJO → indicio de texto generado por máquina.
- B ALTO → indicio de texto humano.
La intuición: un texto de máquina sorprende poco al modelo (perplejidad
baja) EN RELACIÓN con lo poco que los dos modelos se sorprenden entre sí.
Es la relación, no la perplejidad suelta, lo que discrimina.Sobre los resultados publicados: circula una tabla con precisiones por modelo fuente —93,7 % para GPT-4, 91,2 % para Claude 3, y así con cinco filas—. No está en el trabajo original, cuyas evaluaciones usan otros conjuntos, otro número de muestras y otras cifras. No se reproduce aquí: una tabla de precisión sin corpus, sin versión de modelo y sin umbral no significa nada en un dictamen, y es lo primero que desmonta un contraperito.
Lo que sí puede sostenerse: la técnica se propone como detector zero-shot que no requiere entrenar sobre el generador concreto, y su rendimiento depende del dominio y de la longitud del texto.
GLTR (Giant Language model Test Room)
GLTR no es un clasificador sino una herramienta de visualización:
FUNCIONAMIENTO DE GLTR
Para cada palabra del texto, GLTR calcula su ranking
en la distribución de probabilidad del modelo:
Colores:
🟢 Verde → Top 10 palabras más probables
🟡 Amarillo → Top 100
🔴 Rojo → Top 1000
🟣 Púrpura → Fuera del top 1000
TEXTO HUMANO típico:
"El 🟢gato🟢 🟣saltó🟣 por 🟢la🟢 🔴ventana🟡 hacia 🟡el🟢 🟣enmarañado🟣 jardín"
→ Mezcla de colores: muchas elecciones inesperadas
TEXTO IA típico:
"El 🟢gato🟢 🟢saltó🟢 por 🟢la🟢 🟢ventana🟢 hacia 🟢el🟢 🟢bonito🟢 🟢jardín🟢"
→ Predominio de verde: palabras de alta probabilidadUso forense de GLTR:
- Visualizar secciones sospechosas de un documento
- Identificar transiciones entre texto humano y texto IA
- Herramienta pedagógica para explicar al tribunal cómo funciona la detección
- Complementar resultados de herramientas automatizadas
Métodos de watermarking (marcas de agua)
C2PA (Coalition for Content Provenance and Authenticity)
C2PA es un estándar abierto para la procedencia de contenido digital:
ESTÁNDAR C2PA
Objetivo:
Proporcionar una cadena de procedencia verificable
para contenido digital, incluyendo texto generado por IA.
Funcionamiento:
1. El sistema que genera el contenido firma digitalmente
los metadatos de procedencia
2. Los metadatos incluyen:
- Quién creó el contenido
- Con qué herramienta
- Cuándo se creó
- Si intervino IA en su generación
- Cadena de modificaciones posteriores
3. Los metadatos están criptográficamente vinculados
al contenido (no se pueden alterar sin invalidarlos)
Adopción (marzo 2026):
- Adobe: Photoshop, Premiere, Firefly
- Microsoft: Bing Image Creator, Copilot
- Google: Gemini (parcial)
- OpenAI: DALL-E, GPT (parcial)
- Sony, Nikon, Canon (en cámaras)
- BBC, New York Times (en publicaciones)Aplicación a documentos de texto:
| Formato | Soporte C2PA | Estado |
|---|---|---|
| Sí (Adobe Acrobat) | Implementado | |
| DOCX | Parcial (Microsoft 365) | En desarrollo |
| Imágenes con texto | Sí (PNG, JPEG, AVIF) | Implementado |
| HTML | En desarrollo | Propuesta de estándar |
| Texto plano | No | No aplicable directamente |
| En desarrollo | Propuesta |
Limitaciones de C2PA para texto:
- Solo funciona si el proveedor implementa el estándar
- Copiar-pegar texto elimina los metadatos C2PA
- No protege contra captura de pantalla y retranscripción
- Adopción aún parcial en generadores de texto
SynthID (Google DeepMind)
SynthID es el sistema de marca de agua de Google DeepMind. Conviene matizar lo de «propietario»: la integración en sus productos incluye componentes no públicos, pero existe implementación de referencia con licencia Apache-2.0 de la técnica de marcado y detección, demostrada sobre modelos abiertos. No es un secreto cerrado.
SYNTHID PARA TEXTO
Funcionamiento:
1. Durante la generación de texto, SynthID modifica
sutilmente la distribución de probabilidad de
los tokens seleccionados
2. La modificación sigue un patrón pseudoaleatorio
determinado por una clave secreta
3. Un detector con la clave puede identificar
el patrón estadístico
4. Sin la clave, el patrón es invisible
Propiedades:
- Imperceptible: no afecta la calidad del texto
- Robusto: resiste edición menor y parafraseo parcial
- Estadístico: detección probabilística, no binaria
- Escalable: aplicable en tiempo de generación sin coste
Limitaciones:
- En producción, aplicado a los modelos de Google; la técnica en sí no está atada a ellos
- La detección requiere la clave de marcado, que Google no publica para sus modelos productivos
- Vulnerable a parafraseo extensivo
- No es estándar abiertoComparativa de sistemas de watermarking:
| Sistema | Proveedor | Estándar | Detección | Robustez |
|---|---|---|---|---|
| C2PA | Coalición abierta | Abierto | Verificación de metadatos | Media (copy-paste elimina) |
| SynthID | Propietario | Análisis estadístico | Alta (resiste edición menor) | |
| Kirchenbauer | Académico | Abierto | Test estadístico | Media-alta |
| Distillation-based | Varios | Varía | Clasificador | Variable |
| Marcado de OpenAI para texto | OpenAI | No publicado | — | ⚠️ No consta desplegado ni documentado públicamente para texto; se ha descrito trabajo interno, no un producto verificable |
El watermarking es complementario, no sustitutivo
El watermarking solo funciona si el generador del texto implementa la marca de agua. Para texto generado por modelos sin watermarking, modelos locales (Llama, Mistral) o texto generado antes de la implementación, se necesitan métodos estadísticos y basados en ML.
Precisión por herramienta e idioma
Qué se sabe realmente sobre la precisión de estas herramientas
Circulan tablas comparativas que asignan a cada detector una precisión con un decimal frente a cada familia de modelos —GPTZero un 97,2 % contra GPT-4, un 94,8 % contra Claude—, y suelen venir por duplicado, en inglés y en español. No existe ese benchmark. Ningún evaluador independiente publica esa matriz, y menos aún para español.
Lo que sí hay, y conviene distinguir:
| Qué es | Quién lo publica | Cómo leerlo |
|---|---|---|
| Cifras de fabricante | Cada herramienta, sobre su propio corpus | No son comparables entre sí: cada una elige qué textos mide y qué llama acierto |
| Trabajo académico | Métodos como Binoculars publican su AUROC sobre conjuntos de datos identificados | Es reproducible, pero mide sobre ese conjunto, no sobre un escrito judicial en español |
| Evaluación sobre texto jurídico en español | Nadie | Es justo el caso de uso que interesaría a un perito, y está sin medir |
Y hay un dato que vale más que cualquier porcentaje: OpenAI retiró en 2023 su propio clasificador de texto generado por IA por tasa de acierto insuficiente. Quien fábrica los modelos no consiguió construir el detector.
Por qué esto importa en un peritaje
Un perito no puede sostener la autoría de un texto sobre la salida de un detector, y menos citando una precisión que nadie ha medido. Lo que sí se acredita es distinto y mucho más sólido: que las fuentes citadas en el escrito no existen. Comprobar una sentencia en el CENDOJ es binario, reproducible y gratuito; estimar si un párrafo «parece» generado no es ninguna de las tres cosas.
Factores que afectan la precisión
| Factor | Impacto en precisión | Dirección |
|---|---|---|
| Longitud del texto | Muy alto | Más largo = más preciso |
| Idioma | Alto | Inglés > español > otros |
| Modelo generador | Alto | Modelos grandes más detectables |
| Temperature | Medio-alto | Temperature baja más detectable |
| Edición humana posterior | Alto | Reduce detección significativamente |
| Dominio temático | Medio | Texto técnico/legal más difícil |
| Mezcla humano/IA | Muy alto | Reduce drásticamente la detección |
| Herramientas de parafraseo | Alto | Reduce detección |
| Traducción | Medio | Introduce artefactos pero reduce patrones IA |
| Fecha del modelo | Medio | Modelos más nuevos más difíciles |
Sobre las tablas de precisión por longitud y las de tasas de error
Circulan tres tablas con decimales: precisión de GPTZero en español por tramos de longitud, tasas de falso positivo por tipo de texto humano y tasas de falso negativo por técnica de evasión. Aquí no se reproducen, y conviene explicar por qué, porque el motivo es el mismo que hace inservible casi toda cifra de este campo.
Ninguna identifica qué versión del detector se midió, sobre qué corpus, con qué umbral ni quién hizo la medición. La referencia que las sostenía —«Tian, 2023-2026»— no es una publicación identificable. Y los detectores se reentrenan cada pocos meses: una precisión medida hace un año no describe al producto de hoy.
Lo que sí se sostiene, y es lo que un dictamen puede afirmar sin quedar en evidencia:
| Hecho | Por qué importa en un peritaje |
|---|---|
| La longitud del texto condiciona el resultado | Por debajo de un par de párrafos, cualquier detector es poco fiable. No hace falta un porcentaje para saber que un texto corto no sostiene una conclusión |
| El texto formal y formulaico dispara falsos positivos | Lo académico, lo legal y lo administrativo son uniformes por naturaleza, que es justo el rasgo que estos detectores leen como artificial |
| El texto de hablantes no nativos también | Está documentado como sesgo del método, no como anécdota: vocabulario más acotado y estructuras más simples se parecen a lo que el detector busca |
| Editar el texto degrada la detección | Reescritura, traducción de ida y vuelta o ajuste fino del modelo reducen la señal, y no hay contramedida que lo resuelva |
La conclusión operativa no cambia por retirar los números: ningún detector automático sostiene por sí solo una conclusión pericial, y menos sobre texto corto, formal o traducido. Por eso el peso recae en el resto del cuadro —metadatos del documento, historial de edición y contraste estilométrico contra escritos previos del autor—, que es lo que un informe pericial puede documentar y ratificar.
Este análisis lo firma Jonathan Izquierdo, perito informático forense.
Análisis de metadatos de documentos
Microsoft Word (.docx)
Los documentos Word contienen metadatos ricos que pueden revelar el uso de IA:
<!-- core.xml — Metadatos básicos -->
<cp:coreProperties>
<dc:creator>Juan García</dc:creator>
<cp:lastModifiedBy>Juan García</cp:lastModifiedBy>
<dcterms:created>2026-03-15T10:22:00Z</dcterms:created>
<dcterms:modified>2026-03-15T10:47:00Z</dcterms:modified>
<cp:revision>3</cp:revision>
</cp:coreProperties>
<!-- app.xml — Metadatos de aplicación -->
<Properties>
<Application>Microsoft Word 365</Application>
<TotalTime>25</TotalTime> <!-- 25 minutos de edición -->
<Pages>15</Pages>
<Words>5247</Words>
<Characters>29912</Characters>
<Paragraphs>73</Paragraphs>
</Properties>
<!-- ANÁLISIS FORENSE -->
<!-- 5247 palabras en 25 minutos = 210 palabras/minuto -->
<!-- Velocidad promedio de escritura humana: 30-40 pal/min -->
<!-- Velocidad promedio de copy-paste: 200+ pal/min -->
<!-- → INDICADOR DE COPY-PASTE (probable IA) -->Indicadores clave en Word:
| Indicador | Valor normal (humano) | Sospechoso (IA) |
|---|---|---|
| Tiempo de edición | 1-2 min/100 palabras | < 0.3 min/100 palabras |
| Número de revisiones | 20-100+ por documento | < 10 |
| Bloques rsid | Muchos, variados | Pocos, grandes |
| Número de guardados | Múltiples (autoguardado) | 1-3 |
| Track changes | Presentes si hay revisión | Ausentes |
| Comentarios | Posibles | Generalmente ausentes |
ANÁLISIS FORENSE DE PDF
1. METADATOS ESTÁNDAR
/Title: (título del documento)
/Author: (autor)
/Creator: (aplicación que creó el PDF)
/Producer: (software que generó el PDF)
/CreationDate: (fecha de creación)
/ModDate: (fecha de modificación)
2. ANÁLISIS DE FUENTES
- Fuentes embebidas vs. referenciadas
- Tipo de fuente (indica origen):
· Calibri, Aptos → Microsoft Word
· Liberation Sans → LibreOffice
· Roboto, Open Sans → Google Docs/web
· Times New Roman → Múltiples orígenes
3. ESTRUCTURA DE CONTENIDO
- Texto como stream vs. texto como imagen
- Capas de contenido (originales vs. añadidas)
- Marcadores y estructura de navegación
- Formularios y campos editables
4. INDICADORES DE COPY-PASTE EN PDF
- Texto sin estructura de párrafos nativa
- Inconsistencias en el interlineado
- Mezcla de fuentes o tamaños sin justificación
- Ausencia de estilos de documentoGoogle Docs
Google Docs mantiene un historial de revisiones más granular que un procesador de escritorio, pero conviene acotar qué contiene realmente:
HISTORIAL DE REVISIONES — GOOGLE DOCS
El historial NO registra pulsacion a pulsacion. Agrupa cambios
en versiónes y puede FUSIONAR ediciones próximas en el tiempo,
de modo que lo que se ve es una reconstrucción aproximada. Con
todo, la granularidad basta para distinguir escritura de pegado:
ESCRITURA HUMANA TÍPICA:
14:22:01 - "E" (1 carácter)
14:22:01 - "l" (1 carácter)
14:22:01 - " " (1 carácter)
14:22:02 - "a" (1 carácter)
14:22:02 - "n" (1 carácter)
14:22:02 - "á" (1 carácter) ← pausa para tilde
14:22:03 - "l" (1 carácter)
... (continúa carácter a carácter con pausas naturales)
14:22:15 - Backspace x3 ← corrección humana típica
14:22:17 - "isi" (3 caracteres, corrección)
→ Patrón: 2-5 caracteres/segundo, con pausas y correcciones
PEGADO DE TEXTO IA:
14:22:01 - Pegado: "El análisis forense digital es una
disciplina que se encarga de la identificación,
preservación, análisis y presentación de evidencia
digital en procedimientos judiciales. Esta disciplina
ha cobrado una importancia creciente en el contexto
actual de digitalización..." (847 caracteres de una vez)
14:22:30 - Sin actividad (29 segundos, leyendo lo pegado)
14:23:05 - Pegado: "Los principales métodos de análisis
incluyen..." (623 caracteres de una vez)
→ Patrón: Bloques grandes pegados con pausas entre ellos
ANALISIS FORENSE — y una limitación que hay que declarar:
la API de Google Docs devuelve la VERSIÓN ACTUAL del documento,
no el flujo de ediciones. La lista de revisiones de Drive puede
ser incompleta y no expone un registro de teclas ni de pegados.
Lo utilizable es la exportacion del historial que ofrece la
interfaz, solicitada al titular de la cuenta.
- Detectar bloques de pegado (>50 caracteres de una vez)
- Medir velocidad de "escritura" por sección
- Identificar patrones de corrección (humanos corrigen más)
- Mapear timeline: pegado → lectura → pequeña edición → pegadoGoogle Docs: la mejor evidencia de metadatos
El historial de revisiones de Google Docs suele ser la evidencia de metadatos más útil para esta cuestión, porque conserva una secuencia temporal que un documento de escritorio no guarda. Pero no registra «cada acción individual»: agrupa y fusiona versiónes, de modo que permite reconstruir aproximadamente cómo se escribió el documento.
Estilometría computacional
Fundamentos
La estilometría es la ciencia de analizar el estilo de escritura para atribuir autoría. Aplicada a la detección de texto IA, permite comparar el estilo de un texto sospechoso con el estilo conocido de un autor humano:
PROCESO ESTILOMÉTRICO
1. CORPUS DE REFERENCIA
Recopilar textos verificados del supuesto autor:
- Emails anteriores
- Documentos de trabajo previos
- Escritos académicos
- Mensajes de chat
Mínimo: 5.000-10.000 palabras de referencia
2. EXTRACCIÓN DE CARACTERÍSTICAS
Para cada texto (referencia y sospechoso):
a) Léxicas: vocabulario, riqueza, frecuencias
b) Sintácticas: longitud oraciones, complejidad
c) Caracteres: uso puntuación, mayúsculas, espacios
d) Funcionales: preposiciones, artículos, conjunciones
e) Estructurales: párrafos, listas, organización
3. COMPARACIÓN
Medir distancia entre perfiles estilísticos:
- Delta de Burrows (la más usada)
- Distancia coseno
- Divergencia de Kullback-Leibler
- Distancia euclidiana normalizada
4. CONCLUSIÓN
¿El texto sospechoso está más cerca del perfil
del autor humano o de un perfil típico de LLM?Delta de Burrows
El Delta de Burrows es la métrica estilométrica más utilizada y validada:
Delta de Burrows:
Δ(A, B) = (1/n) × Σ |z_A(f_i) - z_B(f_i)|
donde:
- f_i = frecuencia de la palabra funcional i
- z_A(f_i) = z-score de f_i en el texto A
- z_B(f_i) = z-score de f_i en el texto B
- n = número de palabras funcionales analizadas
Interpretación:
- Δ bajo = estilos similares (mismo autor probable)
- Δ alto = estilos diferentes (autores diferentes)
En detección IA:
- Calcular Δ(texto_sospechoso, corpus_autor)
- Calcular Δ(texto_sospechoso, corpus_LLM)
- Si Δ_autor >> Δ_LLM → probable IA
- Si Δ_autor << Δ_LLM → probable humanoHerramientas de estilometría
| Herramienta | Lenguaje | Características | Uso forense |
|---|---|---|---|
| Stylo | R | Delta de Burrows, PCA, clustering | Investigación académica |
| JGAAP | Java | Múltiples métricas y clasificadores | Análisis forense |
| pyStylometry | Python | Flexible, scriptable | Automatización |
| Stylometry.org | Web | Accesible, sin instalación | Análisis rápido |
| LIWC | Multiplataforma | Análisis psicológico del lenguaje | Perfil de autor |
| Signature | Python | Especializado en atribución | Atribución de autoría |
Cómo se estructura un análisis estilométrico
Ejemplo metodológico
Lo que sigue no es un caso real ni un expediente: es la forma que tiene un análisis estilométrico y qué magnitudes se comparan. Las cifras son de ejemplo. Un análisis real exige declarar corpus, tokenizador, versiónes y el procedimiento completo para que otro perito pueda reproducirlo.
ANÁLISIS ESTILOMÉTRICO — ESQUEMA DE TRABAJO
Texto sospechoso: Artículo de opinión (2.100 palabras)
Corpus de referencia del autor: 15 artículos previos (31.000 palabras)
Corpus LLM de referencia: 50 textos GPT-4 (50.000 palabras)
RESULTADOS:
1. DELTA DE BURROWS
Δ(sospechoso, autor_humano) = 1.42
Δ(sospechoso, corpus_GPT4) = 0.38
→ El texto está MUCHO más cerca del estilo GPT-4
2. LONGITUD DE ORACIONES
Autor humano: μ=18.3, σ=12.7 (burstiness=0.69)
Texto sospechoso: μ=21.1, σ=5.4 (burstiness=0.26)
GPT-4 típico: μ=20.8, σ=5.1 (burstiness=0.25)
→ Burstiness del sospechoso coincide con GPT-4
3. PALABRAS FUNCIONALES (top 5 diferencias)
Palabra | Autor | Sospechoso | GPT-4
"pero" | 1.8% | 0.4% | 0.5%
"además" | 0.2% | 1.1% | 1.3%
"sin | 0.9% | 0.3% | 0.4%
embargo"
"es | 0.1% | 0.8% | 0.9%
importante"
"cabe" | 0.0% | 0.6% | 0.7%
→ Perfil funcional coincide con GPT-4
4. VOCABULARIO ÚNICO
Autor humano: 347 hapax (42% del vocabulario)
Texto sospechoso: 189 hapax (29% del vocabulario)
GPT-4 típico: 195 hapax (31% del vocabulario)
→ Riqueza léxica del sospechoso es típica de GPT-4
CONCLUSIÓN ESTILOMÉTRICA:
El perfil estilístico del texto sospechoso presenta
una distancia estadísticamente significativa respecto
al estilo habitual del autor, y coincide con los
patrones típicos de GPT-4 en todas las métricas
analizadas. Nivel de confianza: alto (>90%).Metodología forense para detección de texto IA
Protocolo completo
Recepción del encargo: Documentar por escrito qué se pide analizar, quién lo solicita (orden judicial, parte procesal, institución educativa), y cuáles son las preguntas concretas a responder.
Preservación de evidencia: Obtener el documento original en su formato nativo. Calcular hash SHA-256. Crear copia de trabajo. Si es Google Docs, solicitar exportación del historial de revisiones vía API. Documentar toda la cadena de custodia.
Análisis automatizado con varias herramientas: contrastar más de un detector ayuda, pero conviene saber por qué: no crea independencia estadística. Los detectores comparten arquitectura y datos de entrenamiento, y se equivocan de forma correlacionada —especialmente con texto no nativo—. No hay norma que fije un número mínimo; lo que el manual de buenas prácticas de ENFSI exige es validar el procedimiento concreto que se emplea. Documentar versión exacta de cada herramienta y fecha de análisis. Capturar pantalla de cada resultado con timestamp. Registrar configuración utilizada.
Análisis de metadatos: Extraer metadatos con ExifTool/Apache Tika. Analizar tiempos de edición vs. extensión del documento. Examinar bloques de revisión (rsid en Word). Si disponible, analizar historial de Google Docs carácter por carácter.
Análisis estilométrico: Si hay corpus de referencia del supuesto autor, calcular Delta de Burrows y métricas de distancia. Analizar perplejidad, burstiness y entropía manualmente. Comparar patrones de vocabulario funcional. Medir riqueza léxica y distribución de n-gramas.
Verificación de contenido: Comprobar todas las citas, referencias y datos estadísticos. Buscar alucinaciones (información falsa pero plausible). Verificar coherencia interna del documento. Detectar inconsistencias con el conocimiento del supuesto autor.
Análisis por secciones: No analizar solo el documento completo. Segmentar por secciones y analizar cada una individualmente. Detectar transiciones de estilo (posible mezcla humano/IA). Identificar secciones con perplejidad significativamente diferente.
Triangulación de resultados: Consolidar hallazgos de todas las fuentes de análisis. Identificar convergencias (indicadores que apuntan en la misma dirección). Documentar divergencias (indicadores contradictorios). Determinar nivel de confianza global.
Elaboración del informe: Redactar informe pericial con estructura clara. Incluir metodología, herramientas y versiónes. Documentar todas las limitaciones. Expresar conclusiones como probabilidad, no como certeza. Incluir anexos con datos brutos y capturas.
Nivel de confianza y comunicación de resultados
GRADACIÓN DE CONCLUSIONES — SIN PORCENTAJES
Advertencia previa: circula una escala que asigna a cada nivel
un porcentaje (>95%, 85-95%, 70-85%...). NO SE USA AQUI, y no
debe usarse en un dictamen. Esos números no salen de ningún
modelo probabilistico ni de calibracion alguna: convierten en
probabilidad el hecho de que varias herramientas coincidan, y
varias herramientas correlacionadas que se equivocan a la vez
no son evidencia independiente.
La gradación util es verbal y describe QUÉ sostiene cada nivel:
NIVEL 5 — MUY ALTA
"Con un alto grado de probabilidad, el texto fue generado
por un modelo de inteligencia artificial."
Requisitos: Convergencia de todas las herramientas + metadatos
+ estilometría + alucinaciones verificadas.
NIVEL 4 — ALTA
"Los indicios analizados son consistentes con la generación
por inteligencia artificial, con alta probabilidad."
Requisitos: Convergencia de herramientas + al menos 2
indicadores independientes adicionales.
NIVEL 3 — MEDIA
"Existen indicios significativos de que el texto fue
generado total o parcialmente por IA, aunque no es
posible afirmarlo con certeza."
Requisitos: Mayoría de herramientas coinciden pero
hay factores atenuantes.
NIVEL 2 — BAJA
"Los resultados del análisis no son concluyentes.
Existen indicios tanto a favor como en contra de
la generación por IA."
Nota: Documentar todos los factores y dejar la
valoración al tribunal.
NIVEL 1 — NO CONCLUYENTE
"El análisis no permite determinar si el texto fue
generado por IA. Las herramientas y técnicas utilizadas
no proporcionan resultados significativos."
Nota: Ser honesto. Un resultado no concluyente es
un resultado válido e importante.Marco legal en España
Ámbito académico
| Situación | Normativa aplicable | Consecuencia |
|---|---|---|
| TFG/TFM con IA | Normativa académica universitaria | Suspenso, repetición, expediente |
| Examen con IA | Reglamento de evaluación | Anulación, sanción disciplinaria |
| Tesis doctoral con IA | Normativa de doctorado | Revocación del título |
| Artículo científico | Políticas editoriales | Retracción, sanción ANECA |
| Oposiciones | Ley del Estatuto del Empleado Público | Exclusión del proceso selectivo |
Ámbito judicial
| Situación | Base legal | Consecuencia |
|---|---|---|
| Escrito procesal con IA no declarada | Art. 247 LEC (mala fe) | Multa 180-6.000 € |
| Citas jurisprudenciales falsas (alucinación) | Art. 247 LEC + responsabilidad | Multa + posible inhabilitación |
| Informe pericial elaborado con asistencia de IA sin validación ni declaración | Arts. 335-352 LEC | No hay nulidad automática ni delito automático. El art. 459 CP exige que el perito falte a la verdad maliciosamente en su dictamen; usar una herramienta no es faltar a la verdad. Lo que sí ocurre es que el dictamen pierde credibilidad en la valoración por sana crítica |
| Documento contractual defectuoso por IA | Art. 1101 CC (daños) | Indemnización por daños |
| Falsedad documental | Arts. 390-395 CP | 6 meses-3 años prisión |
Instrucción CGPJ 2/2026
INSTRUCCIÓN 2/2026 DEL CGPJ
Sobre el uso de inteligencia artificial en la
administración de justicia
Aspectos relevantes para detección de texto IA:
1. VALIDACION CRITICA (ordinal Octavo)
- Prohibido incorporar contenidos generados por IA
sin validacion critica personal
- La Instrucción NO impone declarar el uso de IA
2. RESPONSABILIDAD
- El profesional que usa IA es responsable del
contenido generado
- No puede delegar la responsabilidad en la herramienta
3. VERIFICACIÓN
- Obligación de verificar la exactitud de los datos
generados por IA
- Especial atención a citas jurisprudenciales
NOTA DE ALCANCE
- La Instrucción regula el uso de IA POR JUECES Y
MAGISTRADOS. En su texto no aparecen las palabras
"perito", "pericial" ni "dictamen".
- No reconoce la validez de informes de detección de
texto IA, ni impone metodología alguna para ello.AI Act y obligaciones de transparencia
OBLIGACIONES DEL AI ACT PARA TEXTO GENERADO
Artículo 50.2 — obliga a los PROVEEDORES:
Quienes suministren sistemas que generen contenido
sintético de audio, imagen, vídeo O TEXTO deben garantizar
que las salidas queden marcadas en formato legible por
máquina y sean detectables como generadas o manipuladas
artificialmente. NO se limita al contenido de interés
público: esa restriccion no esta en el apartado.
Artículo 50.4 — obliga a los RESPONSABLES DEL DESPLIEGUE:
· Parrafo primero: quien genere o manipule un DEEPFAKE
—imagen, audio o vídeo— debe revelar que es artificial.
· Parrafo separado: quien genere o manipule TEXTO que se
publique para informar al público sobre asuntos de
interés público debe revelarlo, salvo que haya control
editorial humano y alguien asuma la responsabilidad.
Es este segundo parrafo, y no el 50.2, el que introduce el
criterio de "interés público". El artículo estaba contando
un apartado por el otro.
Sanciones (art. 99). El Reglamento no las clasifica por
gravedad, sino por el supuesto infringido:
- Prácticas prohibidas del art. 5: hasta 35 millones €
o el 7% del volumen de negocios mundial
- Incumplimiento de las demás obligaciones: hasta 15
millones € o el 3%Falsedad documental (arts. 390-395 CP)
Una cita inventada no es, por sí sola, falsedad documental
Estos tipos no se activan porque un documento contenga un dato falso. Exigen una conducta falsaria de las descritas en el art. 390 —simular el documento, alterarlo en un elemento esencial, suponer intervenciones que no hubo, faltar a la verdad en la narración de los hechos—, y dependen además de la clase de documento, de quién es el autor y, en el art. 395, de la finalidad de perjudicar a otro.
Un escrito con una sentencia alucinada por un modelo se combate por la vía del art. 247 LEC, no automáticamente por la penal.
| Artículo | Supuesto | Pena | Cuándo podría entrar en juego |
|---|---|---|---|
| 390 | Autoridad o funcionario que comete falsedad en documento público | 3-6 años + inhabilitación | Solo si concurre una de las conductas falsarias del precepto y el autor tiene esa condición |
| 392 | Particular que comete falsedad en documento público, oficial o mercantil | 6 meses-3 años | Requiere la conducta falsaria, no basta un contenido inexacto |
| 395 | Falsedad en documento privado | 6 meses-2 años | Exige además ánimo de perjudicar a otro |
Mala fe procesal y detección de IA
Sobre el uso de IA por profesionales del derecho, este sitio analiza en detalle el caso del abogado multado por 48 sentencias falsas. El caso internacional identificado y documentado es Mata v. Avianca (Distrito Sur de Nueva York, 2023), donde el tribunal impuso una sanción de 5.000 dólares a los letrados por presentar citas inexistentes generadas con ChatGPT. Para España circula la afirmación de que «varios juzgados ya han sancionado» por lo mismo: no se reproduce aquí, porque no se ha localizado ninguna resolución con tribunal, fecha, número de procedimiento ni ROJ o ECLI que la sostenga. Y ninguna norma obliga hoy al abogado a declarar el uso de IA; la Instrucción CGPJ 2/2026 se dirige a jueces y magistrados y les exige validar críticamente —no declarar— el contenido generado por IA.
Estándares internacionales
ISO y normativa técnica
| Estándar | Área | Relevancia |
|---|---|---|
| ISO 27037 | Evidencia digital | Marco de preservación aplicable |
| ISO/IEC 42001 | Gestión de IA | Sistema de gestión para organizaciones que usan IA |
| ISO/IEC 23894 | Gestión de riesgos IA | Evaluación de riesgos incluyendo detección |
| NIST AI RMF | Framework de riesgos IA | Estándar estadounidense complementario |
ENFSI (European Network of Forensic Science Institutes)
BUENAS PRÁCTICAS DE ENFSI PARA EVIDENCIA DIGITAL (ed. 2015)
Alcance real: el manual NO trata de inteligencia artificial, ni
de texto generado, ni contiene una escala de detección. Lo que
aporta son principios generales de trabajo pericial, y son estos
los que se trasladan por analogía a este análisis:
1. COMPETENCIA DEL PERITO
- Formación documentada en el área de análisis
- Actualización continua de conocimientos
- Participación en pruebas de competencia
2. VALIDACIÓN DE MÉTODOS
- Toda herramienta de detección debe estar validada
- Documentar precisión, falsos positivos/negativos
- Realizar pruebas con muestras conocidas
3. ASEGURAMIENTO DE CALIDAD
- Procedimientos documentados
- Trazabilidad de todas las acciones
- Control de versiónes de herramientas
4. EXPRESIÓN DE RESULTADOS
- Expresar el alcance y las limitaciones del metodo
- No atribuir al manual una escala de probabilidad para
detección de IA: no la contiene
- Comunicar incertidumbre y limitaciones
- No hacer afirmaciones absolutasLimitaciones y consideraciones éticas
Limitaciones técnicas fundamentales
| Limitación | Descripción | Impacto |
|---|---|---|
| Imposibilidad teórica | No existe prueba de que la detección perfecta sea posible | Siempre habrá incertidumbre |
| Carrera armamentística | Modelos mejoran → detección mejora → evasión mejora | Nunca será un problema “resuelto” |
| Sesgo de entrenamiento | Herramientas entrenadas mayoritariamente en inglés | Menor precisión en otros idiomas |
| Sesgo contra no nativos | Escritores no nativos producen texto más “regular” | Riesgo de discriminación |
| Edición humana | Cualquier edición reduce la detectabilidad | Textos mixtos son los más difíciles |
| Modelos futuros | Modelos aún no lanzados podrían ser indetectables | Herramientas actuales podrían quedar obsoletas |
Consideraciones éticas
DILEMAS ÉTICOS EN DETECCIÓN DE TEXTO IA
1. PRESUNCIÓN DE INOCENCIA
¿Debe asumirse que un texto es humano hasta que
se demuestre lo contrario?
→ En contexto judicial: SÍ (presunción de inocencia)
→ En contexto académico: depende de la política
2. DERECHO A LA HERRAMIENTA
¿Tiene un autor derecho a usar IA sin declararlo?
→ Depende del contexto y la normativa aplicable
→ El AI Act impone obligaciones de transparencia
→ Pero no todo uso de IA es ilegítimo
3. DISCRIMINACIÓN POR IDIOMA
Las herramientas son menos precisas en español.
¿Es justo aplicar el mismo estándar?
→ El perito debe comunicar esta limitación
→ Ajustar las conclusiones al nivel de precisión real
4. ESTIGMATIZACIÓN
Un falso positivo puede destruir una carrera académica
o profesional. ¿Se debe usar detección de IA como
única prueba?
→ NUNCA como prueba única
→ Siempre como parte de un análisis más amplio
→ Comunicar explícitamente la tasa de falsos positivos
5. ACCESO DESIGUAL
Las herramientas de evasión son accesibles para
quien pueda pagarlas. ¿Crea esto una inequidad?
→ La detección es más fácil contra texto IA "bruto"
→ La evasión sofisticada deja otros rastrosNunca acusar basándose solo en una herramienta
Acusar a alguien de usar IA basándose únicamente en el resultado de una herramienta automatizada es irresponsable y potencialmente injusto. Los falsos positivos existen, y su magnitud no está medida de forma independiente: los rangos que publican los propios fabricantes proceden de parte interesada. Cualquier conclusión debe basarse en la convergencia de múltiples indicadores independientes, y el informe debe documentar la tasa de error de cada método utilizado.
Futuro de la detección de texto IA
Tendencias 2026-2028
| Tendencia | Descripción | Impacto esperado |
|---|---|---|
| Marcado técnico del contenido sintético | El art. 50.2 del AI Act exige que la salida sea marcada en formato legible por máquina y detectable; no impone una técnica concreta ni «marcas de agua» como tal | Facilitará la detección en la medida en que los proveedores lo implementen |
| Modelos más “humanos” | GPT-5, Claude 5 producirán texto menos detectable | Técnicas actuales perderán eficacia |
| Detección multimodal | Analizar texto + metadatos + comportamiento conjunto | Mayor precisión por triangulación |
| IA para detectar IA | Clasificadores cada vez más sofisticados | Carrera armamentística continua |
| Estándares forensics | ISO específico para detección de contenido IA | Mayor rigor metodológico |
| Regulación armonizada | AI Act + normativa nacional | Marco legal claro |
| Herramientas locales | Detección sin enviar texto a la nube | Mejor privacidad |
| Detección en español | Modelos específicos para español | Reducción de la brecha de precisión |
Tecnologías emergentes
TECNOLOGÍAS EN DESARROLLO
1. DETECCIÓN POR EMBEDDING
Análisis del espacio vectorial de embeddings:
- Los textos IA ocupan regiones específicas
del espacio de embeddings
- Clasificación por posición geométrica
- Prometedor pero aún experimental
2. ANÁLISIS TEMPORAL DE ESCRITURA
Sensores que registran el proceso de escritura:
- Dinámica de pulsaciones de teclado
- Movimientos del ratón
- Pausas y correcciones
- OJO: es un indicio, no una garantía. El registro
de tecleo son datos como cualesquiera otros y se
pueden sintetizar o reproducir; lo que aporta es
coherencia con el resto, no imposibilidad
3. BLOCKCHAIN DE CONTENIDO
Registro inmutable de EXISTENCIA (no de autoría):
- Hash del contenido en blockchain
- Timestamp verificable
- Cadena de modificaciones
- Interoperable con C2PA
- OJO: acredita que ESE contenido existía en ESE
momento y que no se ha alterado desde entonces.
NO acredita quién lo escribió: cualquiera puede
registrar el hash de un documento ajeno
4. VERIFICACIÓN ZERO-KNOWLEDGE
Demostrar autoría sin revelar el contenido:
- Pruebas criptográficas de proceso de escritura
- Privacidad del contenido preservada
- Verificación por terceros
5. CLASSIFICADORES ESPECÍFICOS POR IDIOMA
Modelos entrenados exclusivamente en español:
- Mayor precisión para textos en español
- Consideración de regionalismos
- Adaptación a textos legales españolesRecomendaciones prácticas
Para el perito informático
Mantener un kit de herramientas actualizado: Revisar trimestralmente las herramientas de detección. Actualizar versiónes y calibrar con muestras conocidas. Incorporar nuevas herramientas a medida que se publiquen.
Usar siempre múltiples métodos: nunca basar una conclusión en una sola herramienta. Y no por alcanzar un número: porque los detectores automáticos fallan de forma correlacionada, de modo que lo que aporta valor es cruzar familias distintas de indicio —automático, estilométrico y documental—, no acumular detectores. Combinar herramientas automatizadas con análisis de metadatos + análisis manual. Ideal: añadir estilometría si hay corpus de referencia.
Documentar exhaustivamente: Versiones de herramientas, configuraciones, fechas de análisis. Capturas de pantalla con timestamp de cada resultado. Cadena de custodia completa de la evidencia.
Comunicar limitaciones honestamente: Expresar resultados como probabilidad, no certeza. Incluir tasas de falsos positivos de cada herramienta. Señalar factores que podrían afectar la fiabilidad (idioma, longitud, dominio).
Conocer el marco legal actualizado: AI Act, Instrucción CGPJ 2/2026, jurisprudencia reciente. Las obligaciones de transparencia evolucionan rápidamente.
Formación continua: Asistir a conferencias de NLP y forense digital. Leer papers actualizados de ACL, EMNLP, NeurIPS. Practicar con muestras conocidas para calibrar el criterio.
Ser imparcial: El perito trabaja para la verdad, no para quien le contrata. Si el análisis no es concluyente, debe decirlo claramente. Un resultado honesto de incertidumbre es más valioso que una conclusión forzada.
Considerar el contexto completo: La detección técnica es solo una parte. El comportamiento del supuesto autor, el tiempo disponible, la consistencia con trabajos anteriores, y la verificación del contenido son complementos esenciales.
Para instituciones educativas
| Recomendación | Prioridad | Implementación |
|---|---|---|
| Política clara de uso de IA | Crítica | Definir qué está permitido y qué no |
| Formación al profesorado | Alta | Talleres sobre herramientas de detección |
| Evaluaciones adaptadas | Alta | Diseñar evaluaciones resistentes a IA |
| Herramienta institucional | Media | Antes de contratar una licencia, exigir al proveedor la versión evaluada, el corpus de validación y su tratamiento de los datos que se le suben: un detector al que se le envía prueba de un procedimiento es un tercero que la procesa |
| Protocolo de investigación | Alta | Procedimiento ante sospecha de uso de IA |
| Proporcionalidad de sanciones | Alta | No criminalizar, educar |
Para empresas
| Recomendación | Prioridad | Implementación |
|---|---|---|
| Política de uso de IA | Crítica | Definir usos aceptables e inaceptables |
| Revisión de documentos críticos | Alta | Verificar contratos, informes regulatorios |
| Cumplimiento AI Act | Crítica | Auditar sistemas IA propios |
| Formación a empleados | Alta | Uso responsable de IA generativa |
| Cláusulas contractuales | Media | Requisitos de autoría en contratos con proveedores |
Para abogados
| Recomendación | Prioridad | Implementación |
|---|---|---|
| Declarar uso de IA | Recomendable, no obligatorio | Ninguna norma española lo impone hoy; declararlo es la práctica que mejor resiste un interrogatorio |
| Verificar TODAS las citas | Crítica | Comprobar sentencias y legislación citadas |
| Revisar coherencia | Alta | Leer y verificar todo texto generado por IA |
| Conocer la Instrucción CGPJ 2/2026 | Alta | Se dirige a jueces y magistrados, no al abogado, pero fija el listón con que el tribunal mirará el escrito |
| Contratar perito si es necesario | Media | Para casos que requieran análisis forense |
Conclusión
La detección de texto generado por inteligencia artificial es un campo técnico complejo y en rápida evolución que se ha convertido en una necesidad práctica en múltiples ámbitos: educación, justicia, empresa y administración pública. Ninguna herramienta ni técnica es infalible, y la precisión varía según el idioma, la longitud del texto, el modelo generador y las técnicas de evasión empleadas. Que la detección funciona peor fuera del inglés es constatable; ponerle un decimal, no.
Para el perito informático, la detección de texto IA requiere un enfoque multidisciplinar que combine herramientas automatizadas, análisis de metadatos, estilometría computacional, verificación de contenido y análisis contextual. La honestidad sobre las limitaciones y la expresión de resultados en términos de probabilidad (no de certeza) son esenciales para que el informe pericial tenga valor y credibilidad ante tribunales.
El marco legal evoluciona rápidamente: el AI Act impone obligaciones de transparencia y marcado de contenido generado por IA, la Instrucción CGPJ 2/2026 regula el uso de IA en la administración de justicia, y la jurisprudencia comienza a abordar las consecuencias del uso no declarado de IA. El perito informático forense especializado en esta materia ocupa una posición cada vez más relevante en el sistema judicial.
¿Tienes un caso con evidencia digital de por medio?
Una valoración previa dice qué evidencia existe, en qué estado está y si es técnicamente preservable, antes de invertir en el procedimiento.
Referencias y fuentes
Mitchell, E. et al. (2023). “DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature”. Proceedings of ICML 2023. Método estadístico de detección.
Hans, A. et al. (2024). “Spotting LLMs With Binoculars: Zero-Shot Detection of Machine-Generated Text”. arXiv:2401.12070. Herramienta open source de detección.
Weber-Wulff, D. et al. (2023). “Testing of Detection Tools for AI-Generated Text”. International Journal for Educational Integrity, 19(26). Evaluación comparativa de herramientas.
Kirchenbauer, J. et al. (2023). “A Watermark for Large Language Models”. Proceedings of ICML 2023. Watermarking estadístico de texto IA.
Sadasivan, V. et al. (2023). “Can AI-Generated Text be Reliably Detected?”. arXiv:2303.11156. Análisis de limitaciones fundamentales.
C2PA (Coalition for Content Provenance and Authenticity). “Technical Specification v2.1” (2025). Estándar de procedencia de contenido digital.
Google DeepMind (2024). “SynthID Text: Scalable Watermarking for Language Models”. Documentación técnica de SynthID.
Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo (AI Act). Artículo 50 sobre obligaciones de transparencia.
Instrucción 2/2026 del Consejo General del Poder Judicial. Directrices sobre uso de IA en la administración de justicia.
Burrows, J. (2002). “‘Delta’: A Measure of Stylistic Difference and a Guide to Likely Authorship”. Literary and Linguistic Computing, 17(3), 267-287. Fundamento de la estilometría computacional.
Liang, W. et al. (2024). “Monitoring AI-Modified Content at Scale”. arXiv:2403.07183. Detección a escala de contenido modificado por IA.
Última actualización: 27 de agosto de 2026 Categoría: Técnico Código: TEC-065
Preguntas Frecuentes
¿Cómo puedo saber si un texto fue escrito por ChatGPT?
Existen herramientas como GPTZero, Originality.ai y Copyleaks que analizan patrones estadísticos del texto. Sin embargo, ninguna es 100% fiable. Para un resultado más robusto, se recomienda combinar varias herramientas con análisis manual de estilo, verificación de contenido y, si está disponible, análisis de metadatos del documento.
¿Son fiables las herramientas de detección de texto IA en español?
No hay validación independiente que permita dar una cifra. Las tasas de acierto que publican los fabricantes proceden de sus propias pruebas, con sus propios corpus, y no se han replicado para el español. El dato más elocuente es otro: OpenAI retiró su propio clasificador en 2023 por su baja fiabilidad. En un dictamen, la detección automática se usa como indicio a contrastar, nunca como conclusión.
¿Se puede usar un informe de detección de texto IA como prueba en un juicio?
Puede aportarse como dictamen de perito de parte, pero conviene no prometer más: cumplir una lista de requisitos no predetermina que el tribunal lo admita ni el peso que le dé. El tribunal lo valorará por sana crítica (art. 348 LEC), y en esta materia la fuerza del dictamen depende sobre todo de que declare sus limitaciones. Lo exigible al perito es aplicar una metodología rigurosa, contrastar familias distintas de indicio, documentar las limitaciones y mantener la cadena de custodia. Los tribunales valoran la transparencia sobre tasas de error y falsos positivos.
¿Qué consecuencias legales tiene presentar como propio un texto generado por IA?
Depende del contexto: en el ámbito académico puede suponer la anulación del trabajo; en un procedimiento judicial, apreciarse mala fe procesal (art. 247 LEC) si concurren sus requisitos; y en una relación contractual, un posible incumplimiento. Lo que NO hace el AI Act es sancionar con carácter general a quien presenta como propio un texto asistido por IA: su art. 50 reparte obligaciones concretas entre proveedores y determinados responsables del despliegue, y las multas se dirigen a esos sujetos, no a cualquier autor.
¿Necesitas un peritaje forense?
Si necesitas ayuda profesional con análisis forense digital, estoy aquí para ayudarte.
Solicitar Consulta Gratuita
