IbervalumCumplimiento y ciberseguridad para pymes

Informe técnico independiente · Agosto 2026

Hondurasgate: análisis forense de la verificación de audio

Sobre las inconsistencias de los «Informes Forenses de Autenticación de Voz» publicados por hondurasgate.ch

Autor: Miguel Penadés — Consultor de ciberseguridad y cumplimientoFecha: Agosto 2026
Nota editorial

Este informe no analiza si las grabaciones de Hondurasgate son reales o falsas. Esa pregunta requiere acceso a los archivos originales a su resolución nativa — archivos que nunca han sido publicados.

Este informe analiza exclusivamente el método de verificación utilizado y demuestra, con evidencia reproducible, que dicho método no prueba lo que afirma probar.

Declaración de independencia

Investigación personal y autofinanciada: el coste íntegro del experimento fueron 22 $. Sin encargo, sin cliente y sin relación con ninguna de las partes — ni hondurasgate.ch, ni Drop Site News, ni Earshot, ni Phonexia.

La historia en un párrafo: hondurasgate.ch presentó sus 37 audios como verificados con el software forense de Phonexia. Phonexia niega toda participación, exigió la retirada de su nombre, y hondurasgate borró las referencias en cinco horas. El «panel de verificación» es una interfaz fabricada que ningún producto de Phonexia genera, ejecutada sobre audio degradado a 8.000 Hz — la resolución que elimina justo las frecuencias donde se detecta la síntesis por IA. Y la prueba de que el método no prueba nada: un clon de voz creado en dos horas por 22 dólares pasa exactamente la misma verificación.

1Contexto: qué es Hondurasgate

El 30 de abril de 2026, la plataforma anónima hondurasgate.ch — operando desde Suiza en colaboración con Canal Red (España) y Diario Red — publicó 37 grabaciones de audio extraídas supuestamente de WhatsApp, Signal y Telegram. Los audios se atribuyen al ex presidente hondureño Juan Orlando Hernández (JOH), al presidente actual Nasry Asfura y al diputado Tomás Zambrano, entre otros.

Las grabaciones alegan una conspiración internacional para desestabilizar gobiernos de izquierda en América Latina con apoyo de Estados Unidos, Israel y Argentina.

Para respaldar la autenticidad de estos audios, hondurasgate.ch publicó lo que llamó un «dossier forense» con informes individuales de verificación de cada archivo. Estos informes llevan el nombre y logo de Phonexia Voice Inspector, una empresa checa de análisis forense de voz.

Este informe analiza dichos informes de verificación.

REF Hondurasgate en Wikipedia: en.wikipedia.org/wiki/Hondurasgate

2Qué afirman: el panel de verificación forense

Hondurasgate publicó, para cada uno de los 37 audios, un panel de verificación en su web y un informe descargable en PDF. El panel muestra:

Panel de hondurasgate.ch: sello verde VOZ HUMANA CONFIRMADA, seis métricas con barras, confianza 88,9 %, probabilidad IA 5,39 % y hash SHA-256
PRUEBA N.º 1El panel de «verificación» de hondurasgate.ch: sello «✓ VOZ HUMANA CONFIRMADA», seis métricas con barras de progreso, confianza 88,9 %, probabilidad IA 5,39 % y hash 217dd2ca… — presentado como «Phonexia · Voice Inspector».

Cada uno de estos elementos contiene un error fundamental. Los analizamos uno por uno.

3Error 1 — Phonexia no participó

El 20 de mayo de 2026, Phonexia publicó un comunicado oficial en su blog corporativo:

Hechos clave del comunicado

Hondurasgate confirmó a Contracorriente (medio independiente hondureño fundado por la periodista Jennifer Ávila) que usó el branding de Phonexia «sin contar con una autorización comercial explícita».

En cinco horas, el sitio web reemplazó todas las referencias a Phonexia por un supuesto «HG Forensics» — una entidad sin presencia verificable en ningún registro.

No defendieron los informes cuando los pillaron: los borraron. Cuando pasó el foco, los volvieron a colgar.

REF Comunicado de Phonexia: phonexia.com/blog/statement-regarding-honduras-gate…

REF Contracorriente (18 may 2026), «Phonexia niega el uso de su herramienta en Hondurasgate» — documenta «HG Forensics» y la ventana de cinco horas: contracorriente.red

REF Análisis vía Dromómanos/Substack: dromomanos.substack.com

4Error 2 — Producto equivocado, herramienta equivocada

Los informes del panel afirman haber utilizado Phonexia Voice Inspector. Esto revela un malentendido fundamental sobre qué hace este software.

¿Qué es Phonexia Voice Inspector?

Phonexia Voice Inspector es un software forense de escritorio diseñado para comparación de hablantes — es decir, para determinar si el Hablante A en una grabación es la misma persona que el Hablante B en otra. Es una herramienta de identificación de identidad vocal, no un detector de deepfakes.

Lo que los informes pretenden hacer — determinar si un audio fue generado por IA o grabado por un humano — requiere un producto completamente diferente. Phonexia ofrece tres herramientas para eso:

Lo que necesitabanLo que usaron (supuestamente)
Authenticity Verification (verificación de autenticidad)Voice Inspector (comparación de hablantes)
Deepfake Detection (detección de deepfakes)Voice Inspector (comparación de hablantes)
Referential Deepfake Detection (detección referencial)Voice Inspector (comparación de hablantes)

Es como usar un microscopio para medir la temperatura. La herramienta es real. El uso es absurdo.

Nota técnica 1

La documentación oficial de Phonexia describe Voice Inspector como herramienta de comparación de hablantes («automatic forensic voice comparisons in compliance with the ENFSI guidelines») — no como detector de síntesis. La detección de voz artificial es un producto distinto de Phonexia («Deepfake Detection»). Además, la lista oficial de tecnologías de la Speech Platform 4 (Age Estimation, Authenticity Verification, Deepfake Detection, Speaker Identification, Speech to Text, etc.) no contiene ninguna tecnología ni endpoint llamado «voiceinspector». El panel afirma haber usado un endpoint REST (/technologies/voiceinspector) que no existe en la documentación.

REF Voice Inspector, comparación de hablantes: docs.phonexia.com

REF Deepfake Detection, producto distinto: docs.phonexia.com

REF Lista oficial de tecnologías de Speech Platform 4 (sin «voiceinspector»): docs.phonexia.com

5Error 3 — La interfaz es inventada

El panel de hondurasgate.ch muestra un veredicto visual: una insignia verde con el texto «VOZ HUMANA CONFIRMADA» (o «HUMAN VOICE CONFIRMED»), rodeada de barras de progreso coloreadas para seis métricas.

Phonexia Voice Inspector no produce este tipo de output. El software real devuelve:

Caja del panel que afirma procesamiento por la API REST de Phonexia con el endpoint POST /technologies/voiceinspector y botón de descarga del audio a 6 kHz con +5 dB de ganancia
PRUEBA N.º 2La caja «Procesado por la API REST de Phonexia» del panel: cita el endpoint POST /technologies/voiceinspector, que no existe en la documentación de Phonexia. Debajo, el botón «Descargar audio original» ofrece un OGG/OPUS a 6 kHz con +5 dB de ganancia, es decir, un derivado y no el archivo original.

La interfaz visual del panel fue diseñada por los creadores de hondurasgate.ch, no por Phonexia. El «motor forense» es una fachada gráfica montada sobre un proceso desconocido.

REF Formato de salida real de Phonexia Deepfake Detection: score numérico JSON, escala −10 (real) a +10 (deepfake). Ver capturas del producto real en la sección de demostración.

6Error 4 — El audio fue destruido antes de analizarlo

La propia metodología publicada por hondurasgate.ch describe un pipeline —una cadena de procesamiento— de 9 pasos para cada audio antes de analizarlo. El paso 4 es el crítico:

Paso 4 del pipeline: re-codificación

Cada archivo se re-codifica a:

Después de este paso, se calcula el hash SHA-256 sobre el archivo resultante.

¿Qué significa esto?

En lenguaje simple

WhatsApp graba audio a 16.000 Hz como mínimo. Signal, a 44.100 Hz. Reducir a 8.000 Hz es como fotocopiar un documento a color en blanco y negro al 25 % de resolución y luego analizarlo con lupa. La información que permite distinguir una voz real de una clonada vive en las frecuencias altas — precisamente las que este proceso elimina.

Datos técnicos

2 El Teorema de Nyquist-Shannon establece que la máxima frecuencia reproducible en una señal digital es la mitad de su frecuencia de muestreo. A 8.000 Hz de muestreo, nada por encima de 4.000 Hz puede representarse.
3 Los modelos modernos de síntesis de voz (ElevenLabs, CosyVoice, Fish Audio) producen audio de altísima calidad en frecuencias bajas. Las diferencias con una voz real se concentran en las altas frecuencias: sibilantes ligeramente demasiado limpias, caída armónica no-natural, transiciones formánticas que no corresponden a un tracto vocal físico. Eliminando las frecuencias altas, se elimina la evidencia.

REF Parámetros de grabación de Signal, hardcodeados en su código fuente (signal.org no los documenta): notas de voz a 44.100 Hz mono, AAC-LC 32 kbps, en Android e iOS; la versión de escritorio usa MP3 a 90 kbps al sample rate del sistema (típicamente 48 kHz). Constantes en Signal-Android · MediaRecorderWrapper.java, líneas 19-21.

Análisis de bitstream mostrando codec SILK, 8000 Hz, narrowband
PRUEBA N.º 3Análisis de bitstream del archivo publicado: codec SILK en modo narrowband, 8.000 Hz. El techo espectral es absoluto.

Verificamos esto con análisis de bitstream —la lectura byte a byte del archivo comprimido, sin reproducirlo— del audio publicado:

ParámetroValor medido
CodecSILK (narrowband)
Frecuencia de muestreo8.000 Hz
ModoNB (4k) — narrowband
Frame20 ms
Mean packet bytes34.2
Energía por encima de 4 kHz0.000008 %

El techo espectral es absoluto. No hay información por encima de 4 kHz.

La comparación visual lo dice todo: el espectrograma de una nota de voz real a 48.000 Hz muestra energía hasta ~16.000 Hz; el del audio publicado por hondurasgate.ch se corta en seco en los 4.000 Hz. Todo el espacio negro de la mitad inferior es la evidencia que su pipeline eliminó.

Espectrogramas comparados en ejes idénticos de 0 a 24 kHz: arriba, nota de voz real a 48 kHz con energía hasta 16 kHz; abajo, el audio Tomás a JOH de hondurasgate con techo espectral en 4 kHz
PRUEBA N.º 4Misma escala, dos mundos: arriba, una nota de voz real a 48 kHz (energía hasta ~16 kHz); abajo, el audio «Tomás a JOH» publicado por hondurasgate.ch — techo espectral en 4.000 Hz. Generado con ffmpeg (showspectrumpic), reproducible con el comando de la Sección 15.

7Error 5 — La cadena de custodia no existe

Los informes presentan un hash SHA-256 como «cadena de custodia» para cada archivo. Pero:

Problema 1: el hash se calcula sobre el archivo degradado, no el original.

El pipeline de hondurasgate.ch funciona así:

El hash no prueba nada sobre el audio original. Solo prueba que el archivo publicado no fue modificado después de la degradación. Es como certificar la autenticidad de una fotocopia.

Problema 2: un hash auto-publicado es tautológico.

Hondurasgate controla tanto el archivo como el hash. Un hash solo tiene valor como cadena de custodia si es generado por un tercero independiente en el momento de la recepción del material original. Aquí, la misma entidad que publica el audio es la que calcula y publica el hash. Es como si un sospechoso firmara su propia coartada.

En lenguaje simple

Imagina que alguien te da una fotografía y dice «te juro que es auténtica, mira el número de serie que yo mismo le puse». Eso es lo que hace el hash aquí.

8Error 6 — Métricas biológicamente imposibles

El panel de hondurasgate.ch para el audio «Tomás a JOH: buscamos el delito…» (hash 217dd2ca…, el mismo archivo de la Sección 7) presenta métricas biométricas junto al veredicto «VOZ HUMANA CONFIRMADA». Estas métricas se contradicen a sí mismas:

MétricaValor reportadoRango normal humano¿Posible?
Shimmer local71,96 %< 5 %❌ NO
Jitter8,75 %< 1–2 %❌ NO
HNR (ratio armónico/ruido)−4,9 dB> 10 dB❌ NO
Eventos respiratorios / minuto~6312–20❌ NO

Los PDF de otros audios muestran el mismo patrón imposible: shimmer entre el 53 % y el 72 % y HNR negativo en todos los archivos muestreados.

Tabla de métricas del panel de hondurasgate: shimmer 71,964 %, jitter 8,753 %, HNR -4,90 dB, 63,46 eventos respiratorios por minuto
PRUEBA N.º 5Las métricas del propio panel: shimmer 71,964 %, jitter 8,753 %, HNR −4,90 dB y 63,46 respiraciones/min — junto al motor declarado «Phonexia Speech Platform 3.2.1 · Voice Inspector» y el hash 217dd2ca….
Nota técnica 4

Shimmer mide la variación de amplitud entre ciclos vocales consecutivos. En voz normal, varía menos del 5 %. Un 72 % indica daño vocal severo o audio corrupto. Jitter mide la variación de frecuencia fundamental entre ciclos. Un 8,75 % es patológico — más allá del rango de cualquier trastorno de voz documentado. HNR (Harmonics-to-Noise Ratio) mide cuánta energía en el audio proviene de la voz frente al ruido. Un valor negativo (−4,9 dB) significa que hay más ruido que voz — el audio es esencialmente ininteligible. Estos valores son inconsistentes con el veredicto «VOZ HUMANA CONFIRMADA». Fuentes: literatura estándar de patología vocal, Journal of Voice, y manuales de Praat (software de análisis fonético).

Estos valores no corresponden a una voz humana sana ni a una voz humana enferma. Corresponden a audio severamente degradado o corrupto. Sin embargo, el informe concluye «VOZ HUMANA CONFIRMADA» con 88,9 % de confianza.

La explicación más probable: las métricas son cálculos reales de una librería de análisis acústico (probablemente librosa en Python, que aparece en la metodología publicada) ejecutados sobre el audio degradado, y el veredicto se pega encima independientemente de lo que digan los números.

9Error 7 — Error de copiar y pegar en la plantilla

El disclaimer legal al pie de cada informe dice:

«Un veredicto con un 99,4 % de confianza…»

El veredicto del propio PDF dice 88,0 % de confianza (y el panel web del mismo audio, 88,9 %). Ninguno de los dos coincide con el disclaimer.

Es un error de plantilla. El texto legal se escribió para un ejemplo genérico y nunca se actualizó para cada informe individual. Los 37 informes probablemente se generaron automáticamente con un script que inserta el veredicto en un template fijo — pero alguien olvidó parametrizar el disclaimer.

Es un detalle menor comparado con los errores anteriores. Pero revela el nivel de descuido: no hubo revisión humana de los informes antes de publicarlos.

10Error 8 — Etiquetas forenses decorativas

Los informes incluyen referencias a dos estándares internacionales:

Ambas referencias son decorativas:

Incluir estas siglas en un informe que no sigue ninguno de los dos estándares es como llevar en el parabrisas la pegatina de la ITV —la inspección técnica de vehículos— sin haber pasado nunca por la estación.

11Demostración: cloné mi voz y pasé la verificación

Para demostrar que el método de verificación usado por hondurasgate.ch no discrimina entre voz real y voz sintética, realicé el siguiente experimento con mi propia voz:

Paso 1: crear un clon de voz con ElevenLabs

Pantalla de configuración de Professional Voice Clone en ElevenLabs
PRUEBA N.º 6Configuración del Professional Voice Clone en ElevenLabs.
Medidor de calidad de subida mostrando 1 hora y 3 minutos de audio aportado
PRUEBA N.º 7Medidor de calidad: 1 hora y 3 minutos de audio de entrenamiento aportado.
Lista de notas de voz de WhatsApp subidas como material de entrenamiento
PRUEBA N.º 8Notas de voz de WhatsApp del autor usadas como material de entrenamiento.
En lenguaje simple

ElevenLabs es un servicio comercial de clonación de voz. Por 22 dólares al mes, cualquier persona con una hora de audio de alguien puede crear una copia sintética de su voz que habla lo que tú escribas. No se necesita ningún conocimiento técnico.

Paso 2: generar audio sintético

Con el clon de mi voz, generé un audio de texto neutro en español. Luego procesé ese audio por el mismo pipeline descrito en la metodología de hondurasgate.ch: degradación a 8 kHz, re-codificación a Opus 16 kbps mono.

Paso 3: enviarlo al detector de deepfakes REAL de Phonexia

No usé la interfaz fabricada de hondurasgate.ch. Usé el producto real de Phonexia: Phonexia Deepfake Detection, accesible a través de su demo / API.

Interfaz real de Phonexia Deepfake Detection: los tres archivos con scores -0.79, -0.79 y -1.91, y la explicación de la escala de -10 a +10
PRUEBA N.º 9La interfaz REAL de Phonexia Deepfake Detection: los tres archivos del experimento con sus scores (−0.79 / −0.79 / −1.91), la escala de −10 a +10 y el veredicto «Likely authentic». Compárese con la fachada de la Prueba n.º 1: ni sellos, ni barras, ni «confirmada».

Resultado

ArchivoScore PhonexiaVeredicto
copia-test-honduras.ogg (mi voz clonada)−0.79🟢 Likely authentic
audio-2.ogg (otra muestra sintética)−0.79🟢 Likely authentic
tomas-a-joh-busca… (archivo de hondurasgate)−1.91🟢 Likely authentic
El hallazgo central

Mi voz clonada por IA obtuvo el mismo score que los audios de hondurasgate.ch en el detector REAL de Phonexia.

La escala de Phonexia Deepfake Detection va de −10 (probablemente real) a +10 (probablemente deepfake). Un score de −0.79 se clasifica como «likely authentic» — es decir, el detector real de Phonexia no distingue mi clon de voz de un audio real.

¿Qué demuestra esto?

No demuestra que los audios de hondurasgate sean falsos. Demuestra que un veredicto «voz humana confirmada» no es evidencia de autenticidad. Si un clon de voz creado en una hora por 22 dólares pasa la misma verificación, esa verificación no tiene valor probatorio.

Costes totales del experimento

ConceptoCoste
ElevenLabs Creator (1 mes)$22 USD
Acceso a Phonexia Deepfake Detection$0 (demo gratuita)
Total$22 USD
Tiempo total< 2 horas

12Earshot: lo que dice (y lo que no dice) el análisis independiente

Drop Site News encargó un análisis independiente a Earshot (earshot.ngo), una organización británica sin ánimo de lucro especializada en investigación sonora forense, dirigida por Lawrence Abu Hamdan. Existen dos informes distintos de Earshot, y conviene no confundirlos.

Informe 1 (mayo 2026): tres archivos, confianza moderada

Encargado por Drop Site News. Earshot analizó tres archivos (dos de Hernández, uno de Asfura) y concluyó que son «grabaciones auténticas de las voces de Hernández y Asfura y probablemente no fueron generadas por IA». Reconoció explícitamente:

Método: análisis de «artefactos de audio como respiraciones, hesitaciones vocales, ruidos de fondo, ruido ambiental y distorsión de micrófono», más una comparación de voz por machine learning con el programa Resemblyzer — todo sobre archivos ya degradados.

REF Drop Site News / Informe Earshot 1: dropsitenews.com

Informe 2 (25 julio 2026): doce archivos, «highly likely»

Un segundo informe, posterior, también encargado por Drop Site News (la ampliación a doce grabaciones la pidió un periodista hondureño anónimo), cubre doce grabaciones (seis de Hernández, tres de Asfura, dos de María Antonieta Mejía, una de Cosette López) y concluye que las doce son «highly likely» auténticas y no generadas por IA. Este informe añade dos elementos que el primero no tenía:

Es importante ser preciso: la subida de «confianza moderada» (3 archivos) a «highly likely» (12 archivos) no es una inflación de Earshot — es su propio lenguaje en su propio documento. La crítica de este informe no es que exagere sus conclusiones, sino que su metodología responde a una pregunta más estrecha que la que los titulares le atribuyen (desarrollado en la Sección 13).

REF Informe Earshot 2 (25 jul 2026): earshot.ngo/investigations

Lo que ninguno de los dos informes hizo

Conviene señalar además la propia defensa de hondurasgate.ch, aunque sea contradictoria: dijo a Drop Site que accedió a Phonexia con «acceso comercial estándar de usuario único y API» sin colaboración formal, mientras Diario Red habló de acceso vía la consola web del proveedor con credenciales de colaboradores externos. Ambas versiones no pueden ser ciertas a la vez, y Phonexia niega toda relación de licencia.

El problema no es la honestidad de Earshot, que fue considerable en ambos documentos. El problema es cómo se citan: titulares como «audios confirmados como auténticos» colapsan los matices que Earshot sí incluyó, y presentan una verificación de alcance limitado como una certificación de autenticidad total.


WITNESS Deepfake Rapid Response Force

Separadamente, WITNESS (organización de derechos humanos con sede en Nueva York) movilizó su Deepfake Rapid Response Force — una red de ~40 expertos en forensía de medios. Sus conclusiones sobre tres archivos de hondurasgate.ch, ante una solicitud de Criterio.hn, fueron mixtas: un archivo probablemente real, dos con fuertes indicios de manipulación por IA (incluida posible clonación de voz). El propio peritaje advierte que, por las limitaciones de la tecnología, los resultados no son concluyentes. WITNESS no ha publicado un informe formal completo.

REF Criterio.hn (8 jun 2026): criterio.hn

REF WITNESS DRRF: gen-ai.witness.org

13Earshot se apoya en una herramienta obsoleta — y prueba el ataque equivocado

Aquí está el fallo de fondo, y es serio. Earshot sostiene su veredicto sobre dos pilares: la escucha de artefactos y una comparación de voz con Resemblyzer. El primer pilar —la afirmación de que ciertos sonidos (respiraciones, chasquidos, distorsiones) «la IA no los puede reproducir»— descansa entero sobre una sola herramienta de clonación de voz: Coqui TTS. Y Coqui es un cadáver técnico.

La empresa Coqui AI cerró a finales de 2023. Sus servicios comerciales se apagaron en enero de 2024. El código quedó como proyecto comunitario abandonado, sin soporte ni desarrollo, bajo una licencia (CPML) que ni siquiera permite uso comercial. Su modelo, XTTS-v2, era bueno para 2023 — hace tres años, una eternidad en este campo. En 2026 está en el fondo de cualquier ranking serio.

Aclaración imprescindible

Quien usa Coqui es Earshot, no hondurasgate.ch. hondurasgate ni siquiera generaba audio (dice detectar síntesis con Phonexia — Secciones 3-4). Coqui es la única herramienta de generación que Earshot nombra en todo su informe (nota al pie 2 → repositorio de coqui-ai), y la usa como control negativo —la vara con la que decide qué puede y qué no puede hacer la IA—: entrena el modelo, observa qué sonidos no consigue imitar y trata esos sonidos como prueba de autenticidad. Tres usos: respiraciones con chasquido de labios/dientes (§2.1.1), distorsiones de micrófono (§2.1.3) y el marco general de reproducibilidad (§1).

Y ahí se derrumba el pilar. Cuando Earshot afirma que «la IA no reproduce» cierta respiración o cierta distorsión, lo único que ha demostrado es que un modelo descatalogado de 2023 no la reproduce. Su hallazgo no dice absolutamente nada sobre ElevenLabs, Fish Audio, CosyVoice 2, Chatterbox ni ninguna herramienta que un falsificador real usaría hoy. Es un control negativo que no controla nada.

En lenguaje simple

Hay una liga pública donde los sintetizadores de voz se enfrentan y el público vota cuál suena más humano. El modelo de Coqui puntúa ~886. Los líderes actuales pasan de 1500 — capturado en vivo el 10 de agosto de 2026: los cinco primeros del ranking puntúan entre 1543 y 1574. Un modelo gratuito de 82 millones de parámetros (Kokoro, ~86 MB en su versión comprimida) que corre en el navegador de tu móvil le gana con holgura. Earshot midió contra un equipo de tercera regional de hace tres años y, a partir de ahí, concluyó que toda la liga de 2026 es incapaz.

TTS Arena V2 leaderboard en vivo: los cinco primeros modelos entre 1543 y 1574 puntos
PRUEBA N.º 10TTS Arena V2 en vivo (10-08-2026): los líderes puntúan entre 1543 y 1574. XTTS-v2, la única herramienta de generación que nombra Earshot, puntúa ~886.

REF Cierre de Coqui AI (GitHub Discussion): github.com/coqui-ai/TTS

REF TTS Arena V2, ranking de naturalidad (Hugging Face): huggingface.co/spaces/TTS-AGI

Y aún es peor: es el ataque equivocado

Aunque el modelo estuviera al día, seguiría fallando lo esencial. Todos los tests de Earshot comparan material auténtico contra generación de texto-a-voz (TTS): se alimenta texto al modelo y se mira si aparecen respiraciones, chasquidos, bostezos, plosivas o tono de sala.

Pero ese no es el ataque realista contra el audio filtrado de una figura pública. El ataque realista es conversión voz-a-voz (speech-to-speech) o empalme sobre audio real del propio hablante: un actor humano —o el propio audio público de JOH, que hay a montones— aporta de forma nativa cada uno de esos artefactos, y solo el timbre es sintético. Es un ataque más barato, no más caro, que el que Earshot sí probó.

Cada test de Earshot distingue material auténtico de TTS-desde-texto puro; ninguno distingue una conversación auténtica de una síntesis montada sobre material real del hablante. Y esto alcanza también al segundo pilar: el matching de «breath profiles» coincide por construcción si el falso se arma con audio real de JOH, y por el mismo motivo un clon construido sobre ese audio está optimizado para maximizar justo la similitud que mide Resemblyzer. Los dos pilares miden lo que un clon bien hecho ya trae de fábrica.

Y su argumento de «sample rate bajo» ya está refutado

Earshot trata el techo de ~4.500 Hz como evidencia a favor de la autenticidad: «los experimentos en curso de Earshot no han encontrado audio generado por IA con una frecuencia de muestreo tan baja» — admitiendo a la vez que cualquiera puede bajar el sample rate a mano. Es una inducción, y se refuta con una línea de comando: el mismo pipeline de la Sección 6 (ffmpeg -ar 8000 -c:a libopus -b:a 16k -application voip -frame_duration 20) produce exactamente eso — audio clonado a 8 kHz, indistinguible en clase de artefacto del material degradado. «No lo hemos visto» no es «no se puede hacer».

En una frase

La escucha crítica de Earshot está bien hecha; su prueba anti-IA, no. Está calibrada contra una herramienta muerta y contra el ataque que nadie usaría. Responde con solvencia a una pregunta irrelevante —«¿es esto texto-a-voz de 2023?»— y la presenta como respuesta a la única que importa: «¿es esto auténtico?».

14Conclusiones

Los hechos, en orden:

  1. Phonexia no participó. La empresa lo negó públicamente, exigió la retirada de su nombre y anunció acciones legales. Hondurasgate admitió haberlo usado sin autorización y borró las referencias en cinco horas.
  2. Usaron el producto equivocado. Voice Inspector compara hablantes. No detecta deepfakes. No existe el endpoint REST que afirman haber utilizado.
  3. La interfaz es fabricada. El veredicto visual «VOZ HUMANA CONFIRMADA» no es output de ningún producto de Phonexia. Es un diseño de hondurasgate.ch.
  4. El audio fue destruido antes del análisis. Re-codificar a 8 kHz / Opus 16 kbps elimina las frecuencias donde viven los artefactos de síntesis. Es analizar una fotocopia borrosa y certificar que la firma es auténtica.
  5. La cadena de custodia es circular. El hash SHA-256 se calcula sobre el archivo degradado, no sobre el original, y lo genera la misma parte que publica el audio.
  6. Las métricas son fisiológicamente imposibles. Shimmer del 72 %, jitter del 8,75 %, HNR negativo, 63 respiraciones por minuto. Ningún ser humano produce estos valores. El veredicto los ignora.
  7. Es una plantilla genérica con errores de copiar y pegar. El disclaimer legal habla de «99,4 % de confianza» cuando el PDF dice 88,0 % (y el panel web, 88,9 %).
  8. Las etiquetas ISO/ENFSI son decorativas. Ninguno de los dos estándares fue seguido.
  9. Un clon de voz creado en 2 horas por $22 pasa la misma verificación. Esto no prueba que los audios sean falsos, pero demuestra que la verificación no prueba que sean reales.

El reclamo pendiente

Si los audios de hondurasgate.ch son auténticos, existe una forma sencilla de demostrarlo: publicar los archivos originales a la frecuencia de muestreo a la que fueron grabados. WhatsApp graba a 16 kHz como mínimo; Signal, a 44,1 kHz (y su versión de escritorio, típicamente a 48 kHz). Con los archivos originales, expertos independientes pueden realizar análisis forense real: examen de sibilantes, estructura armónica, detección de empalmes, consistencia de ruido de fondo.

El hecho de que los operadores de hondurasgate.ch construyeran un pipeline de 9 pasos específicamente diseñado para destruir la evidencia de alta frecuencia antes de analizarla — y luego sellaran el resultado con un hash SHA-256 y lo llamaran «cadena de custodia» — es una decisión técnica que merece explicación.

15Metodología y reproducibilidad

Todo lo presentado en este informe es reproducible. Los pasos para replicar el experimento de clonación:

  1. Obtener ~1 hora de audio de tu propia voz (notas de voz de WhatsApp sirven)
  2. Crear una cuenta Creator en ElevenLabs ($22/mes): elevenlabs.io
  3. Usar Professional Voice Clone para crear un clon de tu voz
  4. Generar un audio de ~35 segundos con texto neutro en español
  5. Degradar el audio con ffmpeg:
ffmpeg -i input.wav -ar 8000 -c:a libopus -b:a 16k -application voip -frame_duration 20 output.ogg
  1. Enviar el archivo a Phonexia Deepfake Detection (demo disponible)
  2. Comparar el score con los archivos publicados por hondurasgate.ch

El autor invita a cualquier experto forense, periodista o investigador a reproducir estos pasos y verificar los resultados de forma independiente.

16Fuentes y referencias

Comunicados oficiales y documentos primarios

#FuenteURL
1Phonexia — Comunicado oficial sobre hondurasgate.ch (20 mayo 2026)phonexia.com/blog/…
2Phonexia Voice Inspector — Página de productophonexia.com/product/…
2bPhonexia docs — Speech Platform 4, lista de tecnologías (sin «voiceinspector»)docs.phonexia.com
2cPhonexia docs — Voice Inspector (comparación de hablantes)docs.phonexia.com
2dPhonexia docs — Deepfake Detection (producto distinto)docs.phonexia.com
3Hondurasgate — Metodología de verificación forensehondurasgate.ch/investigaciones/…
4Wikipedia — Hondurasgateen.wikipedia.org
4bSignal-Android — MediaRecorderWrapper.java (notas de voz: 44.100 Hz mono, AAC-LC 32 kbps)github.com/signalapp

Análisis independientes

#FuenteURL
5Drop Site News — Informe Earshot 1, 3 archivos («With Moderate Confidence»)dropsitenews.com
5bEarshot — Informe 2, 12 grabaciones («highly likely», 25 jul 2026)earshot.ngo
6Earshot — Organizaciónearshot.ngo
7WITNESS — Deepfake Rapid Response Forcegen-ai.witness.org
7bCriterio.hn — Peritaje WITNESS (1 real / 2 con indicios de IA; no concluyente), 8 jun 2026criterio.hn

Investigaciones periodísticas sobre la verificación

#FuenteURL
8Dromómanos / Contracorriente — «Hondurasgate y la ilusión de verdad»dromomanos.substack.com
8bContracorriente (18 may 2026) — «Phonexia niega el uso de su herramienta…» («HG Forensics», cinco horas)contracorriente.red
9Memetic Warfare — «¿Donde Esta la Phonexia?»memeticwarfare.io

Coqui TTS y rankings

#FuenteURL
10GitHub — Coqui TTS shutdown discussiongithub.com/coqui-ai/TTS
11TTS Arena V2 — Hugging Face leaderboardhuggingface.co

ElevenLabs

#FuenteURL
12ElevenLabs — Plataforma de clonación de vozelevenlabs.io
13ElevenLabs — Pricing (Creator plan, $22/mes)Verificable en elevenlabs.io/pricing

Cobertura mediática (selección)

#FuenteURL
14The American Prospect — «In Latin America, Trump Is Bringing Back That Old-Time Imperialism» (5 ago 2026)prospect.org
15La Jornada — Confirmación parcial de autenticidadjornada.com.mx
16People's World — Cobertura inicialpeoplesworld.org