Informe técnico independiente · Agosto 2026
Hondurasgate: análisis forense de la verificación de audio
Sobre las inconsistencias de los «Informes Forenses de Autenticación de Voz» publicados por hondurasgate.ch
Este informe no analiza si las grabaciones de Hondurasgate son reales o falsas. Esa pregunta requiere acceso a los archivos originales a su resolución nativa — archivos que nunca han sido publicados.
Este informe analiza exclusivamente el método de verificación utilizado y demuestra, con evidencia reproducible, que dicho método no prueba lo que afirma probar.
Investigación personal y autofinanciada: el coste íntegro del experimento fueron 22 $. Sin encargo, sin cliente y sin relación con ninguna de las partes — ni hondurasgate.ch, ni Drop Site News, ni Earshot, ni Phonexia.
La historia en un párrafo: hondurasgate.ch presentó sus 37 audios como verificados con el software forense de Phonexia. Phonexia niega toda participación, exigió la retirada de su nombre, y hondurasgate borró las referencias en cinco horas. El «panel de verificación» es una interfaz fabricada que ningún producto de Phonexia genera, ejecutada sobre audio degradado a 8.000 Hz — la resolución que elimina justo las frecuencias donde se detecta la síntesis por IA. Y la prueba de que el método no prueba nada: un clon de voz creado en dos horas por 22 dólares pasa exactamente la misma verificación.
1Contexto: qué es Hondurasgate
El 30 de abril de 2026, la plataforma anónima hondurasgate.ch — operando desde Suiza en colaboración con Canal Red (España) y Diario Red — publicó 37 grabaciones de audio extraídas supuestamente de WhatsApp, Signal y Telegram. Los audios se atribuyen al ex presidente hondureño Juan Orlando Hernández (JOH), al presidente actual Nasry Asfura y al diputado Tomás Zambrano, entre otros.
Las grabaciones alegan una conspiración internacional para desestabilizar gobiernos de izquierda en América Latina con apoyo de Estados Unidos, Israel y Argentina.
Para respaldar la autenticidad de estos audios, hondurasgate.ch publicó lo que llamó un «dossier forense» con informes individuales de verificación de cada archivo. Estos informes llevan el nombre y logo de Phonexia Voice Inspector, una empresa checa de análisis forense de voz.
Este informe analiza dichos informes de verificación.
REF Hondurasgate en Wikipedia: en.wikipedia.org/wiki/Hondurasgate
2Qué afirman: el panel de verificación forense
Hondurasgate publicó, para cada uno de los 37 audios, un panel de verificación en su web y un informe descargable en PDF. El panel muestra:
- Un veredicto en verde: VOZ HUMANA CONFIRMADA — el PDF descargable lo rebaja a «VOZ HUMANA»
- Seis métricas de autenticidad (naturalidad acústica, coherencia espectral, naturalidad de pitch, microprosodia, respiración, consistencia de fondo)
- Una probabilidad de IA (5,39 %) y una confianza (88,9 % en el panel; 88,0 % en los PDF)
- Un hash SHA-256 —una huella digital criptográfica del archivo— como «cadena de custodia»
- El sello «Phonexia Speech Platform 3.2.1 · Voice Inspector», y referencias a ISO 27037 y ENFSI BPM
- Una sección de procesamiento vía «API REST de Phonexia»

217dd2ca… — presentado como «Phonexia · Voice Inspector».Cada uno de estos elementos contiene un error fundamental. Los analizamos uno por uno.
3Error 1 — Phonexia no participó
El 20 de mayo de 2026, Phonexia publicó un comunicado oficial en su blog corporativo:
- El software de Phonexia no se utilizó en relación con los materiales de hondurasgate.ch
- Todas las referencias a Phonexia fueron realizadas sin autorización
- No existe ninguna relación comercial, técnica, de licencia o de asociación con los operadores de estas publicaciones
- Los materiales contienen numerosas inexactitudes factuales, conceptuales y técnicas sobre la tecnología de Phonexia
- Phonexia ha exigido formalmente la eliminación inmediata de todas las referencias no autorizadas
Hondurasgate confirmó a Contracorriente (medio independiente hondureño fundado por la periodista Jennifer Ávila) que usó el branding de Phonexia «sin contar con una autorización comercial explícita».
En cinco horas, el sitio web reemplazó todas las referencias a Phonexia por un supuesto «HG Forensics» — una entidad sin presencia verificable en ningún registro.
No defendieron los informes cuando los pillaron: los borraron. Cuando pasó el foco, los volvieron a colgar.
REF Comunicado de Phonexia: phonexia.com/blog/statement-regarding-honduras-gate…
REF Contracorriente (18 may 2026), «Phonexia niega el uso de su herramienta en Hondurasgate» — documenta «HG Forensics» y la ventana de cinco horas: contracorriente.red
REF Análisis vía Dromómanos/Substack: dromomanos.substack.com
4Error 2 — Producto equivocado, herramienta equivocada
Los informes del panel afirman haber utilizado Phonexia Voice Inspector. Esto revela un malentendido fundamental sobre qué hace este software.
Phonexia Voice Inspector es un software forense de escritorio diseñado para comparación de hablantes — es decir, para determinar si el Hablante A en una grabación es la misma persona que el Hablante B en otra. Es una herramienta de identificación de identidad vocal, no un detector de deepfakes.
Lo que los informes pretenden hacer — determinar si un audio fue generado por IA o grabado por un humano — requiere un producto completamente diferente. Phonexia ofrece tres herramientas para eso:
| Lo que necesitaban | Lo que usaron (supuestamente) |
|---|---|
| Authenticity Verification (verificación de autenticidad) | Voice Inspector (comparación de hablantes) |
| Deepfake Detection (detección de deepfakes) | Voice Inspector (comparación de hablantes) |
| Referential Deepfake Detection (detección referencial) | Voice Inspector (comparación de hablantes) |
Es como usar un microscopio para medir la temperatura. La herramienta es real. El uso es absurdo.
La documentación oficial de Phonexia describe Voice Inspector como herramienta de comparación de hablantes («automatic forensic voice comparisons in compliance with the ENFSI guidelines») — no como detector de síntesis. La detección de voz artificial es un producto distinto de Phonexia («Deepfake Detection»). Además, la lista oficial de tecnologías de la Speech Platform 4 (Age Estimation, Authenticity Verification, Deepfake Detection, Speaker Identification, Speech to Text, etc.) no contiene ninguna tecnología ni endpoint llamado «voiceinspector». El panel afirma haber usado un endpoint REST (/technologies/voiceinspector) que no existe en la documentación.
REF Voice Inspector, comparación de hablantes: docs.phonexia.com
REF Deepfake Detection, producto distinto: docs.phonexia.com
REF Lista oficial de tecnologías de Speech Platform 4 (sin «voiceinspector»): docs.phonexia.com
5Error 3 — La interfaz es inventada
El panel de hondurasgate.ch muestra un veredicto visual: una insignia verde con el texto «VOZ HUMANA CONFIRMADA» (o «HUMAN VOICE CONFIRMED»), rodeada de barras de progreso coloreadas para seis métricas.
Phonexia Voice Inspector no produce este tipo de output. El software real devuelve:
- Un score numérico en formato JSON (escala de −10 a +10 para deepfake detection, o un likelihood ratio —un cociente de probabilidades— para comparación de hablantes)
- No genera insignias verdes, barras de progreso, ni veredictos binarios «CONFIRMADA / NO CONFIRMADA»
- No calcula las seis métricas mostradas (naturalidad acústica, coherencia espectral, etc.)

POST /technologies/voiceinspector, que no existe en la documentación de Phonexia. Debajo, el botón «Descargar audio original» ofrece un OGG/OPUS a 6 kHz con +5 dB de ganancia, es decir, un derivado y no el archivo original.La interfaz visual del panel fue diseñada por los creadores de hondurasgate.ch, no por Phonexia. El «motor forense» es una fachada gráfica montada sobre un proceso desconocido.
REF Formato de salida real de Phonexia Deepfake Detection: score numérico JSON, escala −10 (real) a +10 (deepfake). Ver capturas del producto real en la sección de demostración.
6Error 4 — El audio fue destruido antes de analizarlo
La propia metodología publicada por hondurasgate.ch describe un pipeline —una cadena de procesamiento— de 9 pasos para cada audio antes de analizarlo. El paso 4 es el crítico:
Cada archivo se re-codifica a:
- 8.000 Hz de frecuencia de muestreo (narrowband, «banda estrecha»: la calidad de una llamada telefónica antigua)
- Mono (1 canal)
- Opus a 16 kbps (compresión extrema)
- Formato contenedor: OGG
Después de este paso, se calcula el hash SHA-256 sobre el archivo resultante.
¿Qué significa esto?
WhatsApp graba audio a 16.000 Hz como mínimo. Signal, a 44.100 Hz. Reducir a 8.000 Hz es como fotocopiar un documento a color en blanco y negro al 25 % de resolución y luego analizarlo con lupa. La información que permite distinguir una voz real de una clonada vive en las frecuencias altas — precisamente las que este proceso elimina.
- Frecuencia de Nyquist a 8 kHz: 4 kHz máximo reproducible2
- Frecuencias donde se detectan artefactos de síntesis: 4–22 kHz (sibilantes, rolloff armónico, transiciones formánticas)3
- Bitrate resultante: 16 kbps (para referencia: una llamada de teléfono estándar usa 12,2 kbps)
- Tamaño de archivo resultante: ~71 KB para 35 segundos de audio
2 El Teorema de Nyquist-Shannon establece que la máxima frecuencia reproducible en una señal digital es la mitad de su frecuencia de muestreo. A 8.000 Hz de muestreo, nada por encima de 4.000 Hz puede representarse.
3 Los modelos modernos de síntesis de voz (ElevenLabs, CosyVoice, Fish Audio) producen audio de altísima calidad en frecuencias bajas. Las diferencias con una voz real se concentran en las altas frecuencias: sibilantes ligeramente demasiado limpias, caída armónica no-natural, transiciones formánticas que no corresponden a un tracto vocal físico. Eliminando las frecuencias altas, se elimina la evidencia.
REF Parámetros de grabación de Signal, hardcodeados en su código fuente (signal.org no los documenta): notas de voz a 44.100 Hz mono, AAC-LC 32 kbps, en Android e iOS; la versión de escritorio usa MP3 a 90 kbps al sample rate del sistema (típicamente 48 kHz). Constantes en Signal-Android · MediaRecorderWrapper.java, líneas 19-21.

Verificamos esto con análisis de bitstream —la lectura byte a byte del archivo comprimido, sin reproducirlo— del audio publicado:
| Parámetro | Valor medido |
|---|---|
| Codec | SILK (narrowband) |
| Frecuencia de muestreo | 8.000 Hz |
| Modo | NB (4k) — narrowband |
| Frame | 20 ms |
| Mean packet bytes | 34.2 |
| Energía por encima de 4 kHz | 0.000008 % |
El techo espectral es absoluto. No hay información por encima de 4 kHz.
La comparación visual lo dice todo: el espectrograma de una nota de voz real a 48.000 Hz muestra energía hasta ~16.000 Hz; el del audio publicado por hondurasgate.ch se corta en seco en los 4.000 Hz. Todo el espacio negro de la mitad inferior es la evidencia que su pipeline eliminó.

7Error 5 — La cadena de custodia no existe
Los informes presentan un hash SHA-256 como «cadena de custodia» para cada archivo. Pero:
Problema 1: el hash se calcula sobre el archivo degradado, no el original.
El pipeline de hondurasgate.ch funciona así:
- Reciben el audio original (formato y resolución desconocidos)
- Lo procesan por su pipeline de 9 pasos (incluyendo la degradación a 8 kHz / 16 kbps)
- Calculan el SHA-256 del archivo resultante de ese proceso
- Publican ese hash como «prueba de integridad»
El hash no prueba nada sobre el audio original. Solo prueba que el archivo publicado no fue modificado después de la degradación. Es como certificar la autenticidad de una fotocopia.
Problema 2: un hash auto-publicado es tautológico.
Hondurasgate controla tanto el archivo como el hash. Un hash solo tiene valor como cadena de custodia si es generado por un tercero independiente en el momento de la recepción del material original. Aquí, la misma entidad que publica el audio es la que calcula y publica el hash. Es como si un sospechoso firmara su propia coartada.
Imagina que alguien te da una fotografía y dice «te juro que es auténtica, mira el número de serie que yo mismo le puse». Eso es lo que hace el hash aquí.
8Error 6 — Métricas biológicamente imposibles
El panel de hondurasgate.ch para el audio «Tomás a JOH: buscamos el delito…» (hash 217dd2ca…, el mismo archivo de la Sección 7) presenta métricas biométricas junto al veredicto «VOZ HUMANA CONFIRMADA». Estas métricas se contradicen a sí mismas:
| Métrica | Valor reportado | Rango normal humano | ¿Posible? |
|---|---|---|---|
| Shimmer local | 71,96 % | < 5 % | ❌ NO |
| Jitter | 8,75 % | < 1–2 % | ❌ NO |
| HNR (ratio armónico/ruido) | −4,9 dB | > 10 dB | ❌ NO |
| Eventos respiratorios / minuto | ~63 | 12–20 | ❌ NO |
Los PDF de otros audios muestran el mismo patrón imposible: shimmer entre el 53 % y el 72 % y HNR negativo en todos los archivos muestreados.

217dd2ca….Shimmer mide la variación de amplitud entre ciclos vocales consecutivos. En voz normal, varía menos del 5 %. Un 72 % indica daño vocal severo o audio corrupto. Jitter mide la variación de frecuencia fundamental entre ciclos. Un 8,75 % es patológico — más allá del rango de cualquier trastorno de voz documentado. HNR (Harmonics-to-Noise Ratio) mide cuánta energía en el audio proviene de la voz frente al ruido. Un valor negativo (−4,9 dB) significa que hay más ruido que voz — el audio es esencialmente ininteligible. Estos valores son inconsistentes con el veredicto «VOZ HUMANA CONFIRMADA». Fuentes: literatura estándar de patología vocal, Journal of Voice, y manuales de Praat (software de análisis fonético).
Estos valores no corresponden a una voz humana sana ni a una voz humana enferma. Corresponden a audio severamente degradado o corrupto. Sin embargo, el informe concluye «VOZ HUMANA CONFIRMADA» con 88,9 % de confianza.
La explicación más probable: las métricas son cálculos reales de una librería de análisis acústico (probablemente librosa en Python, que aparece en la metodología publicada) ejecutados sobre el audio degradado, y el veredicto se pega encima independientemente de lo que digan los números.
9Error 7 — Error de copiar y pegar en la plantilla
El disclaimer legal al pie de cada informe dice:
«Un veredicto con un 99,4 % de confianza…»
El veredicto del propio PDF dice 88,0 % de confianza (y el panel web del mismo audio, 88,9 %). Ninguno de los dos coincide con el disclaimer.
Es un error de plantilla. El texto legal se escribió para un ejemplo genérico y nunca se actualizó para cada informe individual. Los 37 informes probablemente se generaron automáticamente con un script que inserta el veredicto en un template fijo — pero alguien olvidó parametrizar el disclaimer.
Es un detalle menor comparado con los errores anteriores. Pero revela el nivel de descuido: no hubo revisión humana de los informes antes de publicarlos.
10Error 8 — Etiquetas forenses decorativas
Los informes incluyen referencias a dos estándares internacionales:
- ISO 27037 — Directrices para la identificación, recogida, adquisición y preservación de evidencia digital
- ENFSI BPM — Best Practice Manual de la European Network of Forensic Science Institutes para comparación de hablantes
Ambas referencias son decorativas:
- ISO 27037 exige que la cadena de custodia se establezca desde el momento de la adquisición del material original. Aquí, los archivos originales nunca se publicaron y la cadena comienza después de un pipeline de degradación.
- ENFSI BPM cubre la metodología de comparación de hablantes (¿es el Hablante A la misma persona que el Hablante B?). Los informes de hondurasgate.ch no comparan hablantes — afirman detectar síntesis por IA. El estándar ENFSI no aplica a esa pregunta.
Incluir estas siglas en un informe que no sigue ninguno de los dos estándares es como llevar en el parabrisas la pegatina de la ITV —la inspección técnica de vehículos— sin haber pasado nunca por la estación.
11Demostración: cloné mi voz y pasé la verificación
Para demostrar que el método de verificación usado por hondurasgate.ch no discrimina entre voz real y voz sintética, realicé el siguiente experimento con mi propia voz:
Paso 1: crear un clon de voz con ElevenLabs



- Plataforma: ElevenLabs (elevenlabs.io)
- Método: Professional Voice Clone (fine-tuning del modelo sobre muestras del hablante)
- Material de entrenamiento: ~1 hora de notas de voz de WhatsApp en español (mis propias grabaciones)
- Plan utilizado: Creator ($22 USD/mes)
- Tiempo de configuración: menos de 1 hora (incluye subir archivos y esperar el procesamiento)
ElevenLabs es un servicio comercial de clonación de voz. Por 22 dólares al mes, cualquier persona con una hora de audio de alguien puede crear una copia sintética de su voz que habla lo que tú escribas. No se necesita ningún conocimiento técnico.
Paso 2: generar audio sintético
Con el clon de mi voz, generé un audio de texto neutro en español. Luego procesé ese audio por el mismo pipeline descrito en la metodología de hondurasgate.ch: degradación a 8 kHz, re-codificación a Opus 16 kbps mono.
Paso 3: enviarlo al detector de deepfakes REAL de Phonexia
No usé la interfaz fabricada de hondurasgate.ch. Usé el producto real de Phonexia: Phonexia Deepfake Detection, accesible a través de su demo / API.

Resultado
| Archivo | Score Phonexia | Veredicto |
|---|---|---|
| copia-test-honduras.ogg (mi voz clonada) | −0.79 | 🟢 Likely authentic |
| audio-2.ogg (otra muestra sintética) | −0.79 | 🟢 Likely authentic |
| tomas-a-joh-busca… (archivo de hondurasgate) | −1.91 | 🟢 Likely authentic |
Mi voz clonada por IA obtuvo el mismo score que los audios de hondurasgate.ch en el detector REAL de Phonexia.
La escala de Phonexia Deepfake Detection va de −10 (probablemente real) a +10 (probablemente deepfake). Un score de −0.79 se clasifica como «likely authentic» — es decir, el detector real de Phonexia no distingue mi clon de voz de un audio real.
¿Qué demuestra esto?
No demuestra que los audios de hondurasgate sean falsos. Demuestra que un veredicto «voz humana confirmada» no es evidencia de autenticidad. Si un clon de voz creado en una hora por 22 dólares pasa la misma verificación, esa verificación no tiene valor probatorio.
Costes totales del experimento
| Concepto | Coste |
|---|---|
| ElevenLabs Creator (1 mes) | $22 USD |
| Acceso a Phonexia Deepfake Detection | $0 (demo gratuita) |
| Total | $22 USD |
| Tiempo total | < 2 horas |
12Earshot: lo que dice (y lo que no dice) el análisis independiente
Drop Site News encargó un análisis independiente a Earshot (earshot.ngo), una organización británica sin ánimo de lucro especializada en investigación sonora forense, dirigida por Lawrence Abu Hamdan. Existen dos informes distintos de Earshot, y conviene no confundirlos.
Informe 1 (mayo 2026): tres archivos, confianza moderada
Encargado por Drop Site News. Earshot analizó tres archivos (dos de Hernández, uno de Asfura) y concluyó que son «grabaciones auténticas de las voces de Hernández y Asfura y probablemente no fueron generadas por IA». Reconoció explícitamente:
- El nivel de confianza es «moderado», no alto.
- La calidad de los tres archivos es «limitada debido a su naturaleza telefónica».
- No pudieron hacer una determinación con certeza.
Método: análisis de «artefactos de audio como respiraciones, hesitaciones vocales, ruidos de fondo, ruido ambiental y distorsión de micrófono», más una comparación de voz por machine learning con el programa Resemblyzer — todo sobre archivos ya degradados.
REF Drop Site News / Informe Earshot 1: dropsitenews.com
Informe 2 (25 julio 2026): doce archivos, «highly likely»
Un segundo informe, posterior, también encargado por Drop Site News (la ampliación a doce grabaciones la pidió un periodista hondureño anónimo), cubre doce grabaciones (seis de Hernández, tres de Asfura, dos de María Antonieta Mejía, una de Cosette López) y concluye que las doce son «highly likely» auténticas y no generadas por IA. Este informe sí añade dos elementos que el primero no tenía:
- Un marco de reproducibilidad en el que Earshot entrena un programa de clonación de voz para comprobar qué artefactos puede o no puede reproducir la IA (ver Sección 13).
- Matching de «breath profiles»: identificación de respiraciones precedidas por un chasquido de labios o dientes, contrastadas con grabaciones conocidas del hablante.
Es importante ser preciso: la subida de «confianza moderada» (3 archivos) a «highly likely» (12 archivos) no es una inflación de Earshot — es su propio lenguaje en su propio documento. La crítica de este informe no es que exagere sus conclusiones, sino que su metodología responde a una pregunta más estrecha que la que los titulares le atribuyen (desarrollado en la Sección 13).
REF Informe Earshot 2 (25 jul 2026): earshot.ngo/investigations
Lo que ninguno de los dos informes hizo
- No verificaron la cadena de custodia ni el origen de los archivos.
- No tuvieron acceso a los archivos originales previos a la degradación — trabajaron sobre el mismo OGG/OPUS a 8 kHz que publicó hondurasgate.ch.
- No reprodujeron el ataque realista (conversión voz-a-voz o empalme sobre material real del hablante); solo probaron generación de texto-a-voz (ver Sección 13).
- El propio Informe 2 recomienda explícitamente que un lingüista hispanohablante analice acento y dialecto — algo que, hasta donde consta, nadie ha hecho.
Conviene señalar además la propia defensa de hondurasgate.ch, aunque sea contradictoria: dijo a Drop Site que accedió a Phonexia con «acceso comercial estándar de usuario único y API» sin colaboración formal, mientras Diario Red habló de acceso vía la consola web del proveedor con credenciales de colaboradores externos. Ambas versiones no pueden ser ciertas a la vez, y Phonexia niega toda relación de licencia.
El problema no es la honestidad de Earshot, que fue considerable en ambos documentos. El problema es cómo se citan: titulares como «audios confirmados como auténticos» colapsan los matices que Earshot sí incluyó, y presentan una verificación de alcance limitado como una certificación de autenticidad total.
WITNESS Deepfake Rapid Response Force
Separadamente, WITNESS (organización de derechos humanos con sede en Nueva York) movilizó su Deepfake Rapid Response Force — una red de ~40 expertos en forensía de medios. Sus conclusiones sobre tres archivos de hondurasgate.ch, ante una solicitud de Criterio.hn, fueron mixtas: un archivo probablemente real, dos con fuertes indicios de manipulación por IA (incluida posible clonación de voz). El propio peritaje advierte que, por las limitaciones de la tecnología, los resultados no son concluyentes. WITNESS no ha publicado un informe formal completo.
REF Criterio.hn (8 jun 2026): criterio.hn
REF WITNESS DRRF: gen-ai.witness.org
13Earshot se apoya en una herramienta obsoleta — y prueba el ataque equivocado
Aquí está el fallo de fondo, y es serio. Earshot sostiene su veredicto sobre dos pilares: la escucha de artefactos y una comparación de voz con Resemblyzer. El primer pilar —la afirmación de que ciertos sonidos (respiraciones, chasquidos, distorsiones) «la IA no los puede reproducir»— descansa entero sobre una sola herramienta de clonación de voz: Coqui TTS. Y Coqui es un cadáver técnico.
La empresa Coqui AI cerró a finales de 2023. Sus servicios comerciales se apagaron en enero de 2024. El código quedó como proyecto comunitario abandonado, sin soporte ni desarrollo, bajo una licencia (CPML) que ni siquiera permite uso comercial. Su modelo, XTTS-v2, era bueno para 2023 — hace tres años, una eternidad en este campo. En 2026 está en el fondo de cualquier ranking serio.
Quien usa Coqui es Earshot, no hondurasgate.ch. hondurasgate ni siquiera generaba audio (dice detectar síntesis con Phonexia — Secciones 3-4). Coqui es la única herramienta de generación que Earshot nombra en todo su informe (nota al pie 2 → repositorio de coqui-ai), y la usa como control negativo —la vara con la que decide qué puede y qué no puede hacer la IA—: entrena el modelo, observa qué sonidos no consigue imitar y trata esos sonidos como prueba de autenticidad. Tres usos: respiraciones con chasquido de labios/dientes (§2.1.1), distorsiones de micrófono (§2.1.3) y el marco general de reproducibilidad (§1).
Y ahí se derrumba el pilar. Cuando Earshot afirma que «la IA no reproduce» cierta respiración o cierta distorsión, lo único que ha demostrado es que un modelo descatalogado de 2023 no la reproduce. Su hallazgo no dice absolutamente nada sobre ElevenLabs, Fish Audio, CosyVoice 2, Chatterbox ni ninguna herramienta que un falsificador real usaría hoy. Es un control negativo que no controla nada.
Hay una liga pública donde los sintetizadores de voz se enfrentan y el público vota cuál suena más humano. El modelo de Coqui puntúa ~886. Los líderes actuales pasan de 1500 — capturado en vivo el 10 de agosto de 2026: los cinco primeros del ranking puntúan entre 1543 y 1574. Un modelo gratuito de 82 millones de parámetros (Kokoro, ~86 MB en su versión comprimida) que corre en el navegador de tu móvil le gana con holgura. Earshot midió contra un equipo de tercera regional de hace tres años y, a partir de ahí, concluyó que toda la liga de 2026 es incapaz.

REF Cierre de Coqui AI (GitHub Discussion): github.com/coqui-ai/TTS
REF TTS Arena V2, ranking de naturalidad (Hugging Face): huggingface.co/spaces/TTS-AGI
Y aún es peor: es el ataque equivocado
Aunque el modelo estuviera al día, seguiría fallando lo esencial. Todos los tests de Earshot comparan material auténtico contra generación de texto-a-voz (TTS): se alimenta texto al modelo y se mira si aparecen respiraciones, chasquidos, bostezos, plosivas o tono de sala.
Pero ese no es el ataque realista contra el audio filtrado de una figura pública. El ataque realista es conversión voz-a-voz (speech-to-speech) o empalme sobre audio real del propio hablante: un actor humano —o el propio audio público de JOH, que hay a montones— aporta de forma nativa cada uno de esos artefactos, y solo el timbre es sintético. Es un ataque más barato, no más caro, que el que Earshot sí probó.
Cada test de Earshot distingue material auténtico de TTS-desde-texto puro; ninguno distingue una conversación auténtica de una síntesis montada sobre material real del hablante. Y esto alcanza también al segundo pilar: el matching de «breath profiles» coincide por construcción si el falso se arma con audio real de JOH, y por el mismo motivo un clon construido sobre ese audio está optimizado para maximizar justo la similitud que mide Resemblyzer. Los dos pilares miden lo que un clon bien hecho ya trae de fábrica.
Y su argumento de «sample rate bajo» ya está refutado
Earshot trata el techo de ~4.500 Hz como evidencia a favor de la autenticidad: «los experimentos en curso de Earshot no han encontrado audio generado por IA con una frecuencia de muestreo tan baja» — admitiendo a la vez que cualquiera puede bajar el sample rate a mano. Es una inducción, y se refuta con una línea de comando: el mismo pipeline de la Sección 6 (ffmpeg -ar 8000 -c:a libopus -b:a 16k -application voip -frame_duration 20) produce exactamente eso — audio clonado a 8 kHz, indistinguible en clase de artefacto del material degradado. «No lo hemos visto» no es «no se puede hacer».
En una frase
La escucha crítica de Earshot está bien hecha; su prueba anti-IA, no. Está calibrada contra una herramienta muerta y contra el ataque que nadie usaría. Responde con solvencia a una pregunta irrelevante —«¿es esto texto-a-voz de 2023?»— y la presenta como respuesta a la única que importa: «¿es esto auténtico?».
14Conclusiones
Los hechos, en orden:
- Phonexia no participó. La empresa lo negó públicamente, exigió la retirada de su nombre y anunció acciones legales. Hondurasgate admitió haberlo usado sin autorización y borró las referencias en cinco horas.
- Usaron el producto equivocado. Voice Inspector compara hablantes. No detecta deepfakes. No existe el endpoint REST que afirman haber utilizado.
- La interfaz es fabricada. El veredicto visual «VOZ HUMANA CONFIRMADA» no es output de ningún producto de Phonexia. Es un diseño de hondurasgate.ch.
- El audio fue destruido antes del análisis. Re-codificar a 8 kHz / Opus 16 kbps elimina las frecuencias donde viven los artefactos de síntesis. Es analizar una fotocopia borrosa y certificar que la firma es auténtica.
- La cadena de custodia es circular. El hash SHA-256 se calcula sobre el archivo degradado, no sobre el original, y lo genera la misma parte que publica el audio.
- Las métricas son fisiológicamente imposibles. Shimmer del 72 %, jitter del 8,75 %, HNR negativo, 63 respiraciones por minuto. Ningún ser humano produce estos valores. El veredicto los ignora.
- Es una plantilla genérica con errores de copiar y pegar. El disclaimer legal habla de «99,4 % de confianza» cuando el PDF dice 88,0 % (y el panel web, 88,9 %).
- Las etiquetas ISO/ENFSI son decorativas. Ninguno de los dos estándares fue seguido.
- Un clon de voz creado en 2 horas por $22 pasa la misma verificación. Esto no prueba que los audios sean falsos, pero demuestra que la verificación no prueba que sean reales.
El reclamo pendiente
Si los audios de hondurasgate.ch son auténticos, existe una forma sencilla de demostrarlo: publicar los archivos originales a la frecuencia de muestreo a la que fueron grabados. WhatsApp graba a 16 kHz como mínimo; Signal, a 44,1 kHz (y su versión de escritorio, típicamente a 48 kHz). Con los archivos originales, expertos independientes pueden realizar análisis forense real: examen de sibilantes, estructura armónica, detección de empalmes, consistencia de ruido de fondo.
El hecho de que los operadores de hondurasgate.ch construyeran un pipeline de 9 pasos específicamente diseñado para destruir la evidencia de alta frecuencia antes de analizarla — y luego sellaran el resultado con un hash SHA-256 y lo llamaran «cadena de custodia» — es una decisión técnica que merece explicación.
15Metodología y reproducibilidad
Todo lo presentado en este informe es reproducible. Los pasos para replicar el experimento de clonación:
- Obtener ~1 hora de audio de tu propia voz (notas de voz de WhatsApp sirven)
- Crear una cuenta Creator en ElevenLabs ($22/mes): elevenlabs.io
- Usar Professional Voice Clone para crear un clon de tu voz
- Generar un audio de ~35 segundos con texto neutro en español
- Degradar el audio con ffmpeg:
ffmpeg -i input.wav -ar 8000 -c:a libopus -b:a 16k -application voip -frame_duration 20 output.ogg
- Enviar el archivo a Phonexia Deepfake Detection (demo disponible)
- Comparar el score con los archivos publicados por hondurasgate.ch
El autor invita a cualquier experto forense, periodista o investigador a reproducir estos pasos y verificar los resultados de forma independiente.
16Fuentes y referencias
Comunicados oficiales y documentos primarios
| # | Fuente | URL |
|---|---|---|
| 1 | Phonexia — Comunicado oficial sobre hondurasgate.ch (20 mayo 2026) | phonexia.com/blog/… |
| 2 | Phonexia Voice Inspector — Página de producto | phonexia.com/product/… |
| 2b | Phonexia docs — Speech Platform 4, lista de tecnologías (sin «voiceinspector») | docs.phonexia.com |
| 2c | Phonexia docs — Voice Inspector (comparación de hablantes) | docs.phonexia.com |
| 2d | Phonexia docs — Deepfake Detection (producto distinto) | docs.phonexia.com |
| 3 | Hondurasgate — Metodología de verificación forense | hondurasgate.ch/investigaciones/… |
| 4 | Wikipedia — Hondurasgate | en.wikipedia.org |
| 4b | Signal-Android — MediaRecorderWrapper.java (notas de voz: 44.100 Hz mono, AAC-LC 32 kbps) | github.com/signalapp |
Análisis independientes
| # | Fuente | URL |
|---|---|---|
| 5 | Drop Site News — Informe Earshot 1, 3 archivos («With Moderate Confidence») | dropsitenews.com |
| 5b | Earshot — Informe 2, 12 grabaciones («highly likely», 25 jul 2026) | earshot.ngo |
| 6 | Earshot — Organización | earshot.ngo |
| 7 | WITNESS — Deepfake Rapid Response Force | gen-ai.witness.org |
| 7b | Criterio.hn — Peritaje WITNESS (1 real / 2 con indicios de IA; no concluyente), 8 jun 2026 | criterio.hn |
Investigaciones periodísticas sobre la verificación
| # | Fuente | URL |
|---|---|---|
| 8 | Dromómanos / Contracorriente — «Hondurasgate y la ilusión de verdad» | dromomanos.substack.com |
| 8b | Contracorriente (18 may 2026) — «Phonexia niega el uso de su herramienta…» («HG Forensics», cinco horas) | contracorriente.red |
| 9 | Memetic Warfare — «¿Donde Esta la Phonexia?» | memeticwarfare.io |
Coqui TTS y rankings
| # | Fuente | URL |
|---|---|---|
| 10 | GitHub — Coqui TTS shutdown discussion | github.com/coqui-ai/TTS |
| 11 | TTS Arena V2 — Hugging Face leaderboard | huggingface.co |
ElevenLabs
| # | Fuente | URL |
|---|---|---|
| 12 | ElevenLabs — Plataforma de clonación de voz | elevenlabs.io |
| 13 | ElevenLabs — Pricing (Creator plan, $22/mes) | Verificable en elevenlabs.io/pricing |
Cobertura mediática (selección)
| # | Fuente | URL |
|---|---|---|
| 14 | The American Prospect — «In Latin America, Trump Is Bringing Back That Old-Time Imperialism» (5 ago 2026) | prospect.org |
| 15 | La Jornada — Confirmación parcial de autenticidad | jornada.com.mx |
| 16 | People's World — Cobertura inicial | peoplesworld.org |