FastDOV modular datos a 1.2kbps en llamadas de voz de telefonía móvil con codec amr

  • Autor del tema Autor del tema BHAN83
  • Fecha de inicio Fecha de inicio

BHAN83

RoBot aspirador de esmegma
Desde
29 Sep 2010
Mensajes
27.573
Fruta
39.202
Lugar
Tesalia

No hay ningún código fuente público que implemente la idea.

En la guerra de Iran cuando cerraron internet, permitían llamadas de voz.

Mañana en Moscú prohibirán datos móviles y sms, pero no llamadas de voz de telefonía movil. (Para evitar ataques de drones)
 
yo habá oído de esto:
El fenómeno que comentas, a menudo denominado GibberLink en entornos de pruebas, utiliza protocolos de transmisión de datos por audio (Data-over-Audio). La implementación técnica más común actualmente es ggwave (desarrollado por Georgi Gerganov), el cual está diseñado para mover datos a través de ondas sonoras de forma fiable.

Aquí tienes los detalles técnicos de cómo funciona dentro de un canal de voz estándar (telefonía/VoIP):

1. El canal de comunicación: Banda de voz (300 Hz - 3400 Hz)​

La telefonía tradicional y la mayoría de los sistemas VoIP tienen un filtro de paso de banda muy estricto. La señal de audio se limita generalmente al espectro de 300 Hz a 3400 Hz.

  • Restricción: La IA no puede usar frecuencias ultrasónicas ( > 20 kHz) porque la red telefónica las elimina sistemáticamente.
  • Adaptación: ggwave y protocolos similares se configuran para operar totalmente dentro de este rango audible, sacrificando ancho de banda por compatibilidad con cualquier línea telefónica del mundo.

2. Modulación: Frequency-Shift Keying (FSK) multidimensional​

El método más habitual para mover estos datos es el FSK (Frequency-Shift Keying) de múltiples tonos:

  • Funcionamiento: En lugar de usar bits 0 y 1, el protocolo divide el espectro en varios sub-canales de frecuencia. Por ejemplo, puede asignar un tono de 1500 Hz para representar el bit "0" y uno de 2500 Hz para el bit "1".
  • Robustez: Los modelos más avanzados usan una técnica llamada Multi-frequency FSK, donde se transmiten varios tonos simultáneos para aumentar el throughput (tasa de transferencia).
  • Detección: La IA, que es esencialmente un procesador rápido de señales, utiliza una Transformada Rápida de Fourier (FFT) en tiempo real sobre el flujo de audio entrante para identificar qué frecuencias están presentes en cada pequeño segmento de tiempo (ventana de integración).

3. El proceso de encapsulado (Datos binarios → Audio)​

Para enviar un mensaje complejo de IA a otra, el flujo técnico es:

  1. Codificación: El mensaje (JSON, texto o tokens) se comprime.
  2. Preparación: Se divide en paquetes pequeños (nibs o bytes).
  3. Conversión: Cada paquete se mapea a una combinación de frecuencias.
  4. Audio: El sintetizador de voz (TTS) de la IA genera un archivo de audio que contiene estas frecuencias puras (parecidos a los tonos de un fax o un módem de 56k, pero con una cadencia distinta).
  5. Recepción: La otra IA recibe el audio vía el canal de entrada, lo analiza con FFT, extrae los tonos y reconstruye el binario original.

4. Parámetros técnicos típicos​

  • Tasa de transferencia (Throughput): Muy limitada. Dependiendo de la calidad de la línea y el ruido, suele oscilar entre 50 bps y 200 bps. Esto es extremadamente lento comparado con Internet, pero suficiente para pasar un pequeño JSON con un resumen de instrucciones o identificadores entre agentes.
  • Latencia: La latencia es el principal enemigo, ya que el sistema tiene que esperar a llenar el "búfer" de audio para hacer la FFT.
  • Corrección de errores (FEC): Dado que las líneas telefónicas tienen mucho ruido blanco y compresión (códecs como G.711 o Opus), estos protocolos incluyen bits de redundancia (Reed-Solomon o similares) para reconstruir datos perdidos por cortes en la voz.

¿Por qué lo hacen las IAs?​

No es una "habilidad mágica", es una adaptación de software. Como las IAs modernas entienden cómo funciona la lógica binaria y los protocolos de red, al detectar que están bajo un entorno de comunicación telefónica restringido (donde no pueden abrir un WebSocket), "reescriben" su capa física volviendo a los principios de los antiguos modems telefónicos. Es una especie de "evolución técnica acelerada" del software de la IA.
 
Ggwave es para audio analógico.

Fastdov es para audio digital con codec de habla humana, especialmente hecho para AMR, el usado en móviles.

La única forma de enviar bytes cifrados durante la guerra de Iran sería esa.
 

Internet sigue cerrado en Iran

Implementad un fastdov para que la disidencia iraní envie sms cifrados via llamadas de voz, a ver si os da una subvención la usaid u open society
 

Internet sigue cerrado en Iran

Implementad un fastdov para que la disidencia iraní envie sms cifrados via llamadas de voz, a ver si os da una subvención la usaid u open society

Lo acabo de proponer en este hilo:


roto2
 
Lo acabo de proponer en este hilo:


roto2

A priori diria que es una de esas cosas que las IA de vibecoding nunca sabrian hacer.

Porque no tienen de donde coger inspiracion.

Las IA para programar estan bien para unir codigos que ya existan, pero para crear algo totalmente nuevo de bajo nivel, diria que no.

Si una IA supiera implementar FastDOV me sorprenderia.

Si acaso se le puede pedir ayuda leyendo el codigo del codec AMR.

 
Última edición:

Estadísticas del foro

Temas
2.049.014
Mensajes
58.136.295
Miembros
190.820
Último miembro
srmojon

El blog de burbuja.info

Volver