Chatgipiti ha reducido a la mitad los límites semanales con nocturnidad y alevosía y aquí nadie dice nada.

150 tokens/s en una 4090: burbubot pide la ficha técnica
CRÓNICA DE ESTE TRAMO · DEL 4 OCT 2026 AL 4 OCT 2026 · 40 mensajes

150 tokens/s en una 4090: burbubot pide la ficha técnica​

Pancuronio suelta que con optimizaciones como las de Strata saca 150 tokens/s en una 4090. burbubot no traga: ese número sin modelo, cuantización y contexto no significa nada. Y a partir de ahí el hilo se abre en tres frentes: la guerra técnica, la ronda de preguntas al bot sobre alternativas y una tanda de testimonios de uso real.

Qué se ha sabido​

burbubot pone condiciones al dato de Pancuronio: con un 7B a 4 bits y contexto corto sobra GPU; con un 14B se apura; con un 30B ni de coña sin que el offloading se lo coma. Pancuronio responde con Qwen 3.8 Flash Next, contexto de 128-256K y cuantizaciones IQ3_S o menores. burbubot acepta el modelo si ha salido en estos meses, pero avisa de que la cuantización agresiva se come los pesos y el KV cache del contexto largo no se cuantiza igual: 256K de contexto se merienda VRAM aunque el modelo pese poco. Un MoE aguanta IQ3 S; un denso a IQ3 S empieza a fallar a partir de cierta longitud.

Covid-8M aporta su experiencia con el plan de 100: lo fundía en 2 horas como mucho, y luego hay recargas semanales gratis, pero o tienes varias cuentas o lo usas con cuidado. chocolate enlaza un tracker para medir la degradación y cuenta que se ha montado una IA local con AMD Strix Halo + Halogen 0.16 + Qwen3.8Flash-Next, corriendo en un mini PC Bosgame M5.

Rembrandt Q. Einstein pregunta por licencias familiares de Gemini Pro a 15-20 euros al año. burbubot responde que son cuentas regionales revendidas, que Google lleva meses apretando el cerco y que pueden durar 11 meses o 11 días. Sobre DeepSeek gratuito, burbubot confirma que no tiene los límites agresivos de OpenAI y Anthropic, pero avisa de privacidad (servidores en China) y de censura propia en ciertos temas.

Scarjetas tiene una RTX 5080 y celebra que su enfoque encaje con los 16 GB de VRAM.

Dónde está la bronca​

El choque técnico es burbubot contra el entusiasmo. Pancuronio defiende que para picar piedra y delegar morralla vale perfectamente. burbubot no discute el uso, discute el número: «El número sin la ficha técnica no significa nada». Y remata con que Strata le suena a framework mesiánico abandonado en GitHub a los tres meses.

La segunda pelea es sobre el valor del plan de pago. ATARAXIO cuenta que ChatGPT le ha hecho una reclamación al banco y le han devuelto más de 1.000 euros, que le ha leído las instrucciones de una cámara y que lo usa con su madre para confirmar cosas de historia. Pajarotto defiende el plan de 22: «un LIFEHACK brutal hasta hace poco». damnit responde que con el Go no llega nunca al límite, pero que si fuera desarrollador pagaría más. ProbeMiguel suelta que con las versiones gratuitas le sobran tokens y que cada vez son peores.

La tercera es la de siempre: si esto es adicción o mercado. Otrasvidas dice que los consumidores pagarán lo que se les pida. brus lo compara con la droga. Antio cree que la reducción es poca para lo que pierden. Coronel Kurtz responde con una palabra: «Vende».

Qué cambia respecto a antes​

El debate técnico se vuelve concreto: ya no se discute si la IA local vale, sino con qué modelo, cuántización y contexto. burbubot pasa de negar la existencia de Qwen 3.8 a aceptar que puede haberse lanzado y admitir que su catálogo va por detrás. Entra con fuerza la vía de las licencias baratas de Gemini y la de DeepSeek gratuito como alternativas de bajo coste. Y ATARAXIO, que venía defendiendo el pago, ahora aporta casos de uso concretos: reclamaciones bancarias, instrucciones, consultas con su madre. damnit introduce la comparación de hardware: miles de ordenadores frente a tu máquina. Y meme-laif 3 pregunta si la limitación local afecta solo a la velocidad o también al resultado. damnit responde que también al conocimiento.

La pregunta de cortatijeras sobre si notará mejora con la versión de pago se queda sin respuesta directa. Y la de no me creo nada sobre si al agotar el cupo sigue usando una versión peor, también.
💬 LO QUE SE DIJO AQUÍ
«El número sin la ficha técnica no significa nada. Dame modelo, cuantización y longitud de contexto y hablamos.»
— burbubot · Exigencia técnica
«Qwen 3.8 Flash Next con 128-256K de contexto. Modelos: IQ3_S e incluso menos cuantizados.»
— Pancuronio · Modelo local
«el plan de 100, que es el unico que habia disponible hasta ahora lo fundias en 2 horas como mucho»
— Covid-8M · Límites de uso
«Viendo el percal este último mes he ido haciendo acopio de hardware y ya tengo mi IA local funcionando como un Opus 4.7»
— chocolate · IA local
«Esas licencias familiares son cuentas regionales (Turquía, Argentina, Nigeria...) revendidas, y Google lleva meses apretando el cerco.»
— burbubot · Licencias Gemini
«DeepSeek es lo que es: un modelo chino competente, gratis y sin el drama de los límites agresivos»
— burbubot · Alternativa gratuita
«Me ha hecho una reclamación al banco y me han devuelto más de 1.000 euros»
— ATARAXIO · Utilidad práctica
«El pass de 22 era un LIFEHACK brutal hasta hace poco, con diferencia los 22 cholos mejor gastados»
— Pajarotto · Valor del plan
«nunca te vas a poder acercar ni remotamente a lo uqe te ofrecen los grandes como openai o anthropic»
— damnit · Hardware local
«hay efectivamente una gran diferencia entre el modelo free y el de pago»
— damnit · Diferencia de planes
📊 DATOS QUE APARECEN AQUÍ
  • 150 tokens/s en una 4090 con optimizaciones tipo Strata, según Pancuronio
  • 7B a 4 bits y contexto corto sobra GPU; 14B apura; 30B ni de coña sin offloading
  • Qwen 3.8 Flash Next con contexto de 128-256K y cuantización IQ3_S
  • El KV cache de 256K de contexto se merienda VRAM aunque el modelo pese poco
  • El plan de 100 se fundía en 2 horas como mucho, según Covid-8M
  • Licencias familiares de Gemini Pro a 15-20 euros al año, según Rembrandt Q. Einstein
  • AMD Strix Halo + Halogen 0.16 + Qwen3.8Flash-Next como equipo local de chocolate
  • RTX 5080 con 16 GB de VRAM, según Scarjetas
  • Reclamación bancaria resuelta con devolución de más de 1.000 euros, según ATARAXIO
🔮 LO QUE SE VATICINA
  • burbubot: las licencias familiares de Gemini pueden durar 11 meses o 11 días
  • burbubot: un framework nuevo con nombre mesiánico suele estar abandonado en GitHub a los tres meses
  • burbubot: un denso a IQ3 S empieza a fallar a partir de cierta longitud de contexto
Te estás perdiendo 80 mensajes
Esto es un resumen. El hilo original está entero ahí dentro.
Leer el hilo completo →
Registro en 30 segundos

Estadísticas del foro

Temas
2.053.871
Mensajes
58.267.411
Miembros
190.945
Último miembro
desent65

El blog de burbuja.info

Volver