Se rumorea que ya ha llegado el momento de la IA en local

RESUMEN DEL DEBATE · elaborado con IA

La IA local deja de ser ciencia ficción: instalar Qwen en tu PC ya tiene truco Cinco minutos para restar dos columnas. Esa fue la experiencia de quien instaló un modelo local y acabó desinstalándolo. En las antípodas, otro equipo mueve Qwen a 140 tokens por segundo con una GPU de gama alta. La IA en local ha dejado de ser un rumor de laboratorio, pero la pregunta de si compensa acaba de abrirse.

Leer el resumen completo →

Sota_de_bitcoins

Bitcoñero maximalista
Desde
3 Oct 2022
Mensajes
2.752
Fruta
5.136
Desde que salió qwen 3.8 hace unos días está todo el mundo hablando de él debido a sus buenos benchmarks. Los chinos están marcando el ritmo y rugiendo duro en las incorporaciones.

El tema es que hay gente montándose ya pcs con chips ia en los que te bajas ollama y los pesos pesados de qwen y trabajan todo en local, sin pagar los 100 euros de claude.

Pero no sé si vale la pena, porque previamente has de dejarte miles de euros en hardware y además pagar la electricidad que eso consume.

Mejor alquilar que comprar, a no ser que te hiperobsesione la privacidad.

@Una manola
 
Seguramente el que trabaja con ello lo hará con modelos de pago, pero el mercado de todos los que la usan y la usarán en su día a día para temas personales se lo están volando los chinos. Y el otro es cuestión de tiempo.
 
Yo me he montado mi IA local en un Mac pro de 2013 con resultados bastante buenos. Un poco rollo programar una arquitectura en phyton enfocada a maximizar el rendimiento, creando un sistema de memoria vectorial y demás para mantener prompts pequeños. También lleva su curro buscar un modelo que te encaje con el software y la arquitectura, porque puede que al final acabes montando algo distinto a lo que planeabas pero aprendes mucho.
Y sobre todo, tienes una IA que ha sido diseñada PARA TI, no para que ciertos proveedores te saquen la pasta y te monitoreen hasta lo que haces por la mañana.

Pero como siempre, lo bueno cuesta trabajo.

Por cierto hay cosas más interesantes que el Qwen, modelos MOE quantizados y muy abliterated que son una artefacto artefacto peligroso.
 
eso solo lo aprovechas si tienes ya una GPU de tropocientos euros y suficiente ram
de lo contrario es tontería

pero no te extrañe que en unos años ya los pcs vengan con chips capaces de ejecutarlo localmente, y más adelante los móviles directamente,

IA's de video consumen mas y eso igual aún tendrá mejor aguante para usarla en servidores externos, nadie se quiere dejar miles de euros para hacer tonterías, eso solo lo harán lo q la usen duro y les valga la pena la inversión
 
Depende de para que, yo hace tiempo que tengo a qwen 2.5 currando todos los días a ciertas horas programadas para unas tareillas que a mi me darían una pereza terrible.

Un modelo 7b Q4 lo puede mover un ordenador mas o menos normal con una velocidad muy buena. En mi caso un macbook M2.

El programa le envía una petición, la IA lo procesa y da la respuesta, y yo a esas horas durmiendo tan latin.
 
¿Y eso para qué sirve, aparte de para hacer videollamadas inapropiadas con la cara, voz y personalidad de tu vecina? ¿Para que te diseñe un plan de cómo vivir sin trabajar? ¿Pista para robar un banco con éxito? ¿Para hacer videos violentos con imágenes de gente que odias?
 
Desde que salió qwen 3.8 hace unos días está todo el mundo hablando de él debido a sus buenos benchmarks. Los chinos están marcando el ritmo y rugiendo duro en las incorporaciones.

El tema es que hay gente montándose ya pcs con chips ia en los que te bajas ollama y los pesos pesados de qwen y trabajan todo en local, sin pagar los 100 euros de claude.

Pero no sé si vale la pena, porque previamente has de dejarte miles de euros en hardware y además pagar la electricidad que eso consume.

Mejor alquilar que comprar, a no ser que te hiperobsesione la privacidad.

@Una manola


Lo tengo descensurado (quantizado a 3 bits) con llama.cpp turboquant y me comienza a 140 t/s con una 9070 XT.

Decae a unos 15 t/s cuando se va llenando el contexto (262144 t)

Estaba muy muy contento con Qwen 3.6 y dicen que 3.8 es algo mejor. Circula en Huggingface un finetuneo que supera una puntuacion que Anthropic y OpenAI aceptan como inteligencia general.

Por lo que he visto va bastante bien. Lo ire probando como agente/asistente de programacion (a ver si supera al Cerebras Qwen 3.6 coder).
 
Me estoy montando un "2o cerebro" con mi entendimiento del mundo para acceso rapido, con Obsidian, Hermes y (de momento) Grok.

He de decir que Qwen 3.6 ha hecho un trabajo decente usado desde Hermes en otras ocasiones (buscando un recubrimiento de los muelles de una colchoneta en Amazon y alguna que otra cosa). Luego lo probare con Qwen 3.8 a ver que tal saca informacion del vault.

(adjunto visible para usuarios registrados)
 

Adjuntos

Archivo oculto para usuarios no registrados
De momento a mi con Gemini me sobra para lo que le pido, ya sean búsquedas, resúmenes, retocar fotos o código para cosas personales o del curro, con el plan gratuito. Su modelo flash y a veces habilitando el razonamiento avanzado, lo borda el tío.

Para liquidar algo similar en local no tengo medios y ahora mismo las GPU con >16GB de VRAM te valen >1000€, le sumas RAM y precio de la luz y dudo que lo amortices nunca. Si a caso pagaría antes por openrouter o vast.ai, lo local hoy por hoy sólo lo veo para whisper.cpp
 
he subido este hilo buscando personal cloud (en casa) (para correr IA y crypto). por lo que veo hay sistemas operativos que hacer orquestacion de containers docker

 
Dicen que para liquidar IA en local lo mejor es Windows. ¿En Linux y en Mac se puede lograr lo mismo?
pos claro, y ademas mac va muy bien por lo de tener la ram enchufada directamente al procesador (con la capacidad de procesamiento grafico que tienen esos chips M). Y hay modelos optimizados para la arquitectura de los chips M

El SO da igual, lo que importa es cuanta ram tienes bien conectada a los nucleos de procesamiento gráfico, y bueno, tambien importa tener muchos nucleos de procesamiento gráfico.

Nvidia lo que tiene es que su arquitectura de software, no recuerdo el nombre de la historia, está pensada para IA y es el estandar actual, entonces, una tarjeta de las tochas de nvidia con un cigot de vram es lo mejor ahora mismo para procesar IA, pero es muy caro, y te puede limitar la cantidad de vram. Ademas gasta bastante electricidad

Para temas domesticos ahora mismo lo mejor es un mac mini de 24 o 32 de ram, que todavía no se disparan demasiado de precio, y gastan unos 30 watios o algo así.

E irán saliendo cosas del estilo del mac mini. Nvidia ya ha sacado unos, pero son caros, eso si, buenísimos claro.
 
Les recuerdo a los que saben poco que el que ha apostado por la IA local es Apple y les va a hacer su capita a los Chinos con Qwen. La IA no es barata necesita mucha memoria.
 
apple con su siri lento que ha tenido que apoyarse en gemini?? eres apple fanboy? jaja
No cervatillo, no te has enterado, vender equipos para IA local hasta que los Chinos saquen su Chips 3D baratos y tumben a nvidia. Lee y mira la bolsa, que no te enteras. Apple no le importa la IA solo quiere que corra en sus equipos. No va a imponer nada, por que la IA te la van a dar los Chinos para que hagas lo que tu quieras.
 

Estadísticas del foro

Temas
2.054.350
Mensajes
58.284.762
Miembros
190.959
Último miembro
MarquesDePocasPerras

El blog de burbuja.info

Volver