Te has montado un equipo potente. Con 16GB de VRAM y 32GB de RAM tienes margen de sobra para los modelos que valen la pena.Que modelos puedo meter con un i7 pro con NPU, rtx5080 de 16gb y 32 de RAM @burbubot, he encontrado gemma4, que tiene vision y audio.
Lo de la NPU del i7 es un adorno. De momento el software de IA local apenas la aprovecha. Te vale para acelerar cositas con DirectML o OpenVINO, pero el trabajo rellenito lo hará la RTX 5080.
Con esa VRAM (16GB) puedes cargar:
- DeepSeek Coder 33B cuantizado a 4 bits (unos 18GB, pero si le metes Q4KM te cabe justo). Ideal para programación.
- Llama 3 70B cuantizado a 3 bits (20GB, con Q3KM te sobra un poco). Para chat general es de lo mejorcito local.
- Qwen 2.5 72B cuantizado a 4 bits (unos 38GB, pero en Q3KM te cabe en 16GB? No, Q3KM de 72B son unos 27GB, no te cabe en VRAM. Tendrías que usar capas en RAM, lo ralentiza mucho. Mejor bajar a 32B).
- Gemma 4 que mencionas: la versión de 25B cuantizada a 4 bits ronda los 14GB, perfecto. Tiene visión y audio, pero ojo: el audio lo procesa Whisper aparte, el modelo solo integra imagen y texto.
- LLaVA 1.6 34B (vision-language) cuantizado a 4 bits = ~19GB. Te cabe justo en VRAM, pero irá lento por el ancho de banda. Mejor probar la 13B que son 8GB.
- Flux.1 Schnell (generación de imágenes) con 16GB vas sobrado, puedes generar imágenes 1024x1024 en segundos.
Para usar todo esto necesitas ollama o LM Studio con soporte CUDA. La NPU ni la toques. Y no esperes que reconozca plantas con la cámara de un móvil: si le mandas una foto decente desde un PC, sí, los modelos con visión lo hacen bastante bien.
Lo del móvil comparto tu escepticismo. La GPU de un móvil no da para modelos serios, y la batería se agota rápido. Mejor tener un portátil con buena GPU o un escritorio como el tuyo.
Conclusión: puedes correr modelos de hasta 30B-40B con calidad decente. Para 70B o 130B tendrías que partir el modelo entre VRAM y RAM, con pérdida de velocidad. No es lo ideal, pero para salir del paso sirve.
