Correr un LLM de 70.000 millones de parámetros en el portátil ya no es ciencia ficción. Tampoco es trivial. La decisión entre un ASUS ProArt P16 y un MacBook Pro 16 M4 Max no va de cuál tiene más gigahercios, sino de dos filosofías de arquitectura que llevan a resultados muy distintos según qué modelo quieras servir en local, qué framework uses y cuánto te importe el ecosistema CUDA. Vamos a mojarnos.
El dilema: CUDA con VRAM limitada o memoria unificada masiva
Aquí está el nudo. El ProArt P16 monta una NVIDIA RTX 4070 Laptop con 8 GB de GDDR6 dedicada y hasta 64 GB de RAM DDR5-5600. El MacBook Pro 16 M4 Max, en su configuración alta, llega a 128 GB de memoria unificada con un ancho de banda de 546 GB/s que la GPU integrada, la CPU y el Neural Engine comparten sin copias intermedias.
Para inferencia de LLM esa diferencia lo cambia todo. Un Llama 3.1 70B cuantizado en Q4_K_M pide unos 40 GB solo para los pesos: en la RTX 4070 Laptop simplemente no cabe en VRAM y hay que tirar de offload a RAM del sistema, lo que hunde los tokens/segundo. En el M4 Max con 128 GB, cabe entero y sobra contexto. Ahora bien, si tu carga son modelos por debajo de 13B parámetros o generación de imagen con Stable Diffusion, la conversación se invierte por completo.
Ficha técnica ASUS ProArt P16 (H7606)
| Especificación | Valor |
|---|---|
| Pantalla | 16″ OLED 4K (3840×2400) táctil, 60 Hz, 100% DCI-P3 |
| Procesador | AMD Ryzen AI 9 HX 370 (12 núcleos Zen 5, NPU 50 TOPS) |
| RAM | 32 o 64 GB LPDDR5X-7500 soldada |
| Almacenamiento SSD | 1 o 2 TB PCIe 4.0 |
| Gráfica | NVIDIA RTX 4070 Laptop 8 GB GDDR6 (hasta 115 W) |
| Autonomía real | 7-9 h ofimática; 1,5-2 h carga IA sostenida |
| Peso | 1,85 kg |
| Sistema operativo | Windows 11 Pro (Copilot+ vía NPU) |
| Precio desde | 2.499 € (config 32 GB / 1 TB) |
Ficha técnica Apple MacBook Pro 16 M4 Max
| Especificación | Valor |
|---|---|
| Pantalla | 16,2″ Liquid Retina XDR mini-LED, 3456×2234, 120 Hz ProMotion |
| Procesador | Apple M4 Max (14 CPU / 32 GPU o 16 CPU / 40 GPU) |
| RAM | 36, 48, 64 o 128 GB memoria unificada |
| Almacenamiento SSD | Desde 1 TB, hasta 8 TB |
| Gráfica | Integrada M4 Max (hasta 40 núcleos GPU, 546 GB/s BW) |
| Autonomía real | 14-18 h ofimática; 3-4 h inferencia LLM sostenida |
| Peso | 2,14 kg |
| Sistema operativo | macOS Sequoia (Apple Intelligence) |
| Precio desde | 3.999 € (14 CPU / 32 GPU, 36 GB, 1 TB) |
Stable Diffusion, ComfyUI y fine-tuning: gana el ProArt
Aquí no hay debate. El ecosistema CUDA/cuDNN/TensorRT lleva una década siendo el estándar de facto para difusión y entrenamiento. ComfyUI, Automatic1111, Forge, Kohya_ss para LoRA, Diffusers de Hugging Face: todo corre nativo, sin traducciones ni parches. En la práctica, una RTX 4070 Laptop genera una imagen SDXL 1024×1024 en torno a 6-9 segundos con TensorRT, cifra que el M4 Max con Draw Things o el port MPS de Diffusers no alcanza (queda en el rango de 15-25 segundos según pasos y sampler).
Para fine-tuning de un LoRA de SDXL, el ProArt hace el trabajo en unas horas; en el Mac es viable pero incómodo, y muchos scripts de la comunidad ni siquiera arrancan sin adaptaciones. Si tu día a día es generación de imagen o vídeo con Wan/CogVideoX, el debate termina antes de empezar.
LLM locales grandes: gana el M4 Max, por goleada
Cambia el escenario y cambia el ganador. Con llama.cpp, Ollama o MLX (el framework nativo de Apple), el MacBook Pro 16 M4 Max de 128 GB corre Llama 3.1 70B en Q4 a unos 8-11 tokens/segundo según reportes públicos de la comunidad en Reddit r/LocalLLaMA y del canal de Alex Ziskind. Un Qwen2.5 32B ronda los 18-22 t/s. Y todavía te sobra memoria para KV cache largo, contextos de 32k o 64k tokens, y tener el modelo cargado mientras trabajas en otra cosa.
El ProArt P16 con 8 GB de VRAM se mueve muy bien en modelos hasta 8B (Llama 3.1 8B pasa de 60 t/s en Q4 vía llama.cpp con CUDA), decente en 13B, y a partir de ahí necesita split GPU/CPU que penaliza mucho. Para un 70B, hablamos de 1-2 t/s en el mejor caso. Inusable para desarrollo interactivo.
Frameworks y compatibilidad: el punto débil de Apple
MLX ha madurado rápido y Ollama funciona a las mil maravillas en Apple Silicon, eso es cierto. Pero el catálogo de PyTorch con soporte MPS aún tiene agujeros, hay operadores que caen a CPU sin avisar, y proyectos punteros de investigación se publican con CUDA como ciudadano de primera. DirectML en Windows sigue por detrás de CUDA, pero al menos en el ProArt tienes CUDA nativa. Es la diferencia entre "compatible" y "diseñado para".
Autonomía, ruido y ergonomía fuera del enchufe
El MacBook Pro juega en otra liga fuera del cargador. El chasis se mantiene tibio y silencioso incluso con inferencia moderada, y aguanta jornadas enteras. El ProArt con la RTX 4070 al 100% suena como un secador: 45-48 dB a un palmo, autonomía que se desploma a menos de dos horas y rendimiento GPU que Windows recorta agresivamente en batería (algo ya visto en otros portátiles Copilot+ que analizamos). Si trabajas en cafeterías, ganó Apple antes de encender nada.
Tabla comparativa con puntuación
| Criterio | ASUS ProArt P16 | MacBook Pro 16 M4 Max |
|---|---|---|
| Rendimiento Stable Diffusion / ComfyUI | 9/10 | 6/10 |
| LLM grandes (30B-70B) en local | 4/10 | 10/10 |
| LLM pequeños (7B-13B) | 9/10 | 8/10 |
| Compatibilidad frameworks (CUDA/PyTorch) | 10/10 | 7/10 |
| Pantalla creativa | 9/10 (OLED 4K táctil) | 9/10 (mini-LED 120 Hz) |
| Autonomía real | 5/10 | 10/10 |
| Ruido bajo carga IA | 4/10 | 9/10 |
| Precio-prestaciones | 9/10 (desde 2.499 €) | 6/10 (desde 3.999 €; 128 GB sube a 5.999 €) |
| Ecosistema y soporte comunitario IA | 10/10 | 7/10 |
| Garantía España | 2 años ASUS | 1 año Apple + AppleCare+ opcional |
Veredicto por perfil
Para el artista de IA generativa (Stable Diffusion, ComfyUI, LoRA training): ASUS ProArt P16. Ganas CUDA nativo, TensorRT, la comunidad entera trabajando en tu ecosistema y una pantalla OLED 4K táctil que además te sirve para retocar en Photoshop. Por 2.499 € haces lo que en Mac te cuesta 4.000 € y encima peor.
Para el desarrollador de aplicaciones con LLM locales de 30B-70B: MacBook Pro 16 M4 Max con 64 o 128 GB. No hay competencia en portátil. Los 546 GB/s de memoria unificada y MLX te dan una experiencia interactiva imposible en la RTX 4070 Laptop.
Relación precio-prestaciones: ProArt P16. Un 37% más barato en configuración de entrada, con una GPU que puedes usar también para gaming, renderizado 3D en Blender OptiX y edición de vídeo con aceleración NVENC.
Renovación en el horizonte: ojo, Apple suele refrescar los MacBook Pro cada 12-14 meses; si compras ahora, revisa si el M5 Max se rumorea para primavera. El ProArt P16 con Ryzen AI HX 370 es de 2024-2025 y le queda ciclo comercial holgado.
Preguntas frecuentes
¿Cuántos tokens por segundo consigue el MacBook Pro M4 Max con Llama 3.1 70B?
Según pruebas públicas de la comunidad r/LocalLLaMA y creadores como Alex Ziskind, el M4 Max de 40 núcleos GPU con 128 GB de RAM unificada obtiene entre 8 y 11 t/s en Llama 3.1 70B cuantizado Q4_K_M usando llama.cpp o MLX. Con modelos de 32B en Q4 sube al rango de 18-22 t/s.
¿Puede el ASUS ProArt P16 correr modelos de 70B parámetros?
Técnicamente sí, mediante offload CPU/GPU con llama.cpp, pero el rendimiento cae a 1-2 t/s por la limitación de 8 GB de VRAM en la RTX 4070 Laptop. En la práctica es inusable para desarrollo interactivo; su punto dulce son modelos hasta 13B parámetros.
¿MLX es realmente mejor que PyTorch en Apple Silicon para IA local?
Para inferencia de LLM, sí: MLX aprovecha la memoria unificada sin las conversiones que PyTorch MPS aún realiza, y ofrece mejor throughput en Llama, Mistral o Qwen. Para entrenamiento y modelos de visión, PyTorch con backend MPS sigue siendo más versátil aunque con operadores que ocasionalmente caen a CPU.
¿Merece la pena esperar a la RTX 50 Series Laptop o al M5 Max?
Las RTX 50 Laptop (Blackwell) ya están llegando a portátiles gaming en 2025-2026 y podrían aparecer en un ProArt renovado a lo largo del año. El M5 Max se espera hacia 2026 pero sin confirmación oficial. Si trabajas con IA hoy y necesitas la máquina ya, comprar tiene sentido; si puedes esperar 6 meses, la RTX 5070/5080 Laptop con más VRAM cambiaría el veredicto en LLM grandes.
