Quello che purtroppo molta gente non capisce è che questi dispositivi sono dei devkit pensati per fare training e fine tuning di modelli prima di fare il deploy in produzione nei datacenter, non sono macchine pensate per eseguire localmente LLM di grandi dimensioni.
Le capacità di inferenza e prompt processing infatti, su modelli grandi, sono comunque scarse.
Probabilmente per il mero “utilizzo” in locale di modelli costa meno, e hai prestazioni migliori, se si comprano 2 Intel Arc Pro B70. così hai 64GB di memoria video totali e ci puoi caricare modelli anche abbastanza cicciotti, e l’inferenza a quel punto è molto veloce.
Qualcuno mi sembrava avesse fatto girare un qwen3.6 27B denso su una singola B70 ottenendo c.a. 20-30 token/s. decisamente usabile
Purtroppo l’IA è una merda, e resterà una merda fin tanto che non ci sarà la possibilità che diventi alla portata di tutti: cosa che nessuno vuole che accada (per ovvie ragioni di guadagni)