Intelligenza artificiale sul proprio computer: come si fa
Si può far girare un'intelligenza artificiale sul proprio computer, senza internet e senza abbonamento. Se il tuo computer ce la fa lo decide un numero solo: i GB di memoria della scheda video. Se il modello ci entra vola; se ne resta fuori un terzo si va venti volte più piano. Qui c'è il conto, cosa installare e — detto onestamente — quando non conviene.
scritta il 20 settembre 2026 · si legge in 13 minuti
L'idea piace a tutti: l'intelligenza artificiale che gira a casa tua, che non manda niente a nessuno e non costa venti euro al mese. Si può fare davvero, ed è più facile di quanto sembri — l'installazione sono cinque minuti. La parte che nessuno spiega è l'altra: capire prima se il tuo computer ce la fa, perché la differenza fra «ce la fa» e «non ce la fa» non è graduale, è un muro.
Il numero che decide tutto
Un modello di intelligenza artificiale è un file grosso che, per rispondere, va tenuto tutto nella memoria della scheda video — che è una cosa diversa dalla RAM del computer e molto più veloce.
Se il modello ci entra, il computer lo legge alla velocità della scheda video e le risposte escono più in fretta di quanto tu riesca a leggere. Se non ci entra, la parte che avanza resta nella RAM normale, e da lì si legge molto più lentamente: più ne resta fuori, peggio va, e con un terzo fuori si arriva a venti volte.
I Mac con chip Apple sono l'eccezione, ed è un'eccezione importante: lì memoria del computer e della scheda video sono la stessa cosa. Con un'avvertenza da sapere prima di comprare: macOS non lascia al modello tutta la memoria. La quota esatta Apple non la pubblica, ma nelle prove si assesta intorno ai tre quarti: un Mac da 32 GB ne rende utilizzabili circa 24, non 32. Resta sproporzionatamente bravo per quello che costa, ma il conto va fatto su quei tre quarti — e per arrivare a 32 GB davvero utilizzabili serve un Mac da 48.
Che modello puoi far girare
I modelli si chiamano con un numero seguito da «B»: 8B, 14B, 27B. È il numero di miliardi di parametri, cioè quanto il modello «sa». Più è alto, meglio risponde e più memoria vuole.
La regola per il conto, con i modelli compressi (che è come si scaricano sempre): ogni miliardo di parametri occupa circa 0,6 GB. Poi servono 1 o 2 GB di margine. Da qui esce la tabella — e si vede subito perché un modello da 70B non sta in 32 GB: 70 × 0,6 fa già 42.
E qui c'è l'eccezione che cambia tutto, ed è recente. La tabella vale per i modelli «densi», che usano tutti i loro parametri a ogni parola. Da un po' però i più interessanti sono fatti diversamente — si chiamano a esperti, in inglese MoE — e per ogni parola ne accendono solo una piccola parte. Risultato: quello che resta nella RAM normale costa pochissimo, perché viene usato di rado.
In pratica: un modello a esperti da 120 miliardi di parametri, che per la tabella vorrebbe 72 GB di scheda video, gira a velocità di lettura su una scheda da 16 GB con il resto nella RAM. Come si riconoscono: nel nome hanno sigle tipo MoE o A3B, e nella descrizione c'è scritto «parametri attivi». Se usi uno di questi, la RAM normale torna a contare e conviene averne tanta.
| Memoria della scheda video | Cosa ci gira davvero | A cosa serve |
|---|---|---|
| 4 GB o meno | modelli da 3B | poco: riassunti brevi, poco altro |
| 8 GB | modelli da 7 a 8B | la soglia da cui comincia a essere utile |
| 12 GB | modelli da 14B | scrivere, tradurre, riassumere bene |
| 16 GB | modelli fino a 20B | il punto giusto: qui si lavora |
| 24 GB | modelli da 27 a 32B | anche programmazione seria |
| 48 GB e oltre | modelli da 70B | qualità vicina a quelli a pagamento |
- Parti dai GB della tua scheda video e leggi la riga corrispondente: quella è la taglia massima che ha senso scaricare.
- Non scaricare la taglia sopra «tanto per provare». Il rallentamento è proporzionale a quanto resta fuori: con pochi pezzi fuori perdi qualche decina per cento, ma saltando alla taglia sopra ne resta fuori un terzo, e lì si va venti volte peggio. È così che ci si convince che l'AI in locale non funzioni.
- Se hai 8 GB, parti da un modello da 8B: è la combinazione più collaudata e quella con cui la maggior parte della gente comincia.
- Lascia sempre 1-2 GB liberi, e di più se lavori su documenti lunghi. Quello spazio serve alla conversazione, che cresce mentre parli: con i testi brevi bastano poche centinaia di MB, ma se alzi la lunghezza massima per dargli da leggere un manuale intero possono servire diversi GB. È il motivo per cui un modello che all'inizio ci stava può traboccare a metà lavoro.
- La famiglia da cui partire oggi è Qwen, che nel 2026 è diventata la risposta standard alla domanda «cosa faccio girare in locale». Attento al numero di versione: scarica l'ultima (a settembre 2026 siamo a Qwen3.8), perché cercando solo «Qwen3» ti porti a casa quello dell'anno prima. Le alternative serie sono Llama, Mistral, Gemma, DeepSeek, gpt-oss e GLM.
- Se lo usi per lavoro, guarda la licenza. Non sono tutte uguali: Qwen, DeepSeek e gpt-oss hanno licenze libere che permettono l'uso commerciale; Llama e Gemma hanno licenze proprie con condizioni da leggere; e sotto il marchio Mistral ci sono anche modelli solo per ricerca, che per lavorare non si possono usare. Sta scritto nella pagina del modello, e sono due minuti.
Come si installa, in cinque minuti
Due programmi, e fanno la stessa cosa. Hanno tutti e due le finestre — Ollama ne ha aggiunte dal 2025 — quindi la scelta si fa su un'altra cosa: a cosa ti serve dopo.
Un'eccezione da conoscere: alcuni modelli — Llama e Gemma fra quelli citati qui sotto — per essere scaricati chiedono un account gratuito su Hugging Face e l'accettazione della loro licenza. Gli altri no.
| LM Studio | Ollama | |
|---|---|---|
| Ha le finestre | sì, ed è nato così | sì, aggiunte dopo |
| Per cominciare | sì, è questo | va bene anche lui |
| Ti dice se un modello ci sta | sì, un pallino verde o rosso | no, devi saperlo tu |
| Serve ad altri programmi | sì, va acceso | sì, è il suo mestiere |
| Sui Mac con chip Apple | veloce | veloce |
| Quanto costa | gratis | gratis |
- Scarica LM Studio dal sito ufficiale e installalo come un programma qualunque. Attenzione a prendere quello giusto: sullo stesso sito c'è anche un altro prodotto con un nome diverso, che non è questo.
- Cerca un modello dentro il programma. Accanto a ogni versione c'è un pallino verde o rosso che dice se ci sta nella tua memoria: è la cosa più utile di tutto il programma, e ti evita il conto.
- Scarica quello verde più grande e basta. Il primo scaricamento sono diversi GB: falla di notte se hai una linea lenta.
- Scrivi. Da qui in poi è una chat come le altre, solo che non esce niente dal tuo computer — puoi staccare internet e continuare a usarla.
- Se poi ti serve che altri programmi lo usino (per automatismi, script, un'estensione del browser), quello è il momento di guardare Ollama: fa la stessa cosa, ma è costruito soprattutto per essere chiamato da altro software, ed è quello che quasi tutti i programmi si aspettano di trovare.
- Se lo apri verso la rete, mettigli una password davanti. È la cosa più importante di questa sezione e quasi nessuno la dice: la porta con cui Ollama parla agli altri programmi non chiede nessuna autenticazione. Va benissimo finché ascolta solo sul tuo computer, che è il comportamento normale. Ma se la apri per usarla da un'altra macchina e quella macchina è raggiungibile da internet, stai regalando il modello — e un pezzo del computer — a chiunque passi. Le scansioni pubbliche ne trovano decine di migliaia esposte così. Se ti serve da fuori: VPN, oppure un proxy con password davanti.
Quando conviene davvero, e quando no
Questa è la parte che gli articoli saltano, e invece è quella che ti fa risparmiare un pomeriggio o seicento euro.
Sulla qualità pura, in locale si perde. Un modello che gira su una scheda da 16 GB non è al livello di quelli a pagamento, e non lo sarà. Quindi in locale ci si va per altri motivi, e se nessuno di questi ti riguarda, l'abbonamento è la scelta giusta e non c'è niente di male.
Dall'altra parte c'è la scheda, e qui va detta una cosa: il prezzo di listino di una 16 GB è intorno ai 450 euro, ma in questo periodo in negozio se ne pagano oltre 700 per via della crisi delle memorie. Ai prezzi di oggi il pareggio arriva dopo più di tre anni e mezzo, e in quel tempo i modelli a pagamento saranno migliorati e la tua scheda no: se il motivo è risparmiare, non conviene. Se invece i prezzi tornassero al listino, il pareggio scenderebbe a poco più di due anni, e il conto cambierebbe — quindi vale la pena rifarlo quando compri.
Se il motivo è che certi dati non possono uscire dal tuo computer, allora non è un risparmio: è l'unica strada, e il prezzo non c'entra.
| Il motivo | Conviene? |
|---|---|
| Ci devo mettere dentro dati riservati di clienti | sì, ed è il motivo numero uno |
| Lavoro dove internet non c'è o va male | sì |
| Lo uso tantissimo e i limiti mensili mi bloccano | sì |
| Voglio capirci qualcosa e smanettare | sì, ed è gratis provare |
| Voglio risparmiare l'abbonamento | no, fai il conto qui sotto |
| Voglio la risposta migliore possibile | no, quella è a pagamento |
| Devo generare immagini o video | è un altro discorso e un'altra guida |
Cosa comprare, se vuoi salire
Se hai deciso che ti serve, la spesa è quasi tutta in un pezzo solo — la scheda video — ed è la stessa conclusione dell'articolo sull'alimentatore: una voce decide, il resto è rumore.
- 1
RTX 5060 Ti da 16 GB, il punto giusto

745,82 € prezzo del 20 settembre 2026
Per chi: Chi ha deciso di farci lavoro vero, non solo prove
La scheda da comprare per questo mestiere: 16 GB di memoria fanno girare comodamente i modelli fino a 20B, che è la fascia in cui l'intelligenza artificiale in locale smette di essere una prova e comincia a essere utile. Ed è NVIDIA, quindi tutto funziona al primo colpo. Conta però l'alimentatore: NVIDIA per questa scheda chiede un sistema da 600 watt.
- 16 GB: la soglia da cui si lavora davvero
- NVIDIA: nessun programma ti dirà di no
- 180 watt: fra le schede capaci è una delle più sobrie
- Oggi si paga molto sopra il listino: la crisi delle memorie
- Per giocare, a questo prezzo ci sono scelte migliori
- 2
Mini PC con 32 GB, la strada piccola e sempre accesa

422,51 € prezzo del 19 settembre 2026
Per chi: Chi ha già un server di casa o ci sta pensando
Un'altra idea, per un uso diverso: una macchinetta che sta sempre accesa e fa girare un modello piccolo per gli automatismi — riassumere, classificare, rispondere a cose ripetitive. Non è per chattarci: è lenta. È per far lavorare qualcosa di notte senza tenere acceso il computer grosso. Un consiglio sul modello: non pagare il sovrapprezzo per la sigla «AI» nel nome del processore — l'acceleratore dedicato che giustifica quel prezzo i due programmi di cui parliamo qui non lo usano.
- 32 GB di RAM: i modelli a esperti ci stanno comodi
- Consuma pochissimo, può stare acceso sempre
- Ci gira anche Proxmox, quindi fa anche altro
- Lento: non è la macchina con cui chattare
- Niente scheda video dedicata: i modelli densi grossi non girano
I prezzi e la disponibilità dei prodotti sono accurati alla data indicata e sono soggetti a modifica. Qualsiasi informazione di prezzo o disponibilità visualizzata su Amazon.it al momento dell’acquisto sarà applicata all’acquisto. Apri il collegamento e guarda il prezzo di oggi: su Amazon cambia spesso, e capita che lo stesso prodotto sia in offerta a meno. I bottoni Amazon sono collegamenti affiliati: se compri, a te non costa niente in più e a me resta una piccola commissione.
- Conta prima i GB, poi la banda della memoria. Per giocare conta quanti fotogrammi fa la scheda; qui contano due cose in ordine. Primo: quanta memoria ha — una scheda più lenta con 16 GB batte una più veloce con 8, e non di poco. Secondo, una volta che il modello ci sta, la velocità con cui scrive dipende quasi solo dalla banda della memoria, che nelle specifiche si misura in GB/s. È il numero da confrontare fra due schede con la stessa memoria: può cambiare del doppio.
- NVIDIA è ancora la scelta più tranquilla, ma AMD non è più da scartare. Fino a qualche tempo fa su AMD molte cose non partivano; oggi AMD stessa documenta come far girare LM Studio e Ollama sulle sue schede. Va un po' meno veloce, ma va. Due avvertenze prima di risparmiare: il supporto è pieno sulle serie recenti e incostante su quelle vecchie dell'usato, quindi controlla il tuo modello preciso nell'elenco di Ollama; e se vuoi accendere e non pensarci, NVIDIA resta la scelta senza sorprese.
- Un Mac con chip Apple è la strada più economica per tanta memoria. Lì la memoria è condivisa, quindi un Mac con 32 GB fa girare modelli che su PC richiederebbero una scheda da 24 GB — sempre i tre quarti — e una scheda da 24 GB costa molto di più. Va meno veloce, ma ci arriva.
- Aggiungere RAM normale non risolve, con i modelli densi. Lì il modello deve stare nella scheda video e basta. Con i modelli a esperti invece sì, e parecchio: sono fatti apposta per tenere gran parte di sé nella RAM. Se è quella la strada che ti interessa, la RAM diventa l'acquisto più conveniente dei due — tieni però presente che in questo periodo costa carissima, un kit da 64 GB sta fra i 450 e gli 800 euro.
- Controlla l'alimentatore prima di comprare la scheda. Una scheda da 16 GB chiede fra 180 e 300 watt, e la regola è aggiungere 400 watt a quel numero: per una scheda da 180 W serve un alimentatore da almeno 600. Molti computer da ufficio ne hanno 400 o 500, quindi controlla prima di ordinare — e qui il carico è continuo, non a raffiche come giocando.
Domande frequenti
Se lo uso per lavoro devo dirlo ai clienti?
Sì, se fai una professione intellettuale, e vale anche tenendo tutto in casa: la legge 132/2025, articolo 13 chiede che le informazioni sui sistemi di intelligenza artificiale usati siano comunicate al cliente «con linguaggio chiaro, semplice ed esaustivo». Il fatto che il modello giri sul tuo computer non cambia l'obbligo.
Quello che la norma NON dice, e che in giro si legge: non impone la forma scritta né un momento preciso. Metterlo nel preventivo resta il modo più semplice di poterlo dimostrare, ma è una scelta pratica, non un obbligo. La stessa norma dice anche che l'AI può servire alle attività strumentali e di supporto: il lavoro intellettuale deve restare prevalente.
Posso far girare ChatGPT sul mio computer?
ChatGPT come prodotto no, non si scarica. OpenAI ha però pubblicato dei modelli aperti, gpt-oss, che si scaricano e girano in casa; e poi ci sono Qwen, Llama, Mistral, Gemma, DeepSeek. Fanno lo stesso mestiere senza internet e senza abbonamento. Sulla qualità pura perdono contro quelli a pagamento, ma sono gratis e non mandano niente a nessuno.
Che computer serve per l'intelligenza artificiale in locale?
Conta un numero solo: i GB di memoria della scheda video. Con 8 GB si comincia a fare qualcosa di utile (modelli da 7-8B), con 16 GB si lavora davvero (fino a 20B). La regola è che ogni miliardo di parametri occupa circa 0,6 GB, più uno o due GB di margine. I Mac con chip Apple sono un caso a parte: lì la memoria è condivisa, ma macOS ne lascia al modello circa tre quarti, quindi un Mac da 32 GB ne rende utilizzabili 24.
Perché l'AI in locale è lentissima sul mio computer?
Quasi sempre perché il modello che hai scaricato non entra nella memoria della scheda video: la parte che avanza finisce nella RAM normale, e da lì si legge molto più lentamente — con un terzo del modello fuori si va anche venti volte peggio. Scarica un modello più piccolo e vedrai il salto immediatamente.
C'è anche un'impostazione che nasconde il problema, ed è il motivo per cui non ti arriva nessun errore: con le schede NVIDIA su Windows il driver, quando la memoria video finisce, trabocca da solo nella RAM invece di dirti che non ci sta. Se vuoi che te lo dica: Pannello di controllo NVIDIA → Gestisci impostazioni 3D → CUDA - Sysmem Fallback Policy → «Prefer No Sysmem Fallback».
Meglio LM Studio o Ollama?
Per cominciare LM Studio, per un motivo pratico: accanto a ogni modello ti dice con un pallino verde o rosso se ci sta nella tua memoria, e ti risparmia tutto il conto. Anche Ollama ha le finestre da tempo, quindi la differenza non è più quella: Ollama conviene quando ti serve che altri programmi usino il modello, perché è quello che quasi tutti si aspettano di trovare.
Conviene davvero rispetto all'abbonamento?
Ai prezzi di oggi no, se il motivo è risparmiare: l'abbonamento costa circa 280 euro all'anno, la corrente ne aggiunge settanta, e una scheda con 16 GB in negozio supera i 700 — quindi il pareggio arriva dopo più di tre anni e mezzo, e nel frattempo i modelli a pagamento migliorano e la tua scheda no. Attenzione però: quei 700 sono un prezzo gonfiato dalla crisi delle memorie, il listino è intorno ai 450. Se i prezzi rientrano, il pareggio scende a poco più di due anni. Conviene comunque, a qualunque prezzo, se hai dati che non devono uscire dal tuo computer.
È vero che l'AI in locale è più sicura?
Per la riservatezza sì, ed è il motivo migliore per usarla: quello che scrivi non esce dal tuo computer. Due avvertenze però, tutte e due importanti. La prima: un modello in locale sbaglia come gli altri, anzi di più, perché è più piccolo — riservato non vuol dire affidabile. La seconda: riservato non vuol dire a norma. Se tratti dati di clienti resti tu il responsabile, e il portatile va protetto come proteggeresti un archivio — disco cifrato, password, backup. Un portatile non cifrato dimenticato in treno è una violazione di dati esattamente come un fornitore bucato.
Serve una scheda NVIDIA o va bene AMD?
Oggi vanno bene tutte e due, ed è cambiato di recente: fino a qualche tempo fa su AMD parecchi programmi non partivano, mentre adesso è AMD stessa a documentare come far girare LM Studio e Ollama sulle sue schede. Va un po' meno veloce, ma va. Controlla però che la tua scheda precisa sia supportata: sulle serie recenti sì, su quelle vecchie dell'usato è incostante. Se vuoi accendere e non pensarci, NVIDIA resta la scelta senza sorprese.
Da dove vengono questi dati
Dati controllati il 20 settembre 2026.
- Hugging Face — i modelli aperti e le loro dimensioni le taglie dei modelli e le compressioni
- LM Studio — il programma con le finestre come si installa e il controllo della memoria
- Ollama — la versione per gli altri programmi l'alternativa da riga di comando
- Apple — come la GPU dei Mac usa la memoria unificata il fatto che non tutta la memoria sia disponibile al modello
- Normattiva — Legge 132/2025, articolo 13 (professioni intellettuali) l'obbligo per i professionisti
- Amazon.it — prezzi letti dalle sue interfacce il 20 settembre 2026 i prezzi delle schede
Questa guida l’ho scritta con l’aiuto dell’intelligenza artificiale e l’ho verificata sulle fonti qui sopra prima di pubblicarla. Come lavoro


