
Nella prima puntata abbiamo delineato l’orizzonte: eseguire un modello linguistico sul proprio computer per ridurre la dipendenza dai servizi cloud e acquistare maggiore consapevolezza degli strumenti. Ora possiamo passare alla prova. Servono tre elementi: un programma capace di caricare il modello, un modello compatibile e una macchina dotata di risorse sufficienti.
Ollama e LM Studio combinano questi elementi in modi diversi. Il primo privilegia il terminale, le automazioni e le integrazioni; il secondo offre un ambiente grafico nel quale cercare, scaricare, configurare e interrogare i modelli. Entrambi permettono di lavorare in locale: proprio per questo costringono a rendere visibili scelte che nei servizi online restano spesso sullo sfondo.
1. Prima di cominciare: controllare la macchina
Non esiste un requisito hardware valido per ogni modello. Contano la quantità di memoria disponibile, la presenza o meno di una GPU, la dimensione del modello, il grado di quantizzazione e la lunghezza dei testi che si vogliono elaborare. Le soglie riportate qui servono a orientarsi, non a certificare la compatibilità di qualunque configurazione.
| Voce | Per una prima prova | Per lavorare con più agio |
| Sistema | Sistema operativo a 64 bit e versione supportata dal programma. Su Windows x64, LM Studio richiede AVX2. | Apple Silicon oppure un PC recente. LM Studio non supporta attualmente i Mac Intel; Ollama supporta la GPU di Apple Silicon |
| Memoria | Con 8 GB si possono tentare modelli molto piccoli e contesti brevi. | 16 GB o più offrono un margine realistico; modelli e contesti più ampi richiedono ulteriore memoria. |
| GPU | Non è obbligatoria: l’esecuzione via CPU è possibile, ma può essere lenta. | Una GPU dedicata con almeno 4 GB di VRAM aiuta. Nei Mac Apple Silicon la memoria è unificata e viene condivisa tra CPU e GPU. |
| Disco | Occorrono spazio per l’applicazione e alcuni gigabyte per un piccolo modello quantizzato. | È prudente lasciare almeno 10–20 GB liberi; una raccolta di modelli può occupare decine o centinaia di gigabyte. |
La memoria disponibile è il primo dato da guardare. Se il modello entra interamente nella VRAM o nella memoria unificata, la generazione è in genere più rapida; in caso contrario parte del lavoro ricade sulla RAM e sulla CPU. Ollama permette di controllare la ripartizione con il comando «ollama ps».
2. Due strumenti, due modi di entrare
Ollama e LM Studio non sono modelli: sono ambienti di esecuzione e gestione. Scaricano o importano i pesi di un modello, li caricano in memoria e mettono a disposizione una chat, un’interfaccia di programmazione o entrambe.
| Aspetto | Ollama | LM Studio |
| Accesso | App con chat (macOS e Windows) e riga di comando; servizio locale adatto ad automazioni e integrazioni. | Applicazione grafica; offre anche CLI, modalità senza interfaccia e server locale. |
| Modelli | Catalogo Ollama, download diretto di GGUF da Hugging Face e importazione di modelli compatibili, compresi file GGUF. | Ricerca integrata su Hugging Face e importazione di modelli già scaricati. |
| Formati e runtime | Gestisce il formato attraverso il proprio sistema di modelli e può importare GGUF e Safetensors compatibili; sui Mac Apple Silicon usa anche MLX per alcuni modelli. | Esegue modelli GGUF tramite llama.cpp e, sui Mac Apple Silicon, anche modelli MLX. |
| Uso tipico | Ripetere procedure, collegare altri programmi, esporre API locali. | Esplorare cataloghi e configurazioni, osservare l’uso delle risorse, chattare, esporre API locali. |
La distinzione non è rigida. Ollama dispone oggi di un’applicazione con chat per macOS e Windows e LM Studio può funzionare senza interfaccia grafica. Per una prima esplorazione LM Studio rende più visibili le scelte; Ollama è spesso più comodo quando si vuole riprodurre un’operazione con un comando o collegare il modello ad altri strumenti.
3. Scegliere un modello senza inseguire classifiche
Il modello è un insieme di parametri appresi durante l’addestramento. Il numero associato al nome – per esempio 3B, 4B o 8B – indica approssimativamente i miliardi di parametri. È un primo indizio del fabbisogno di memoria, ma non basta da solo a prevedere qualità e velocità: architettura, quantizzazione, contesto e compito incidono sul risultato.
Molti modelli destinati all’uso locale sono distribuiti in formato GGUF. Sigle come Q4_K_M o Q5 indicano diverse forme di quantizzazione: i valori numerici dei pesi vengono rappresentati con minore precisione, così il file occupa meno spazio e richiede meno memoria. Il guadagno di efficienza può comportare una riduzione della qualità; non si tratta quindi di «togliere peso senza togliere intelligenza».
Per una prima prova conviene cercare:
- un modello «instruct» o «chat», preparato per seguire istruzioni e sostenere un dialogo;
- una dimensione contenuta, intorno a 3–4 miliardi di parametri;
- una quantizzazione a 4 bit o superiore, se la macchina la sostiene;
- una scheda che dichiari lingue supportate, licenza, dimensione del file e compiti previsti.
Un esempio verificabile al momento della pubblicazione è Qwen3.5 4B: nel catalogo Ollama la versione Q4_K_M occupa circa 3,4 GB, supporta input testuali e immagini ed è distribuita con licenza Apache 2.0. È un punto di partenza, non una raccomandazione definitiva. Per compiti diversi – scrittura, riassunto, programmazione, analisi di immagini – può essere opportuno scegliere famiglie differenti.
4. Elaborazione locale, privacy e scuola
Quando un modello già scaricato viene eseguito interamente sul dispositivo, i prompt e le risposte possono restare sul dispositivo. LM Studio dichiara che chat, documenti e server locale funzionano offline; Ollama dichiara di non ricevere prompt e dati durante l’esecuzione locale. Questa possibilità riduce la trasmissione a fornitori esterni, ma richiede una configurazione coerente.
Ollama offre infatti anche modelli cloud e ricerca sul web; chi vuole imporre il solo uso locale deve disattivare queste funzioni. LM Studio necessita della rete per cercare e scaricare modelli, e può collegarsi a servizi esterni attraverso integrazioni. Un server locale esposto sulla rete scolastica, inoltre, va protetto e amministrato.
In una scuola vanno quindi considerate almeno queste condizioni:
- quali dati possono essere inseriti e da chi;
- dove vengono conservate chat, documenti e registri;
- chi può accedere al dispositivo o al server;
- quali collegamenti di rete e integrazioni sono attivi;
- come vengono aggiornati software e modelli;
- quale licenza disciplina il modello scelto.
L’elaborazione locale è dunque una misura tecnica utile, non una garanzia automatica di sicurezza o conformità. Nel giugno 2026 il Garante per la protezione dei dati personali ha ricordato che la normativa privacy si applica pienamente alle sperimentazioni di IA nella scuola e che i trattamenti ad alto rischio richiedono valutazioni e misure specifiche.
5. Limiti da mettere in conto
- Qualità variabile. Un modello piccolo può essere adeguato a riscritture o classificazioni semplici e deludente in compiti complessi. Le risposte vanno sempre verificate.
- Conoscenze non aggiornate. Senza strumenti esterni il modello non consulta il web e risponde sulla base dei dati di addestramento e del materiale fornito nella conversazione.
- Prestazioni legate alla macchina. Velocità, lunghezza del contesto e numero di richieste simultanee dipendono dalla memoria e dall’accelerazione disponibili.
- Consumo di risorse. CPU e GPU possono scaldarsi e assorbire energia; locale non significa privo di costi materiali.
- Controllo incompleto. Un prompt di sistema orienta il comportamento, senza impedire errori, contenuti inappropriati o allucinazioni.
6. Prima attività: installare e provare
A. Ollama
- Verifica la compatibilità. Dal sito ufficiale scarica la versione per macOS, Windows o Linux e controlla i requisiti del sistema operativo.
- Installa e avvia. Su macOS e Windows l’applicazione può partire insieme al sistema; questo comportamento può essere disattivato nelle impostazioni di avvio.
- Scarica un piccolo modello. Apri il terminale e digita «ollama run qwen3.5:4b». Al primo avvio Ollama scarica il modello; in seguito lo carica dal disco.
- Fai una prova controllata. Chiedi una breve riscrittura o un riassunto di un testo non riservato. Per uscire dalla chat digita «/bye».
- Controlla dove lavora il modello. Con «ollama ps» puoi vedere se il carico è sulla CPU, sulla GPU o ripartito. Se il progetto richiede un ambiente soltanto locale, disattiva le funzioni cloud seguendo la FAQ ufficiale.
B. LM Studio
- Verifica la compatibilità. Su Mac serve Apple Silicon; su Windows x64 è richiesto AVX2. Scarica il programma dal sito ufficiale e installalo.
- Apri la sezione Discover. Cerca una famiglia di modelli, per esempio «Qwen3.5», oppure incolla il nome completo di un repository di Hugging Face.
- Scegli il file. Per iniziare seleziona una variante piccola e quantizzata almeno a 4 bit. Controlla dimensione, licenza e compatibilità prima del download.
- Carica il modello nella Chat. Apri una nuova conversazione, seleziona il modello scaricato e osserva la stima della memoria richiesta.
- Ripeti la stessa prova. Usa lo stesso testo e la stessa consegna impiegati con Ollama. Confronta velocità, qualità della risposta, consumo di memoria e facilità d’uso.
Lo scopo di questa prima attività non è trovare subito il modello «migliore». È imparare a vedere la filiera: da dove provengono i pesi, quanto occupano, quali risorse usano, dove restano i dati e quali funzioni dipendono ancora dalla rete. L’autonomia digitale comincia da questa possibilità di osservare e scegliere.
Leggi la prima puntata qui: https://laricerca.loescher.it/artigiani-digitali-1-introduzione-un-altro-orizzonte/