Artigiani digitali #2 | Entriamo nel merito: Ollama e LM Studio

Tempo di lettura stimato: 8 minuti
La seconda puntata del percorso sui sistemi generativi in locale: come verificare il proprio computer, scegliere un modello e muovere i primi passi con due strumenti diversi e complementari.

Nella prima puntata abbiamo delineato l’orizzonte: eseguire un modello linguistico sul proprio computer per ridurre la dipendenza dai servizi cloud e acquistare maggiore consapevolezza degli strumenti. Ora possiamo passare alla prova. Servono tre elementi: un programma capace di caricare il modello, un modello compatibile e una macchina dotata di risorse sufficienti.

Ollama e LM Studio combinano questi elementi in modi diversi. Il primo privilegia il terminale, le automazioni e le integrazioni; il secondo offre un ambiente grafico nel quale cercare, scaricare, configurare e interrogare i modelli. Entrambi permettono di lavorare in locale: proprio per questo costringono a rendere visibili scelte che nei servizi online restano spesso sullo sfondo.

1. Prima di cominciare: controllare la macchina

Non esiste un requisito hardware valido per ogni modello. Contano la quantità di memoria disponibile, la presenza o meno di una GPU, la dimensione del modello, il grado di quantizzazione e la lunghezza dei testi che si vogliono elaborare. Le soglie riportate qui servono a orientarsi, non a certificare la compatibilità di qualunque configurazione.

Voce Per una prima prova Per lavorare con più agio
Sistema Sistema operativo a 64 bit e versione supportata dal programma. Su Windows x64, LM Studio richiede AVX2. Apple Silicon oppure un PC recente. LM Studio non supporta attualmente i Mac Intel; Ollama supporta la GPU di Apple Silicon
Memoria Con 8 GB si possono tentare modelli molto piccoli e contesti brevi. 16 GB o più offrono un margine realistico; modelli e contesti più ampi richiedono ulteriore memoria.
GPU Non è obbligatoria: l’esecuzione via CPU è possibile, ma può essere lenta. Una GPU dedicata con almeno 4 GB di VRAM aiuta. Nei Mac Apple Silicon la memoria è unificata e viene condivisa tra CPU e GPU.
Disco Occorrono spazio per l’applicazione e alcuni gigabyte per un piccolo modello quantizzato. È prudente lasciare almeno 10–20 GB liberi; una raccolta di modelli può occupare decine o centinaia di gigabyte.

La memoria disponibile è il primo dato da guardare. Se il modello entra interamente nella VRAM o nella memoria unificata, la generazione è in genere più rapida; in caso contrario parte del lavoro ricade sulla RAM e sulla CPU. Ollama permette di controllare la ripartizione con il comando «ollama ps».

2. Due strumenti, due modi di entrare

Ollama e LM Studio non sono modelli: sono ambienti di esecuzione e gestione. Scaricano o importano i pesi di un modello, li caricano in memoria e mettono a disposizione una chat, un’interfaccia di programmazione o entrambe.

Aspetto Ollama LM Studio
Accesso App con chat (macOS e Windows) e riga di comando; servizio locale adatto ad automazioni e integrazioni. Applicazione grafica; offre anche CLI, modalità senza interfaccia e server locale.
Modelli Catalogo Ollama, download diretto di GGUF da Hugging Face e importazione di modelli compatibili, compresi file GGUF. Ricerca integrata su Hugging Face e importazione di modelli già scaricati.
Formati e runtime Gestisce il formato attraverso il proprio sistema di modelli e può importare GGUF e Safetensors compatibili; sui Mac Apple Silicon usa anche MLX per alcuni modelli. Esegue modelli GGUF tramite llama.cpp e, sui Mac Apple Silicon, anche modelli MLX.
Uso tipico Ripetere procedure, collegare altri programmi, esporre API locali. Esplorare cataloghi e configurazioni, osservare l’uso delle risorse, chattare, esporre API locali.

La distinzione non è rigida. Ollama dispone oggi di un’applicazione con chat per macOS e Windows e LM Studio può funzionare senza interfaccia grafica. Per una prima esplorazione LM Studio rende più visibili le scelte; Ollama è spesso più comodo quando si vuole riprodurre un’operazione con un comando o collegare il modello ad altri strumenti.

3. Scegliere un modello senza inseguire classifiche

Il modello è un insieme di parametri appresi durante l’addestramento. Il numero associato al nome – per esempio 3B, 4B o 8B – indica approssimativamente i miliardi di parametri. È un primo indizio del fabbisogno di memoria, ma non basta da solo a prevedere qualità e velocità: architettura, quantizzazione, contesto e compito incidono sul risultato.

Molti modelli destinati all’uso locale sono distribuiti in formato GGUF. Sigle come Q4_K_M o Q5 indicano diverse forme di quantizzazione: i valori numerici dei pesi vengono rappresentati con minore precisione, così il file occupa meno spazio e richiede meno memoria. Il guadagno di efficienza può comportare una riduzione della qualità; non si tratta quindi di «togliere peso senza togliere intelligenza».

Per una prima prova conviene cercare:

  1. un modello «instruct» o «chat», preparato per seguire istruzioni e sostenere un dialogo;
  2. una dimensione contenuta, intorno a 3–4 miliardi di parametri;
  3. una quantizzazione a 4 bit o superiore, se la macchina la sostiene;
  4. una scheda che dichiari lingue supportate, licenza, dimensione del file e compiti previsti.

Un esempio verificabile al momento della pubblicazione è Qwen3.5 4B: nel catalogo Ollama la versione Q4_K_M occupa circa 3,4 GB, supporta input testuali e immagini ed è distribuita con licenza Apache 2.0. È un punto di partenza, non una raccomandazione definitiva. Per compiti diversi – scrittura, riassunto, programmazione, analisi di immagini – può essere opportuno scegliere famiglie differenti.

4. Elaborazione locale, privacy e scuola

Quando un modello già scaricato viene eseguito interamente sul dispositivo, i prompt e le risposte possono restare sul dispositivo. LM Studio dichiara che chat, documenti e server locale funzionano offline; Ollama dichiara di non ricevere prompt e dati durante l’esecuzione locale. Questa possibilità riduce la trasmissione a fornitori esterni, ma richiede una configurazione coerente.

Ollama offre infatti anche modelli cloud e ricerca sul web; chi vuole imporre il solo uso locale deve disattivare queste funzioni. LM Studio necessita della rete per cercare e scaricare modelli, e può collegarsi a servizi esterni attraverso integrazioni. Un server locale esposto sulla rete scolastica, inoltre, va protetto e amministrato.

In una scuola vanno quindi considerate almeno queste condizioni:

  1. quali dati possono essere inseriti e da chi;
  2. dove vengono conservate chat, documenti e registri;
  3. chi può accedere al dispositivo o al server;
  4. quali collegamenti di rete e integrazioni sono attivi;
  5. come vengono aggiornati software e modelli;
  6. quale licenza disciplina il modello scelto.

L’elaborazione locale è dunque una misura tecnica utile, non una garanzia automatica di sicurezza o conformità. Nel giugno 2026 il Garante per la protezione dei dati personali ha ricordato che la normativa privacy si applica pienamente alle sperimentazioni di IA nella scuola e che i trattamenti ad alto rischio richiedono valutazioni e misure specifiche.

5. Limiti da mettere in conto

  • Qualità variabile. Un modello piccolo può essere adeguato a riscritture o classificazioni semplici e deludente in compiti complessi. Le risposte vanno sempre verificate.
  • Conoscenze non aggiornate. Senza strumenti esterni il modello non consulta il web e risponde sulla base dei dati di addestramento e del materiale fornito nella conversazione.
  • Prestazioni legate alla macchina. Velocità, lunghezza del contesto e numero di richieste simultanee dipendono dalla memoria e dall’accelerazione disponibili.
  • Consumo di risorse. CPU e GPU possono scaldarsi e assorbire energia; locale non significa privo di costi materiali.
  • Controllo incompleto. Un prompt di sistema orienta il comportamento, senza impedire errori, contenuti inappropriati o allucinazioni.

6. Prima attività: installare e provare

A. Ollama

  1. Verifica la compatibilità. Dal sito ufficiale scarica la versione per macOS, Windows o Linux e controlla i requisiti del sistema operativo.
  2. Installa e avvia. Su macOS e Windows l’applicazione può partire insieme al sistema; questo comportamento può essere disattivato nelle impostazioni di avvio.
  3. Scarica un piccolo modello. Apri il terminale e digita «ollama run qwen3.5:4b». Al primo avvio Ollama scarica il modello; in seguito lo carica dal disco.
  4. Fai una prova controllata. Chiedi una breve riscrittura o un riassunto di un testo non riservato. Per uscire dalla chat digita «/bye».
  5. Controlla dove lavora il modello. Con «ollama ps» puoi vedere se il carico è sulla CPU, sulla GPU o ripartito. Se il progetto richiede un ambiente soltanto locale, disattiva le funzioni cloud seguendo la FAQ ufficiale.

B. LM Studio

  1. Verifica la compatibilità. Su Mac serve Apple Silicon; su Windows x64 è richiesto AVX2. Scarica il programma dal sito ufficiale e installalo.
  2. Apri la sezione Discover. Cerca una famiglia di modelli, per esempio «Qwen3.5», oppure incolla il nome completo di un repository di Hugging Face.
  3. Scegli il file. Per iniziare seleziona una variante piccola e quantizzata almeno a 4 bit. Controlla dimensione, licenza e compatibilità prima del download.
  4. Carica il modello nella Chat. Apri una nuova conversazione, seleziona il modello scaricato e osserva la stima della memoria richiesta.
  5. Ripeti la stessa prova. Usa lo stesso testo e la stessa consegna impiegati con Ollama. Confronta velocità, qualità della risposta, consumo di memoria e facilità d’uso.

Lo scopo di questa prima attività non è trovare subito il modello «migliore». È imparare a vedere la filiera: da dove provengono i pesi, quanto occupano, quali risorse usano, dove restano i dati e quali funzioni dipendono ancora dalla rete. L’autonomia digitale comincia da questa possibilità di osservare e scegliere.


Leggi la prima puntata qui: https://laricerca.loescher.it/artigiani-digitali-1-introduzione-un-altro-orizzonte/ 

Condividi:
Dario Zucchini

docente di Informatica e animatore digitale presso l’ITI Majorana di Grugliasco, è esperto di sistemi e reti con una storia che parte dal coding e dal fascino pionieristico per ELIZA. Collaboratore di Dschola.it, è attivamente impegnato nella formazione docenti.

Marco Guastavigna

Insegnante nella scuola secondaria di secondo grado e formatore. Tiene traccia della sua attività intellettuale in www.noiosito.it.

Simone Conradi

ha un dottorato in fisica teorica e insegna informatica e intelligenza artificiale presso l’Itis Delpozzo di Cuneo. Coautore di un manuale di AI artificiale, è convinto che si capisce davvero solo ciò che si è capaci di costruire.

Contatti

Loescher Editore
Via Vittorio Amedeo II, 18 – 10121 Torino

laricerca@loescher.it
info.laricerca@loescher.it