Far girare in locale il tuo compagno AI: cosa serve

Scegliere un’app

Ogni conversazione con un'app di compagnia ospitata vive sul server di qualcun altro. Farne girare una a casa è l'unico modo per cambiare davvero la cosa. È anche gratis, senza censura di default e ormai davvero valida, e ti chiede più di quanto ammettano la maggior parte delle guide.

Potremmo ricevere una commissione dai link di questa pagina. Non cambia mai un voto.

L'espressione «fai girare la tua fidanzata AI» fa pensare a un unico programma. In pratica sono tre pezzi che dialogano tra loro, e capire quale fa cosa risparmia la maggior parte delle frustrazioni.

I tre pezzi

Schema di una configurazione locale di compagno AI: un front-end SillyTavern nel browser invia i prompt a un back-end come KoboldCpp o Ollama, che esegue un file di modello GGUF sulla scheda grafica

Cosa parla con cosa in una tipica configurazione locale.

Il front-end è ciò che vedi: finestre di chat, personaggi, avatar, impostazioni. SillyTavern è la scelta standard per la chat con personaggi. Gira nel browser, salva personaggi e chat come file sul tuo disco e si collega a quasi qualsiasi back-end. Non genera testo da sé.

Il back-end carica il modello e genera le risposte. KoboldCpp è un unico programma senza installazione, apprezzato per il gioco di ruolo perché espone ogni impostazione di generazione. Ollama è il modo più semplice per far partire un modello con pochi comandi. LM Studio è un'app desktop con un comodo browser di modelli. Ognuno di essi mette a disposizione il modello su un indirizzo locale a cui si collega il front-end.

Il modello è un file di grandi dimensioni, di solito in formato GGUF, scaricato da Hugging Face. La sua dimensione in parametri (8B, 12B, 24B) e la sua quantizzazione decidono quanto è valido e di che hardware ha bisogno.

La questione dell'hardware

Ciò che decide se un modello gira bene è la memoria grafica (VRAM). Il modello deve starci, più lo spazio per la conversazione stessa. La quantizzazione riduce i modelli per farli entrare: «Q4_K_M» è il compromesso più comune tra dimensione e qualità.

Dimensione del modelloMemoria approssimativa a Q4Hardware tipicoCosa aspettarsi
7-8B5-6 GBScheda grafica da 8 GBCoerente, veloce, dimentica i dettagli nelle scene lunghe
12-14B9-10 GBScheda da 12 GBPersonaggi e prosa sensibilmente migliori
22-24B14-16 GBScheda da 16-24 GBVicino alle buone app ospitate per il gioco di ruolo
70B40 GB+Due schede o un Mac con molta memoriaEccellente, lento e costoso

Queste cifre sono indicative: un contesto più lungo richiede altra memoria. I Mac con Apple Silicon condividono la memoria tra processore e grafica, quindi un MacBook da 32 GB può far girare modelli che una scheda grafica da 12 GB non regge. Un modello che non ci sta finisce sul processore principale e rallenta da morire: se le risposte arrivano a poche parole al secondo, passa a un modello più piccolo prima di provare una quantizzazione più dura. Un modello più piccolo a buona qualità di solito batte uno più grande compresso troppo.

Cosa guadagni

  • Una privacy che non dipende da un'informativa. Nulla lascia la macchina. Nessun periodo di conservazione, nessun addestramento, nessun accesso del personale, niente da cancellare in seguito.
  • Nessun filtro oltre a quello del modello. Scegli tu il modello, compresi quelli tarati apposta per il gioco di ruolo. Il limite legale sui contenuti vale comunque per te, ma nessun gestore aggiunge regole in più.
  • Niente abbonamento e niente crediti. Generi quanto vuoi.
  • Personaggi che sono tuoi. Le schede dei personaggi sono normali immagini PNG con la scheda incorporata. Passano da un front-end all'altro e nessun aggiornamento può portartele via.
  • Stabilità. Un modello che funziona oggi funziona allo stesso modo fra cinque anni. Nessuno può sostituirlo sotto i tuoi occhi, il rischio descritto in quando il tuo compagno AI cambia da un giorno all'altro.

Cosa lasci

  • Tempo di configurazione. Metti in conto una serata per la prima chat funzionante e settimane di sperimentazione se ti diverte.
  • La memoria è compito tuo. Le app ospitate riassumono e salvano di nascosto fatti su di te. In locale la gestisci con i lorebook, i riassunti e le note del personaggio di SillyTavern: gli stessi tre meccanismi spiegati in come funziona la memoria di un compagno AI, solo con i controlli a vista.
  • Immagini e voce sono progetti separati. La generazione di immagini richiede un modello a parte e di solito più memoria grafica; la voce richiede strumenti di riconoscimento e sintesi vocale. Tutto possibile, niente automatico.
  • Il mobile è scomodo. Puoi aprire il front-end dal telefono con il Wi-Fi di casa. Usarlo fuori casa significa esporre il computer a internet, cosa che richiede cautela.
  • Un tetto di qualità. I migliori modelli ospitati sono più grandi di qualsiasi cosa la maggior parte delle persone possa far girare a casa, soprattutto per la coerenza a lungo termine.

La via di mezzo e il suo inconveniente

Molti fanno girare SillyTavern sulla propria macchina ma lo collegano a un'API cloud a pagamento invece che a un modello locale. Ottieni il controllo del front-end e i file dei personaggi, modelli molto più grandi e un prezzo a messaggio che può essere basso per un uso leggero.

Ma non è privato. Ogni messaggio va al fornitore dell'API, con le sue regole di registrazione, conservazione e contenuti, spesso più severe sul gioco di ruolo delle app di compagnia dedicate. È un compromesso diverso, non una configurazione locale.

Nozioni di sicurezza

  • Scarica il software solo dalle pagine ufficiali dei progetti su GitHub o dal sito del progetto stesso.
  • Scarica i modelli da autori noti su Hugging Face e preferisci i file GGUF, che contengono dati del modello e non codice.
  • Leggi la licenza del modello. Alcune limitano l'uso commerciale; poche limitano certi contenuti.
  • Tieni SillyTavern legato alla tua macchina o alla rete domestica, a meno che tu non abbia impostato una password e capito cosa stai esponendo.

La pagina del progetto SillyTavern su GitHub

SillyTavern è sviluppato in modo aperto su GitHub.

Per chi è

Fai girare un compagno in locale se la privacy è la tua preoccupazione principale, hai già hardware adeguato o ti piace configurare le cose quanto usarle. Resta su un'app ospitata se vuoi voce, immagini e memoria lunga che funzionino subito, o se chatti soprattutto dal telefono. La nostra guida alla scelta della prima app tratta quella strada. Molti finiscono per avere entrambe: un'app ospitata per comodità e una configurazione locale per le conversazioni che preferirebbero non archiviare altrove.

Domande frequenti

Far girare un compagno AI in locale è gratis?

Il software è gratuito e open source e non c'è nessun abbonamento. I costi sono l'hardware, soprattutto una scheda grafica con memoria sufficiente, e la corrente elettrica. Se hai già un PC da gaming o un Mac recente, il costo aggiuntivo può essere vicino a zero.

Posso usare un compagno AI locale sul telefono?

Per il modello in sé non in modo realistico, ma puoi far girare tutto sul computer e aprire l'interfaccia di chat dal browser del telefono, sulla stessa rete domestica. SillyTavern lo permette con una modifica alle impostazioni.

Una configurazione locale è completamente privata?

Solo se il modello gira sulla tua macchina. Molti usano SillyTavern con un'API cloud a pagamento, e in quel caso ogni messaggio va al fornitore dell'API, con i suoi registri e le sue regole sui contenuti.