Vai al contenuto

AI locale

Non esiste un’architettura migliore in assoluto. Esiste quella adatta a ciò che devi proteggere, a quanto vuoi spendere e a come lavorano le persone.

AI in Locale (On-Premise)

I modelli linguistici open-source (es. Llama, Mistral, Qwen) vengono installati ed eseguiti direttamente su server, workstation o mini-PC locali protetti dalla rete aziendale.

Hardware
Richiede hardware dedicato provvisto di GPU adeguate (VRAM dimensionata sui parametri del modello scelto) o server dedicati.
Riservatezza
I dati rimangono all’interno del perimetro di rete aziendale; nessun testo o documento transita su provider esterni.
Connessione
Funziona in assenza di connessione internet esterna (air-gapped o intranet protetta).
Manutenzione
Manutenzione hardware, aggiornamento dei pesi dei modelli e gestione dell’infrastruttura sono a carico dell’organizzazione.

Quando ha senso ciascuna.

In locale

Modelli eseguiti su macchine o server dedicati interni all’azienda

  • Documenti strettamente confidenziali o soggetti a rigidi vincoli di riservatezza
  • Stabilimenti produttivi o ambienti con connessione internet instabile o assente
  • Costi di inferenza prevedibili e indipendenti dal numero di token elaborati

La velocità di calcolo dipende dall’hardware a disposizione. Hardware, prestazioni e compatibilità vanno valutati analizzando le dimensioni dei modelli e il carico d’uso previsto.

In cloud

Modelli avanzati erogati tramite endpoint sicuri di grandi provider

  • Attività che richiedono massima capacità di ragionamento logico o contesti documentali enormi
  • Avvio rapido senza investimenti anticipati in macchine o schede grafiche dedicate
  • Volumi di traffico variabili che richiedono scalabilità elastica immediata

Costi variabili in base al volume di token utilizzati. È fondamentale configurare opportunamente le impostazioni di privacy aziendale del fornitore scelto.

Ibrida

Il bilanciamento tra riservatezza locale e flessibilità cloud

  • Aziende che vogliono la massima potenza analitica senza esporre dati sensibili di clienti o brevetti
  • Percorsi di transizione graduale verso l’adozione dell’AI in azienda
  • Ottimizzazione dei costi di calcolo locali e delle spese API

Richiede una progettazione attenta del gateway di routing per definire con precisione cosa può uscire dal perimetro locale e cosa deve rimanere confinato.

Valutiamo l’architettura giusta.

Hardware, modelli e costi dipendono dal carico reale. Partiamo da quello, con una call di 30 minuti.