Atto 3 · Pagina 8

La mappa dei significati

Per l'IA il significato non è una definizione: è una posizione. Prima di dirti come si chiama, ti chiedo di indovinarne le regole.

📖 Livello di lettura
🗺️ Come una mappa delle città: due città vicine lo sono per un motivo. Qui due parole vicine condividono significato.
Schema Come funziona, in breve
LA PAROLA I NUMERI · EMBEDDING LA POSIZIONE "re" [0.8, 0.1, 0.7, … , 0.4]
Fai Indovina le regole (prima di vedere la mappa)
1. Quale parola sta più vicino a "re" nello spazio dei significati?
2. Allora prova l'aritmetica: re − uomo + donna = ?
Scopri Eccola: la mappa vera
La mappa dei significati esempio illustrativo
Esplora: aritmetica dei significati
+
Aggiungi una parola tua → la mappa passa ai vettori veri

Clicca una parola: si illuminano le tre più vicine. O rifai l'aritmetica con altre parole.

Nome Adesso i termini
Quei numeri si chiamano embedding. Lo spazio in cui vivono è lo spazio latente. La vicinanza si chiama similarità. Il modello non sa cosa sia un re: sa solo dove sta.

Sto semplificando molto. Lo spazio vero ha migliaia di dimensioni e non si può disegnare: questo è il suo schiacciamento su un foglio, con tutte le altre direzioni compresse via. E finché il cartellino sopra la mappa dice «esempio illustrativo», le posizioni le ho scelte io a mano per far vedere l'idea: diventano quelle vere — calcolate dai numeri del modello — solo quando premi «Aggiungi alla mappa», e allora il cartellino diventa verde. Anche con i vettori veri, però, l'aritmetica non torna sempre alla perfezione: è un limite noto e studiato, non un difetto di questa pagina.

💡 Il punto. Il modello non sa che cosa sia un re. Sa soltanto dove sta «re» rispetto a tutte le altre parole — e per rispondere alle tue domande, sorprendentemente, gli basta.
Il feedback e il tutor sono generati dall'IA (con la connessione attiva); il tutor lo incolli in un altro chatbot per continuare.

Quando dico «spazio» non sto usando una metafora comoda: uso la parola nel senso preciso che le dà la geometria. Un punto sul foglio ha due coordinate, un punto nella stanza ne ha tre, e un embedding — il vettore che il modello associa a un pezzo di testo — ne ha quante gliene ha assegnate l'architettura. Il modello che questa pagina interroga davvero quando premi «Aggiungi alla mappa» è gemini-embedding-001, e di default restituisce un vettore di 3072 numeri (documentazione dell'API Gemini). Un vettore, in matematica, è esattamente questo: una lista ordinata di numeri, ciascuno una coordinata lungo un asse. Con 3072 coordinate in virgola mobile la parola «cane», che di lettere ne ha quattro, diventa un oggetto da dodici kilobyte. E nessuno di quegli assi porta un nome scelto da un essere umano: non c'è l'asse «regalità» accanto all'asse «femminile». Gli assi sono quelli che l'addestramento ha trovato convenienti, e capire che cosa significhino è un problema di ricerca ancora aperto.

Immaginare 3072 dimensioni è fuori portata, ma il loro comportamento si calcola, ed è il comportamento a sorprendere. In uno spazio a d dimensioni due vettori presi a caso sono quasi sempre quasi perpendicolari: il coseno dell'angolo che formano ha valore atteso zero e deviazione standard 1/√d, cioè circa 0,018 per d = 3072. Tradotto: peschi due parole a caso e la loro somiglianza è praticamente nulla. Lo spazio è quasi tutto vuoto, ed è proprio questo vuoto a permettergli di ospitare un numero enorme di concetti distinti senza che si pestino i piedi — il lato buono di ciò che di solito si chiama maledizione della dimensionalità.

La mappa che hai davanti ha due dimensioni, e quindi per costruzione mente: sta comprimendo 3072 numeri in 2. Il modo in cui li comprime si chiama analisi delle componenti principali (PCA), e il criterio è dichiarato: fra tutte le direzioni possibili dello spazio, la PCA cerca quella lungo cui i punti si sparpagliano di più — la direzione di massima varianza — poi, fra quelle perpendicolari alla prima, di nuovo quella che sparpaglia di più, e adotta le due come asse orizzontale e asse verticale del disegno. È il modo più onesto di spendere due soli numeri per punto. Resta che tutto il resto viene schiacciato via.

Quanto resto? È una quantità misurabile, e questa pagina la misura invece di raccontartela: quando i vettori veri arrivano, sotto la mappa compare la quota di varianza che le due direzioni disegnate riescono a trattenere — con diciotto parole divise in quattro gruppi netti la percentuale non è nemmeno bassa, ed è comunque quello che perdi. Perché la conseguenza è seria: due parole che sul foglio sembrano vicine possono stare lontanissime lungo una delle 3070 direzioni che non stai vedendo. Vale anche per le mappe più celebri — Martin Wattenberg, Fernanda Viégas e Ian Johnson hanno mostrato su Distill che nelle nuvole disegnate con t-SNE, l'algoritmo che produce la maggior parte delle mappe di embedding in circolazione, la dimensione dei grappoli e le distanze fra un grappolo e l'altro spesso non vogliono dire niente. La metafora della carta geografica regge fino a un certo punto, e conviene dire dove si spezza: la proiezione di Mercatore deforma le aree ma conserva gli angoli, e si sa esattamente che cosa sacrifica; una proiezione da 3072 dimensioni a 2 butta via informazione senza che nessuna regola semplice dica quale. Una mappa dello spazio latente è un'illustrazione, non una misura.

Il mito: «re − uomo + donna = regina dimostra che il modello ha capito le analogie». L'idea nasce con word2vec nel 2013, quando Tomáš Mikolov, Wen-tau Yih e Geoffrey Zweig osservano che le relazioni fra parole sembrano tradursi in scarti costanti fra vettori. Il numero da circo funziona, ma è truccato in due punti. Il primo lo smonta Tal Linzen nel 2016: il metodo dello scarto (offset) si appoggia alla similarità del coseno e finisce per confondere la coerenza della direzione con la struttura del vicinato, cioè col fatto banale che «regina» è già una delle parole più vicine sia a «re» sia a «donna»; controlli elementari — rispondere con il vicino più prossimo di «donna» e basta, ignorando del tutto la sottrazione — se la cavano quasi altrettanto bene su parecchie categorie. Il secondo sta nell'implementazione: il codice standard esclude d'ufficio le tre parole di partenza dalle risposte ammesse, così «re» non può mai vincere e «regina» arriva prima anche per forfait. Malvina Nissim, Rik van Noord e Rob van der Goot lo hanno documentato in «Fair Is Better than Sensational» (Computational Linguistics 46/2, 2020, doi:10.1162/coli_a_00379), mostrando che diverse analogie celebri sui pregiudizi — «uomo sta a programmatore come donna sta a casalinga» — sono in buona parte un artefatto di quel filtro. Non è un motivo per buttare via l'idea: le direzioni nello spazio esistono e contano. È un motivo per diffidare della versione da titolo di giornale. E per provare: premi «Aggiungi alla mappa», passa ai vettori veri e rifai l'aritmetica. Se atterra altrove, quello è il risultato.
‖a − b‖² = 2 − 2·cos(a, b) la vicinanza, in formula

Con i vettori veri attivi, i tre vicini che la mappa collega col tratteggio non sono i più vicini sul disegno: sono i più vicini nello spazio intero a 3072 dimensioni, calcolati con la distanza euclidea. Per vettori di norma 1 — e quelli di gemini-embedding-001 a piena dimensione lo sono — ordinare per distanza euclidea crescente o per coseno decrescente dà la stessa classifica, perché vale l'identità qui sopra. L'aritmetica delle analogie fa eccezione: il vettore a − b + c non ha norma 1, l'equivalenza salta, e il risultato dipende da quale delle due misure si sceglie. È una di quelle decisioni che nei paper finiscono in nota, e che spiegano perché due implementazioni della stessa analogia possano non essere d'accordo.

Guarda Un concetto vero, dentro un modello vero

Fin qui la mappa è fatta di parole intere. Dentro un modello, però, i concetti non stanno nelle parole: stanno nei numeri che scorrono da uno strato all'altro — e da qualche anno esiste un modo per andarli a guardare uno per uno. La finestra qui sotto è uno di quei concetti, estratto da un modello vero di Google e messo online da Neuronpedia: il concetto «cane». Scrivi una frase nel campo di prova e guarda su quali parole si accende.

Se apri un neurone di un modello linguistico e guardi quando si attiva, quasi sempre lo trovi polisemantico: risponde ai gatti, a certe righe di codice e a un paio di cognomi, tutto insieme. Nel 2022 Nelson Elhage e colleghi hanno proposto la spiegazione oggi più accreditata, la sovrapposizione (superposition): il modello ha molti più concetti da rappresentare di quanti neuroni possieda, e allora li impacchetta come direzioni non perpendicolari dentro lo stesso spazio, accettando un po' di interferenza in cambio di parecchia capacità in più. È qui che torna il conto di prima: se in 3072 dimensioni due direzioni prese a caso sono già quasi perpendicolari, se ne possono stipare molte più di 3072 restando quasi distinguibili. E se i concetti sono direzioni e non neuroni, cercarli neurone per neurone è cercarli nel posto sbagliato.

Lo strumento che li tira fuori si chiama sparse autoencoder: una rete piccola addestrata a riscrivere l'attivazione di uno strato come somma di pochissimi elementi presi da un dizionario molto più grande dello strato stesso. Ogni elemento del dizionario è una feature, e a differenza dei neuroni le feature tendono a essere monosemantiche: una vuol dire «cani», un'altra «viaggi nel tempo», un'altra ancora il ponte di San Francisco — quella che nel 2024 Anthropic ha amplificato a mano per ottenere il Golden Gate Claude. Nello stesso anno Google DeepMind ha pubblicato Gemma Scope, centinaia di sparse autoencoder aperti addestrati su tutti gli strati di Gemma 2 (Lieberum et al., 2024), proprio perché addestrarli costa troppo per chi non sia un'azienda; Neuronpedia le ha messe online una per una. Quella qui sotto è la feature 12082 dello strato 20 di Gemma 2 2B.

Che cosa stai guardando. La scheda di una singola feature di Gemma 2 2B: in alto la spiegazione automatica (in inglese: «riferimenti ai cani come animali domestici»), sotto i frammenti di testo che la fanno accendere, con l'intensità resa in colore. Nel campo di prova puoi scrivere una frase tua — anche in italiano, come quella che ho già lasciato lì — e premere invio: vedrai su quali parole il concetto si attiva e su quali resta spento. È il modo più diretto per capire che cosa significhi «un concetto è una direzione nello spazio», e vale la pena provare anche parole che con i cani non c'entrano, per vedere il silenzio.
⚠️ Interfaccia in inglese e pensata per lo schermo grande: meglio da computer. Da telefono si legge, ma è un'altra esperienza; in alternativa aprila a tutta pagina oppure parti dalla demo guidata di Gemma Scope.

Neuronpedia (neuronpedia.org) · dati Gemma Scope, Google DeepMind 2024

Fonti Per approfondire

Complessità della fonte: divulgativa approfondimento tecnica o accademica

  • Gioco Neuronpedia, «Gemma Scope» — la demo guidata di Google DeepMind e Neuronpedia: si accendono e si spengono a mano i concetti dentro un modello. Da computer. neuronpedia.org
  • Gioco Embedding Projector (TensorFlow, Google) — uno spazio di embedding vero da ruotare in 3D, con PCA, t-SNE e UMAP a scelta: si vede in diretta che cosa cambia fra una proiezione e l'altra. projector.tensorflow.org
  • Saggio M. Wattenberg, F. Viégas, I. Johnson, «How to Use t-SNE Effectively», Distill, 2016 — interattivo: perché la dimensione dei grappoli e le distanze fra grappoli, nelle mappe di embedding, ingannano. distill.pub
  • Fonte Google, «Embeddings», documentazione dell'API Gemini — le dimensioni dei vettori (3072 di default per gemini-embedding-001) e la normalizzazione: il numero usato in questa pagina. ai.google.dev
  • Paper T. Mikolov, W. Yih, G. Zweig, «Linguistic Regularities in Continuous Space Word Representations», NAACL 2013 — l'origine di re − uomo + donna: le relazioni come scarti costanti fra vettori. aclanthology.org
  • Paper T. Linzen, «Issues in Evaluating Semantic Spaces Using Word Analogies», RepEval @ ACL 2016 — il metodo dello scarto confonde la coerenza della direzione con il vicinato; propone i controlli che mancavano. aclanthology.org · arxiv
  • Paper M. Nissim, R. van Noord, R. van der Goot, «Fair Is Better than Sensational: Man Is to Doctor as Woman Is to Doctor», Computational Linguistics 46(2), 2020 — l'esclusione d'ufficio delle parole di partenza e le analogie sui pregiudizi che ne escono gonfiate. aclanthology.org
  • Paper N. Elhage et al., «Toy Models of Superposition», Transformer Circuits, 2022 — perché un concetto è una direzione e non un neurone, dimostrato su modelli giocattolo. transformer-circuits.pub
  • Paper T. Lieberum et al., «Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2», 2024 — gli sparse autoencoder aperti da cui viene la scheda qui sopra. arxiv.org
  • Paper A. Templeton et al., «Scaling Monosemanticity», Anthropic, 2024 — le feature estratte da un modello di produzione, e l'esperimento del Golden Gate Claude. transformer-circuits.pub
  • Lezione 3Blue1Brown, «Transformers, the tech behind LLMs» — la parte sugli embedding e sulla direzione «maschile → femminile», spiegata visivamente (inglese, con sottotitoli). youtube.com