Dario Amodei non ha costruito la prima rete neurale né inventato l’architettura su cui corrono i modelli di oggi. Ha fatto una cosa diversa, da fisico e non da ingegnere: ha misurato la legge con cui crescono. Da quella misura discendono la corsa industriale, il treno che l’Europa e l’Italia rischiano di perdere per sempre e l’allarme che ha appena portato all’ONU.
Il 23 settembre, per la prima volta, il Consiglio di sicurezza delle Nazioni Unite ha ascoltato i capi dei laboratori che costruiscono l’intelligenza artificiale. Fra loro c’era Dario Amodei, amministratore delegato di Anthropic, e il suo è stato l’intervento più allarmato. Ha definito l’IA la più importante questione di sicurezza globale del nostro tempo e ha indicato due pericoli precisi: l’uso dei modelli per facilitare la costruzione di armi biologiche e la perdita di controllo su sistemi le cui capacità crescano più in fretta della possibilità di governarli. Ha poi proposto standard globali per collaudare i modelli più avanzati, meccanismi internazionali di verifica e un sistema di notifica degli abusi. Gli Stati Uniti hanno fatto sapere di non voler sostenere alcun organismo internazionale che fissi le regole. Il giorno dopo, a Washington, fra gli alleati del presidente Trump si ragionava apertamente su come fare di Amodei il volto del catastrofismo sull’intelligenza artificiale. Chi liquida quell’allarme come la paura di un profeta di sventura dovrebbe prima sapere chi lo ha lanciato. Non un filosofo, né un commentatore, ma uno degli scienziati che hanno capito, prima e meglio di quasi tutti, come si fa crescere un’intelligenza artificiale. E che lo ha capito non da ingegnere, ma da fisico: una differenza che spiega, come vedremo, molto più di quanto sembri.
Un fisico-biologo fra le macchine
Amodei è nato a San Francisco nel 1983 da padre italiano, un artigiano originario di Massa Marittima, e da madre americana. Ha studiato fisica al Caltech e a Stanford, ha conseguito il dottorato in biofisica a Princeton lavorando su modelli di meccanica statistica dei circuiti neurali e ha proseguito come ricercatore post-dottorato alla facoltà di medicina di Stanford. Per anni, dunque, il suo oggetto di studio non sono state le macchine, ma i neuroni veri: come migliaia di cellule nervose, ciascuna relativamente semplice, producano insieme comportamenti complessi. Poi il passaggio all’intelligenza artificiale: Baidu, Google Brain e infine OpenAI, dove da vicepresidente della ricerca ha guidato lo sviluppo di GPT-2 e GPT-3. È fra gli ideatori dell’apprendimento per rinforzo dal feedback umano, la tecnica con cui oggi si insegna ai modelli a comportarsi come le persone si aspettano. Nel 2021 ha lasciato OpenAI con la sorella Daniela e un gruppo di colleghi per fondare Anthropic, la società che sviluppa Claude. C’è però un suo contributo meno noto al grande pubblico e forse più decisivo di tutti: la misura delle leggi di scala. Per capire come sia nato, bisogna prima capire in che cosa un fisico differisca da un ingegnere.
Un fisico non è un ingegnere
La distinzione può sembrare accademica; è invece la chiave di questa storia. L’ingegnere e il fisico usano la stessa matematica, e seguono un percorso iniziale di studi molto simile, ma si pongono domande diverse. L’ingegnere si chiede come far funzionare un oggetto: ha un progetto, dei requisiti, un budget, e il suo successo si misura sul risultato. Un ponte deve reggere, un motore deve rendere, un programma deve girare. Il fisico si chiede a quale legge obbedisca un fenomeno, anche quando quel fenomeno è un oggetto costruito dall’uomo. Non gli interessa, in prima battuta, migliorare la macchina: gli interessa capire che cosa accade se, in essa, ad esempio, si fanno variare alcuni parametri di cento, mille, un milione di volte.Nel 2019 il mondo dell’apprendimento automatico ragionava, in larga parte, da ingegnere. Si progettava un’architettura nuova, la si confrontava con le precedenti su una tabella di prove standardizzate e si festeggiava magari il punto percentuale guadagnato su una data prova. È un metodo che ha prodotto risultati straordinari, ma che guardava un modello alla volta. Chiedersi invece come vari l’errore quando la dimensione cresce, ad esempio, su più di sei ordini di grandezza, e tracciarne il grafico in scala logaritmica alla ricerca di una retta, è un gesto tipico del fisico. Non a caso a coordinare il lavoro del 2020 da cui nasce questa storia fu Jared Kaplan, fisico teorico della Johns Hopkins University. C’è un risultato che rivela più di ogni altro questa impronta. Entro un ampio intervallo, la forma precisa della rete neurale, più profonda o più larga, conta poco: ciò che conta è la scala. Per un ingegnere è quasi una provocazione, perché i dettagli del progetto sono il suo mestiere. Per un fisico è un’idea familiare, che la meccanica statistica chiama universalità: sistemi diversissimi nei dettagli, come un magnete e un fluido vicino al punto critico, obbediscono alle stesse leggi, con gli stessi esponenti. Amodei aveva studiato proprio la meccanica statistica dei circuiti neurali. E c’è la biologia. Chi viene dalle scienze della vita conosce le leggi di potenza da quasi un secolo: nel 1932 Max Kleiber mostrò che il metabolismo degli animali cresce con la massa corporea elevata a circa tre quarti, dal topo all’elefante, con una regolarità sorprendente. È la stessa forma matematica che ritroveremo nella formula dell’IA. Chi ha studiato i neuroni sa inoltre che anche il cervello è, in un certo senso, un sistema scalato: principi relativamente semplici, ripetuti su un numero enorme di elementi. Per un fisico-biologo, l’idea che una rete artificiale potesse migliorare soprattutto crescendo non era un azzardo, ma un’ipotesi naturale da verificare. Chi scrive queste righe conosce quel percorso dall’interno: sono un fisico che, fin dai tempi della tesi di laurea, si è appassionato alla biologia, l’ha studiata a fondo e ancora la studia. Forse per questo la traiettoria di Amodei, dalla fisica ai neuroni e dai neuroni alle macchine, mi sembra meno sorprendente di quanto appaia a molti commentatori. Chi ha imparato a guardare la vita con gli strumenti della fisica è abituato a cercare, sotto la complessità, poche leggi semplici.Questo non significa che l’ingegneria conti meno. Sono stati gli ingegneri a costruire le macchine su cui le curve sono state misurate, e saranno gli ingegneri, come vedremo, a sfruttarle fino all’ultimo punto percentuale. Ma la domanda di partenza, quella che ha trasformato una collezione di esperimenti in una legge, è una domanda da fisico. E un fisico porta con sé anche un’altra abitudine, che tornerà utile alla fine di questa storia: sa che ogni legge empirica vale entro un intervallo, e che oltre quell’intervallo la natura può cambiare comportamento all’improvviso.
Un mestiere fatto di probabilità
C’è poi un secondo tratto del mestiere di fisico che rende questa storia quasi inevitabile: la familiarità con la statistica. Chi studia fisica passa anni a calcolare probabilità: la termodinamica, nella sua forma moderna, è meccanica statistica. Nessuno può prevedere il moto di una singola molecola in un litro d’aria, dove a temperatura e pressione ambiente ce ne sono circa venticinquemila miliardi di miliardi; eppure pressione e temperatura di quel gas si calcolano con una precisione straordinaria. È la legge dei grandi numeri: l’individuo è imprevedibile, la collettività no. Su questa idea Ludwig Boltzmann fondò, alla fine dell’Ottocento, la definizione statistica dell’entropia. Lo stesso vale per il mondo delle particelle. La meccanica quantistica non dice dove si trovi un elettrone: assegna a ogni posizione possibile una probabilità. Ripetendo la misura su un numero enorme di sistemi preparati nello stesso modo, quella distribuzione si ricostruisce con precisione sempre maggiore, fino a sfiorare la certezza. Occorre però dire con esattezza che cosa diventa certo: non l’esito della singola misura, che resta intrinsecamente imprevedibile, ma la mappa delle probabilità. Il principio di indeterminazione di Heisenberg aggiunge poi un limite ulteriore: posizione e velocità di una particella non possono mai essere conosciute insieme con precisione arbitraria. Questa è una distinzione sottile, ma è proprio quella che serve per capire un modello linguistico di grandi dimensioni, o LLM, dall’inglese Large Language Model. Un modello linguistico, infatti, in un testo, non sa a priori quale parola verrà dopo la precedente. Come la meccanica quantistica con l’elettrone, esso assegna una probabilità a ciascuna delle parole possibili. La singola scommessa resta incerta; ma, misurata su miliardi di parole, la qualità complessiva delle scommesse diventa una grandezza stabile e calcolabile, come la pressione di un gas. È per questo che le leggi di scala disegnano curve così regolari: descrivono medie su numeri enormi, non casi singoli. E la misura dell’errore che incontreremo fra poco, la loss, ha un nome che un fisico riconosce al primo sguardo: si chiama entropia incrociata, ed è parente stretta dell’entropia di Boltzmann, attraverso quella che Claude Shannon introdusse nel 1948 per la teoria dell’informazione. Per chi aveva studiato la meccanica statistica dei neuroni, guardare a una rete neurale come a un grande sistema di probabilità non era una metafora lontana: era… il linguaggio di casa.
La scoperta di una curva
Una delle idee più importanti dell’intelligenza artificiale contemporanea non nacque dall’invenzione di una macchina nuova: nacque dall’osservazione di una curva. Tra il 2019 e il 2020 un gruppo di ricercatori di OpenAI, coordinato dal fisico Jared Kaplan e con Amodei fra i firmatari in veste di ricercatore senior, studiò in modo sistematico che cosa accade ai modelli linguistici quando crescono tre ingredienti: la dimensione del modello, la quantità di testo con cui viene addestrato e la potenza di calcolo impiegata per addestrarlo. Il risultato sorprese. I miglioramenti non erano capricciosi: seguivano una regola semplice, della stessa forma per tutti e tre gli ingredienti, che reggeva su un intervallo enorme di dimensioni. Erano le leggi di scala, in inglese scaling laws.
La formula, spiegata a chi non fa questo mestiere
Prima della formula servono due nozioni, e sono più semplici di quanto sembri. La prima riguarda ciò che un modello linguistico fa davvero. Gli si dà l’inizio di una frase e lui prova a indovinare come prosegue. Se legge «Nel mezzo del cammin di nostra…», un buon modello scommette quasi tutto su «vita». Se legge «Stamattina ho comprato il...», deve distribuire la scommessa fra pane, giornale, biglietto e mille altre possibilità. La scommessa, però, non dipende soltanto dall’ultima parola, ma da tutto ciò che la precede: se la frase comincia con «Sono passato in edicola: stamattina ho comprato il...», il modello punterà quasi tutto su «giornale»; se comincia con «Ero dal fornaio», su «pane». Tutto ciò che questi sistemi sanno fare, dal tradurre un contratto allo scrivere un programma, nasce da questo gioco, ripetuto miliardi di volte su miliardi di frasi. Il modello guarda soltanto indietro, mai avanti: la parola successiva, per lui, non esiste ancora. La loss, letteralmente «perdita», è il punteggio di questo gioco, con una particolarità: più è bassa, meglio è. Per calcolarla occorre sapere che il gioco si svolge durante l’addestramento, su testi veri scritti da persone: libri, articoli, pagine web. Il meccanismo è quello di un esercizio scolastico. Si copre la parola successiva, il modello fa la sua scommessa, poi si scopre la parola che l’autore aveva effettivamente scritto e si confronta. Se il modello aveva puntato forte su «vita» e nel testo c’è proprio «vita», l’errore è minimo. Se aveva quasi escluso la parola che l’autore aveva invece scelto, l’errore è grande e la loss sale. Il modello non viene giudicato sulla parola che sceglierebbe lui, ma su quanta fiducia aveva accordato a quella giusta. Fatta la media su un’enorme quantità di testo, la loss diventa una misura precisa di quanto il modello abbia capito come funziona la lingua e, attraverso la lingua, una parte del mondo che essa descrive: per indovinare bene la parola successiva in un trattato di chimica, bisogna, ovviamente, sapere un po’ di chimica.
La seconda nozione riguarda i parametri. Si immagini il mixer di uno studio di registrazione, con un numero sterminato di manopole. All’inizio sono tutte in posizione casuale e ne esce soltanto rumore. L’addestramento consiste nel far leggere al modello un testo dopo l’altro e, a ogni parola sbagliata, nel girare leggermente ciascuna manopola nella direzione che riduce l’errore. Dopo miliardi di piccole correzioni, la posizione d’insieme delle manopole custodisce tutto ciò che il modello ha imparato. I parametri sono quelle manopole: più ce ne sono, più sfumature il modello è in grado di registrare. GPT-2, nel 2019, ne aveva un miliardo e mezzo; GPT-3, un anno dopo, 175 miliardi. Nota bene: da GPT-4 in poi OpenAI ha smesso di comunicare questo numero. Per GPT-4 circola una stima di circa 1.760 miliardi, ma è una ricostruzione esterna, non una cifra confermata. Per i modelli successivi non esistono nemmeno stime affidabili. Oggi sono in genere architetture a «miscela di esperti», nelle quali per ogni parola si attiva soltanto una parte dei parametri, e il numero totale dice quindi meno di un tempo. Anthropic, da parte sua, non ha mai reso pubblico il numero di parametri di nessuna versione di Claude, dalla prima all’attuale. Nell’aprile 2026 Elon Musk scrisse che il suo Grok ha 500 miliardi di parametri, la metà di Sonnet e un decimo di Opus; molti ne hanno ricavato che Sonnet abbia circa 1.000 miliardi di parametri e Opus circa 5.000 miliardi. Quando gli chiesero come facesse a conoscere quelle dimensioni, Musk non rispose. Circola anche la cifra di 10.000 miliardi per Claude Mythos, ma nessun annuncio o documento ufficiale di Anthropic la conferma. Sono indiscrezioni, non dati. Comunque, con queste due nozioni la scoperta di Kaplan e Amodei si enuncia in una riga: se si aumentano le manopole, i testi da leggere o la potenza di calcolo, la sorpresa del modello diminuisce, e diminuisce in modo regolare e prevedibile. Nella forma oggi più usata, la relazione si scrive così:
L(x) ≈ L∞ + A · x−α
Si legge in questo modo. L è l’errore del modello. x è l’ingrediente che aumentiamo: parametri, dati o calcolo. L∞, «elle infinito», è il pavimento, ovvero l’errore che resterebbe anche disponendo di risorse illimitate, perché ogni lingua contiene un’incertezza che nessuno può eliminare: neppure il lettore più acuto indovina sempre la parola successiva di un romanzo. A è una costante che dipende dalle unità di misura. Infine α, alfa, è il numero che conta davvero, perché dice quanto rende ogni investimento.
Il segno meno nell’esponente significa che x sta, in pratica, al denominatore: x−α equivale a 1 diviso xα. Più risorse, dunque, meno errore. Ma non in proporzione. Proporzione vorrebbe dire α uguale a 1: raddoppio le risorse e l’errore si dimezza, le moltiplico per dieci e diventa un decimo. Nell’intelligenza artificiale non va mai così. Gli esponenti misurati sono piccoli, frazioni di unità, e la formula dice allora una cosa precisa: ogni volta che moltiplichiamo le risorse per lo stesso fattore, la parte eliminabile dell’errore si riduce della stessa percentuale. Non di una quantità fissa, ma di una percentuale fissa.
Conviene vedere che cosa sia x in concreto. Può essere il numero di parametri: un miliardo, dieci miliardi, cento miliardi. Può essere la quantità di testo letta durante l’addestramento, misurata in token, i frammenti di parola con cui i modelli leggono, di cui diremo più avanti. Oppure la potenza di calcolo impiegata, contata in operazioni elementari: numeri con venti e più zeri. La formula ha la stessa forma per tutti e tre gli ingredienti; cambiano soltanto i valori di A e di α.
Un esempio con numeri tondi, puramente illustrativo. Supponiamo che α valga 0,1 e che un modello da un miliardo di parametri abbia una parte eliminabile dell’errore pari a 10, in unità qualsiasi. Passando a dieci miliardi di parametri, l’errore scende a 7,9; a cento miliardi, a 6,3; a mille miliardi, a 5. A ogni moltiplicazione per dieci si guadagna sempre il 21 per cento, ma in valore assoluto il guadagno si assottiglia: 2,1 punti, poi 1,6, poi 1,3. E per dimezzare l’errore è servito un modello mille volte più grande.
L’esponente α è dunque la pendenza del cammino, e piccole differenze pesano moltissimo. Moltiplicando le risorse per dieci, con α pari a 0,5 l’errore eliminabile cala del 68 per cento; con α pari a 0,1, del 21 per cento; con α pari a 0,05, soltanto dell’11 per cento. Un α grande è una discesa ripida verso l’errore minimo; un α piccolo è un pendio quasi piatto, sul quale si avanza di pochi passi al prezzo di quantità enormi di risorse. I valori misurati nei modelli linguistici, come vedremo subito, stanno dalla parte del pendio quasi piatto.
I valori misurati da Kaplan rendono l’idea concreta. Per la dimensione del modello, α vale circa 0,076: raddoppiando i parametri, l’errore eliminabile scende di circa il 5 per cento, e per dimezzarlo occorre un modello circa novemila volte più grande. Per il calcolo, α è ancora più piccolo, circa 0,05: per dimezzare l’errore bisogna moltiplicare la potenza di calcolo per circa un milione. Queste stime valgono quando gli altri ingredienti non fanno da freno.
È, in qualche modo, la legge del ripasso che ogni studente dovrebbe conoscere: le prime ore di studio fanno guadagnare molti punti, le successive sempre meno. Qui però quel «sempre meno» è misurato con precisione, e la precisione è tutto. Su un grafico con scale logaritmiche, dove ogni tacca vale dieci volte la precedente, la relazione diventa una linea retta. Ed è la retta il vero regalo: misurando l’errore di una serie di modelli piccoli ed economici, la si può prolungare con un righello e prevedere, entro certi limiti, quanto sbaglierà un modello cento volte più grande prima ancora di spendere un euro per costruirlo. Una precisazione per il lettore esperto: nel lavoro di Kaplan e colleghi del 2020, Scaling Laws for Neural Language Models, la relazione compariva come legge di potenza pura, senza il termine L∞. Il pavimento è stato esplicitato dagli studi immediatamente successivi: prima, nello stesso 2020, dal lavoro di Henighan e colleghi sui modelli generativi, poi da quello di DeepMind del 2022 di cui diremo. La sostanza non cambia.
Perché un fisico la vide prima degli altri
Fu un cambiamento concettuale enorme. Per migliorare l’intelligenza artificiale non occorreva più attendere una nuova intuizione teorica. Diventava lecito chiedersi che cosa accadesse prendendo ciò che già funzionava e rendendolo cento volte più grande. GPT-3, più di cento volte più grande di GPT-2, fu in un certo senso la verifica sperimentale di quella domanda. La formazione di Amodei aiuta a capire perché ne afferrò presto le implicazioni. Le leggi di potenza, per un fisico, sono materia quotidiana: descrivono terremoti, transizioni di fase, la distribuzione delle città. All’epoca, inoltre, non era affatto scontato che ingrandire le reti neurali avrebbe continuato a dare frutti migliori. Una parte del mondo dell’apprendimento automatico, fedele all’approccio ingegneristico, riteneva che oltre una certa soglia sarebbero servite architetture nuove o principi diversi. Ma i dati sperimentali raccontavano un’altra storia: i modelli continuavano a migliorare. Bisogna però evitare di caricare la scoperta di un significato che non ha. Le leggi di scala non sono leggi fondamentali della natura, come la gravitazione di Newton o le equazioni di Maxwell. Sono regolarità empiriche osservate nel comportamento delle reti neurali, valide in determinati intervalli. Proprio per questo sono utilissime, ma proprio per questo vanno maneggiate con cautela.
Dalla curva all’industria
Da un’idea scientifica discende una conseguenza industriale gigantesca. Addestrare un modello di frontiera richiede soldi, tanti soldi: capitali (spesso di rischio), acceleratori, energia e infrastrutture in quantità enormi. Prima di investire miliardi è preziosissimo sapere se, moltiplicando il calcolo per dieci o per cento, ci si può ragionevolmente attendere un miglioramento. Lo scaling è diventato così non soltanto un fenomeno scientifico, ma una strategia industriale. Qui il testimone passa agli ingegneri, ed è giusto così. Nel 2022 DeepMind corresse un elemento importante di quella strategia. Nel lavoro Training Compute-Optimal Large Language Models mostrò che aumentare soltanto i parametri non era l’uso migliore del calcolo: anche i dati dovevano crescere nella giusta misura. Chinchilla, un modello da 70 miliardi di parametri addestrato su circa 1.400 miliardi di token, superò Gopher, quattro volte più grande ma nutrito con molti meno dati. La regola pratica che ne derivò è di circa venti token di testo per ogni parametro. Il token è l’unità con cui i modelli leggono le parole di un testo: non sempre è una parola intera, ma spesso un suo frammento. Le parole brevi e frequenti valgono di solito un token ciascuna; quelle lunghe o rare vengono spezzate in più pezzi, così che «incredibilmente», per esempio, può diventare «in», «credibil» e «mente». In inglese un token corrisponde in media a circa tre quarti di parola; in italiano, a qualcosa di meno. Venti token per parametro significano quindi, per un modello da 70 miliardi di parametri, una biblioteca di oltre mille miliardi di parole. La lezione era sottile ma fondamentale: scalare non significa ingrassare il modello, significa trovare l’equilibrio fra parametri, dati e calcolo.
La concentrazione in poche mani e la barriera per l’Europa
Da allora OpenAI, Google DeepMind, Anthropic, Meta e pochi altri hanno investito somme senza precedenti in acceleratori, centri di calcolo, energia e dati. Dietro una parte rilevante dell’economia dell’IA generativa c’è una scommessa precisa: continuando ad aumentare le risorse, le prestazioni continueranno a crescere. Ne è derivata una conseguenza che all’inizio poteva sembrare estranea alla ricerca: la concentrazione dell’IA in poche mani. Un articolo scientifico può leggerlo chiunque, un algoritmo si può riprodurre. Decine di migliaia di acceleratori, grandi centri di calcolo, energia abbondante e miliardi di dollari (magari senza risultato garantito) sono invece alla portata di pochissimi. Una curva matematica ha finito per erigere una barriera all’ingresso. Per l’Europa, e per l’Italia, è la conseguenza più concreta di tutte: chi non dispone di calcolo, energia e capitali su quella scala può leggere le curve, ma non può percorrerle. I numeri rendono l’idea meglio di qualsiasi aggettivo. Secondo il conteggio del Financial Times, quattro sole società americane, Amazon, Microsoft, Alphabet e Meta, prevedono di investire nel 2026 circa 725 miliardi di dollari, in gran parte in infrastrutture per l’intelligenza artificiale: il 77 per cento in più dell’anno precedente, che era già un record. L’Unione europea ha risposto con le «gigafabbriche dell’IA», fino a sette grandi centri di calcolo con almeno 75.000 o 100.000 acceleratori ciascuno. Il bando si chiude il 12 novembre 2026, le assegnazioni sono attese all’inizio del 2027 e gli impianti dovrebbero entrare in funzione entro diciotto mesi dalla firma dei contratti, cioè non prima della seconda metà del 2028. Ma dei fondi europei promessi soltanto un miliardo è oggi effettivamente impegnato; il resto dipende dal prossimo bilancio pluriennale, ancora in negoziazione. E c’è l’energia, l’ingrediente che alimenta ogni singola operazione di calcolo: all’industria europea costa circa il doppio che a quella americana, e l’Italia paga l’elettricità più cara della media europea. Tradotto nel linguaggio della formula, il quadro è spietato. Se dimezzare l’errore richiede un milione di volte più calcolo, chi parte con una frazione delle risorse e con anni di ritardo non recupera correndo sulla stessa curva. Può soltanto tentare di spostarla, ma con grande fatica: modelli più efficienti, specializzati nei settori in cui l’Europa e l’Italia sono forti, come la manifattura, la sanità e la pubblica amministrazione; dati di qualità che altri non possiedono; tecniche che ottengono di più con meno. È una strada praticabile, e qualche laboratorio europeo lo ha già dimostrato. Richiede però decisioni rapide, capitali pazienti e una politica energetica coerente, tre cose che il continente raramente ha avuto insieme. Il treno, dunque, non è ancora del tutto perso per l’Europa; ma, se non vi si sale adesso, il prossimo potrebbe non passare più.
Più grande vuol dire più intelligente?
Qui compare il problema più importante, e la risposta richiede cautela. La loss misura la capacità di previsione statistica, non ciò che nel linguaggio comune chiamiamo intelligenza. Capacità diverse, inoltre, possono crescere a velocità diverse: ragionamento matematico, programmazione, pianificazione, memoria, affidabilità dei fatti e autonomia non sono la stessa cosa. Dalle leggi di scala non discende quindi logicamente che, costruendo modelli sempre più grandi, si arriverà per forza a un’intelligenza artificiale generale.
Attenzione: con questa espressione, in inglese Artificial General Intelligence o AGI, si intende un sistema capace di affrontare, con competenza paragonabile a quella umana, praticamente qualsiasi compito intellettuale, anche mai visto prima, anziché eccellere in un solo campo. Non va confusa con l’IA generativa, la GenAI, che indica più semplicemente i sistemi che producono contenuti, testi, immagini, suoni, programmi: quella esiste già, ed è la stessa di cui parla questo articolo, mentre l’AGI resta un obiettivo, dai contorni ancora discussi.
Le leggi di scala dimostrano qualcosa di più limitato, e già notevole: in certi regimi sperimentali, certe misure delle prestazioni migliorano in modo prevedibile quando crescono certe risorse. C’è poi un limite molto concreto, i dati. Internet non contiene una quantità illimitata di testi umani di buona qualità, e quando una parte significativa è già stata usata occorre cambiare strategia. Entrano in gioco dati sintetici, apprendimento per rinforzo, ambienti simulati, uso di strumenti, sistemi che producono problemi, ne verificano le soluzioni e imparano dai risultati. Per questo la frontiera si sta spostando dallo scaling dell’addestramento anche verso lo scaling del ragionamento: invece di spendere quasi tutto il calcolo per costruire una volta per tutte un modello più potente, se ne destina una parte crescente al momento in cui il modello affronta un problema difficile. Con una metafora antropomorfica: non soltanto un cervello più grande, ma più tempo per pensare.
Il paradosso Amodei
È qui che Amodei torna al centro della storia, e con lui il suo intervento alle Nazioni Unite. La sua posizione contiene una tensione evidente. Se lo scaling continuerà, sostiene, i sistemi potranno raggiungere capacità straordinarie, ma proprio quell’aumento potrebbe generare rischi altrettanto straordinari. Uno degli uomini che hanno contribuito a capire come rendere le macchine più potenti è anche fra quelli che insistono di più sulla necessità di studiarne i pericoli.
La sua visione positiva è ambiziosissima. Nel suo saggio Machines of Loving Grace immagina sistemi capaci di superare i premi Nobel in molte discipline e di lavorare con una velocità e un parallelismo impossibili per gli esseri umani, fino a comprimere in pochi anni progressi di biologia e medicina che altrimenti richiederebbero decenni. È uno scenario affascinante, ma va distinta con cura l’estrapolazione dal risultato sperimentale. Non esiste una legge di scala che consenta di scrivere:
1028 operazioni = premio Nobel
e neppure:
1030 operazioni = superintelligenza
Le curve permettono certe estrapolazioni quantitative. Prevedere trasformazioni qualitative della conoscenza è un problema diverso.
C’è poi il costo. Le leggi di potenza implicano rendimenti decrescenti, e i numeri visti sopra lo dicono senza pietà: se dimezzare l’errore richiede un milione di volte più calcolo, la domanda smette di essere soltanto scientifica e diventa: quanto costa il prossimo punto percentuale di intelligenza artificiale? Lo scaling potrebbe continuare a funzionare in matematica e diventare insostenibile in economia. Il primo vero limite potrebbe essere finanziario, energetico o infrastrutturale, non teorico. Sarebbe però sbagliato considerarlo inevitabile. La storia dell’informatica è anche la storia di innovazioni che hanno cambiato il rapporto fra calcolo e prestazioni: algoritmi migliori, hardware specializzato, quantizzazione, sparsità, architetture a miscela di esperti, distillazione, dati sintetici, apprendimento per rinforzo, calcolo al momento della risposta, sistemi ad agenti. Ognuna di queste, nel linguaggio della formula, sposta la curva o ne cambia la pendenza.
Che cosa stiamo scalando
La domanda allora cambia forma. Non basta più chiedersi quanto possiamo scalare: bisogna chiedersi che cosa stiamo scalando. La prima generazione di leggi di scala studiava parametri, dati, calcolo e loss. La prossima sfida è capire come crescano proprietà molto più difficili da misurare: ragionamento, autonomia, affidabilità, creatività scientifica, pianificazione, capacità di agire nel mondo. E soprattutto se crescano insieme. Un sistema potrebbe diventare eccellente nella programmazione senza migliorare altrettanto nel giudizio; potrebbe acquisire capacità matematiche superiori continuando a produrre informazioni false; potrebbe diventare più autonomo senza diventare proporzionalmente più affidabile. Tradotto nel linguaggio della formula, sono curve con pendenze diverse. Ed è esattamente la seconda preoccupazione che Amodei ha portato al Consiglio di sicurezza: capacità che crescono più in fretta della nostra possibilità di controllarle. Non è catastrofismo. È una differenza fra due esponenti. Resta infine la conseguenza più profonda. Per molto tempo abbiamo immaginato l’intelligenza come il prodotto necessario di principi qualitativamente raffinati. I grandi modelli hanno introdotto una possibilità più inquietante e insieme più affascinante: alcune capacità che giudichiamo intelligenti possono emergere aumentando enormemente dati, calcolo e dimensioni di sistemi costruiti su principi relativamente semplici. Oltre una certa scala, la quantità può produrre qualità. Un fisico conosce bene il fenomeno: l’acqua scaldata un grado alla volta resta acqua finché, a cento gradi e a pressione atmosferica, diventa vapore. Si chiama transizione di fase: chi prolungasse le curve delle proprietà del liquido misurate fino a ottanta gradi non vedrebbe arrivare il salto. Non sappiamo ancora fin dove, e in che modo, questo valga per l’intelligenza artificiale. Il fisico-biologo che cercava regolarità quantitative nei circuiti neurali ha contribuito a individuare una delle regolarità che hanno plasmato l’IA moderna. Seguendo quella curva fino alle conseguenze più lontane, è arrivato a una conclusione doppia. Se continuerà a funzionare, potremmo costruire sistemi capaci di accelerare la scienza e trasformare l’economia. Se continuerà a funzionare, potremmo anche costruire sistemi sempre più difficili da controllare. È la stessa curva a reggere entrambe le possibilità. Per questo l’allarme lanciato all’ONU non contraddice il lavoro di una vita: ne è la conseguenza. E per questo il rifiuto di qualsiasi regola comune da parte della potenza che ospita quasi tutti i laboratori di frontiera dovrebbe preoccupare l’Europa più di qualsiasi previsione apocalittica. Un ingegnere si domanda se il ponte reggerà. Un fisico si domanda dove la legge smetterà di valere. La domanda decisiva dei prossimi anni non sarà soltanto se le leggi di scala continueranno a funzionare. Sarà capire dove finisce ciò che possiamo prevedere prolungando una retta e dove comincia ciò che quella retta non è più in grado di raccontarci. È una domanda da fisico, alla quale neppure Dario Amodei, uno dei primi a capire la potenza dello scaling, possiede ancora una risposta. Per lo meno, così io credo.

