I costi del calcolo AI potrebbero aumentare di 10 volte? Dwarkesh Patel analizza lo scenario Anthropic

Per gran parte dell'era del calcolo, la tendenza sembrava ovvia: prestazioni dei chip in continuo miglioramento, infrastrutture cloud in costante espansione e prezzi effettivi del calcolo in calo. Tuttavia, l'AI potrebbe cambiare questa tendenza.

发布于 2026年8月6日generalGEO 评分: 01 次阅读
L'immagine ha uno sfondo scuro, con la scritta 'ANTHROPIC' a sinistra e 'COST / TOKEN' con una curva ascendente a destra. Al centro, in caratteri blu e bianchi, è mostrato 'AI Compute 10× More Expensive?', con la scritta più piccola in basso 'H100 Economics · Anthropic Growth'. Nella parte inferiore ci sono due schermate con dati, con 'H100' in basso a sinistra. L'immagine è correlata al contenuto del documento che illustra il possibile aumento di dieci volte dei costi del calcolo AI, sottolineando il contesto dell'economia H100 e della crescita di Anthropic.

Il costo della potenza di calcolo AI aumenterà di 10 volte? Analisi dello scenario Anthropic di Dwarkesh Patel

Introduzione

Per gran parte dell'era informatica, la direzione dello sviluppo è sembrata ovvia: i chip sono diventati sempre più potenti, l'infrastruttura cloud si è espansa costantemente e il prezzo effettivo del calcolo è continuamente diminuito.

L'AI potrebbe rompere questo schema.

In un articolo del 29 luglio 2026, il giornalista tecnologico e scrittore Dwarkesh Patel ha proposto uno scenario deliberatamente激进: la capacità dell'AI di frontiera di trasformare il calcolo in valore economico aumenta notevolmente, mentre l'espansione fisica dell'offerta di potenza di calcolo avanzata procede molto più lentamente.

In questo scenario, il prezzo di mercato della potenza di calcolo AI di fascia alta potrebbe aumentare di 10 volte o più, prima di tornare infine al percorso di lungo termine della riduzione dei costi.

L'argomentazione parte da un confronto provocatorio.

Se un agente AI che gira su una potenza di calcolo equivalente a una NVIDIA H100 potesse svolgere il lavoro di un ingegnere software ben pagato, perché il prezzo di noleggio di questa GPU dovrebbe essere ancora determinato principalmente dall'ammortamento hardware e dalla concorrenza nel cloud?

Perché il suo prezzo non dovrebbe avvicinarsi di più al valore economico del lavoro umano che sostituisce o potenzia?

L'articolo estende questo esperimento mentale a previsioni più ampie su laboratori AI, data center, capacità produttiva di semiconduttori avanzati e sulla possibilità che il mondo stia entrando in un periodo di grave inflazione della potenza di calcolo.

Fin dall'inizio è necessario chiarire diversi confini importanti:

  • Un ingegnere software di livello umano che gira su una potenza equivalente a una H100 è un'abilità futura ipotetica, non un risultato di benchmark attuale.
  • I ricavi annualizzati confermati ufficialmente da Anthropic hanno superato i 47 miliardi di dollari a maggio 2026, ma le cifre di 100-150 miliardi entro fine anno e 1 trilione l'anno successivo proposte da Patel sono ipotesi di scenario, non indicazioni di performance di Anthropic.
  • L'aumento di 10 volte del prezzo della potenza di calcolo è un'argomentazione economica, non una previsione di mercato confermata.
  • I prezzi delle GPU cloud variano in base al modello di chip, durata del contratto, tasso di utilizzo, rete, sicurezza e livello di servizio; non esiste un prezzo H100 uniforme.

Fatte queste premesse, questo esperimento mentale è prezioso perché solleva una domanda che il settore spesso evita:

Cosa succede quando il valore economico creato dall'AI cresce più velocemente della capacità del mondo di costruire l'infrastruttura necessaria a sostenerla?

Forza lavoro in silicio: quando una H100 inizia a sembrare un ingegnere da 250.000 dollari all'anno

L'argomentazione inizia cambiando l'unità di confronto.

Oggi, la potenza di calcolo viene generalmente prezzata come infrastruttura:

  • Prezzo per ora GPU
  • Prezzo per token
  • Prezzo per server al mese
  • Prezzo per cluster riservato
  • Prezzo per watt o per megawatt

La domanda di Patel è: cosa succede quando lo stesso hardware diventa il contenitore di forza lavoro autonoma?

Immagina un ingegnere software AI in grado di:

  • Leggere codebase di grandi dimensioni
  • Implementare funzionalità
  • Debuggare malfunzionamenti
  • Eseguire test
  • Revisionare pull request
  • Investigare incidenti
  • Lavorare in modo continuativo
  • Produrre risultati paragonabili a quelli di un ingegnere umano esperto

Se quell'agente richiede circa una potenza equivalente a una H100 durante l'esecuzione, la GPU non è più solo un componente server. È parte di un sistema di produzione digitale.

L'esperimento mentale dei 250.000 dollari

Patel utilizza come riferimento il valore di mercato di 250.000 dollari all'anno di un ingegnere software di alto livello nella Silicon Valley.

Poi lo confronta con la stima del noleggio spot annualizzato di una H100, pari a circa 16.000 dollari.

Il divario implicito è:

250.000 / 16.000 ≈ 15,6 volte

In questo esperimento mentale semplificato, una GPU in grado di ospitare una forza lavoro digitale equivalente appare gravemente sottovalutata rispetto al valore del lavoro che può generare.

Confronto dei costi annuali tra H100 e un ingegnere

Questo calcolo non è una previsione diretta che ogni H100 verrà noleggiata a 250.000 dollari.

Ignora diversi fattori importanti:

  • L'agente potrebbe richiedere più di una H100 come potenza di calcolo.
  • Una GPU non può mantenere un tasso di utilizzo perfetto tutto l'anno.
  • L'infrastruttura di servizio include CPU, memoria, rete, storage, elettricità, raffreddamento e operazioni.
  • Gli ingegneri umani non si limitano a generare codice.
  • Se la forza lavoro digitale si espande rapidamente, i salari potrebbero cambiare.
  • I fornitori di modelli potrebbero catturare gran parte del valore economico attraverso il pricing delle API anziché il noleggio di GPU.
  • La concorrenza e i miglioramenti di efficienza potrebbero ridurre la quantità di calcolo necessaria per ogni attività.

Il punto più ristretto di Patel è che quando la potenza di calcolo può produrre risultati di maggior valore, la disponibilità a pagare per essa potrebbe aumentare drasticamente.

Perché il valore del lavoro non crollerà immediatamente

Un'obiezione naturale è che l'aggiunta di milioni di ingegneri software AI ridurrebbe il valore di mercato del lavoro di ingegneria software.

Se il software diventa abbondante, un ingegnere digitale potrebbe non valere più 250.000 dollari.

Patel riconosce questa possibilità, ma sostiene che non avvenga automaticamente.

Il ragionamento economico standard spesso rifiuta l'idea che "la quantità di lavoro utile sia fissa". Lavoratori qualificati aggiuntivi possono creare nuovi prodotti, nuove aziende, nuove specializzazioni e nuova domanda.

Da questa prospettiva, un forte aumento di lavoratori capaci non si limita a dividere il lavoro esistente tra più partecipanti. Espande la gamma di ciò che è economicamente possibile.

L'AI potrebbe portare a uno shock di offerta di lavoro insolitamente rapido, quindi i confronti storici potrebbero non essere applicabili. Ciononostante, Patel sostiene che sia ragionevole che il valore marginale della potenza di calcolo AI rimanga elevato man mano che nuovi software e servizi diventano realizzabili.

L'argomentazione è più convincente nel lavoro completamente digitalizzato

Un utile contro-argomento emerso nella discussione sotto l'articolo di Patel è che il confronto sul valore del lavoro è più forte quando l'intera attività può essere svolta in un ambiente digitale.

L'ingegneria software si avvicina a questo stato ideale:

  • Gli input sono digitali.
  • Gli output sono digitali.
  • I test possono spesso essere automatizzati.
  • La distribuzione è rapida.
  • Molti cicli di feedback operano a velocità della macchina.

Quando predominano i colli di bottiglia fisici, il confronto diventa più debole.

Un sistema AI potrebbe progettare rapidamente un farmaco, ma le sperimentazioni cliniche richiedono ancora pazienti, regolamentazione, produzione e tempo. Potrebbe ottimizzare una fabbrica, ma costruzione, permessi, catena di approvvigionamento e attrezzature rimangono soggetti a vincoli fisici.

In questi ambiti, l'intelligenza potrebbe smettere di essere il collo di bottiglia principale prima che la potenza di calcolo possa assorbire pienamente il valore del lavoro umano sostituito.

La crescita dei ricavi AI potrebbe superare la crescita dell'offerta di potenza di calcolo AI

La seconda parte dell'argomentazione passa dalla singola GPU alla situazione finanziaria dei laboratori AI di frontiera.

Anthropic è l'esempio principale, data la sua recente crescita dei ricavi straordinariamente rapida.

I dati riportati ufficialmente da Anthropic sono i seguenti:

  • Ricavi a run-rate annualizzato a fine 2025: circa 9 miliardi di dollari
  • Ricavi a run-rate annualizzato ad aprile 2026: oltre 30 miliardi di dollari
  • Ricavi a run-rate annualizzato a inizio maggio 2026: oltre 47 miliardi di dollari

Si tratta di dati a run-rate annualizzato, non di ricavi annuali certificati.

Descrivono il tasso di crescita implicito nei ricavi di un dato momento.

![Immagine che mostra la crescita dei ricavi di Anthropic (run-rate annualizzato). Ricavi 2022: circa $10M, 2023: circa $100M, fine 2025: circa $1B, febbraio 2024: circa $14B, marzo 2025: circa $19B, aprile 2026: circa $30B, metà maggio 2026: circa $47B. Mostra anche che la crescita effettiva del run-rate annualizzato nel primo trimestre 2026 ha superato di gran lunga le aspettative, raggiungendo ~$9B, con possibilità di arrivare a ~80 volte. Immagine di Dario

Amodei ha definito "un tasso di crescita pazzesco, dieci volte all'anno". Il grafico è correlato alle proiezioni di crescita dei ricavi di Anthropic menzionate nel documento e ne illustra visivamente l'andamento.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/27321613-b67f-40b5-b15f-43c37a8cc0be-0b44034b-99ac-407c-98dc-22191c3ab493.png)

Il punto di partenza di Patel è un'osservazione: i ricavi di Anthropic sono cresciuti di circa un ordine di grandezza su base annua.

Ha poi costruito uno scenario deliberatamente estremo:

  • Il fatturato annualizzato di Anthropic raggiunge circa 100-150 miliardi di dollari entro la fine del 2026.
  • La stessa tendenza di fondo prosegue.
  • Entro la fine dell'anno successivo, i ricavi si avvicinano a 1.000 miliardi di dollari.

Patel sottolinea chiaramente che questa traiettoria non è una conseguenza inevitabile e non ha ragioni profonde. Dipende dalle future capacità dell'AI, dall'adozione dei prodotti, dai prezzi e dalla concorrenza.

Lo scopo di questo scenario non è affermare che Anthropic preveda ricavi da 1.000 miliardi di dollari, ma piuttosto chiedersi: se un'azienda di AI crescesse davvero a questo ritmo, quali altre condizioni dovrebbero verificarsi?

La crescita dei ricavi non corrisponde alla crescita della potenza di calcolo

Patel confronta un'ipotetica crescita decupla dei ricavi con una stima di espansione triennale della potenza di calcolo AI di 3 volte.

Epoch AI stima che nel 2025 lo stock globale di potenza di calcolo AI, misurato in equivalente H100, sia cresciuto di circa tre volte (cioè sia triplicato), pur sottolineando che le stime a livello aziendale e relative al futuro rimangono incerte.

Il disallineamento che ne deriva è di circa:

Crescita della domanda di business AI: 10 volte
Crescita fisica della potenza di calcolo: 3 volte
Divario: circa 3,3 volte

L'immagine mostra il confronto tra la crescita della domanda commerciale di AI e l'offerta di potenza di calcolo. Il grafico a barre blu a sinistra rappresenta la domanda commerciale di AI, con una crescita di 10 volte; il grafico a barre verdi a destra rappresenta l'offerta di potenza di calcolo, con una crescita di 3 volte. Tra i due, una freccia tratteggiata collega, con l'annotazione "il divario si amplia fino a 3,3 volte". L'immagine è strettamente correlata al contesto e illustra visivamente come la crescita della domanda commerciale di AI superi di gran lunga l'offerta di potenza di calcolo, evidenziando il divario crescente e supportando la spiegazione del possibile aumento dei costi di calcolo AI.

Se la crescita dei ricavi di un laboratorio all'avanguardia supera di gran lunga la crescita della potenza di calcolo disponibile, allora deve verificarsi una combinazione di alcune delle seguenti tre cose:

  1. Il laboratorio ottiene margini di profitto più elevati.
  2. I prezzi di mercato della potenza di calcolo aumentano.
  3. Una quota maggiore della potenza di calcolo del laboratorio viene destinata a

servizi di inferenza generativi di ricavi, a scapito di ricerca e formazione.

Patel ritiene che tutti e tre questi aspetti stiano già cambiando in una certa misura.

Opzione uno: margini in aumento per i laboratori all'avanguardia

I fornitori di modelli sostengono elevati costi fissi per addestrare i modelli, poi vendono le capacità apprese a numerosi clienti.

Questo crea potenziali economie di scala.

Le stesse capacità già addestrate possono essere vendute attraverso:

  • Abbonamenti consumer
  • Licenze aziendali
  • API
  • Prodotti di programmazione
  • Piattaforme di agenti
  • Partnership cloud

Il costo marginale di una singola richiesta aggiuntiva può essere molto inferiore al valore che quella richiesta genera.

Patel osserva che i margini di inferenza dei laboratori leader sono già migliorati notevolmente. Tuttavia, i suoi dati specifici sui margini del servizio di inferenza Fable di Anthropic sono chiaramente presentati come stime approssimative, non come informazioni aziendali verificate.

Margini elevati possono assorbire parte del divario tra crescita dei ricavi e crescita della potenza di calcolo.

La difficoltà sta nella scala.

Nello scenario da 1.000 miliardi di dollari di Patel, se prezzi e allocazione della potenza di calcolo non vengono adeguati sufficientemente, i margini dovrebbero salire a livelli medio-alti di circa il 95%. Ritiene che questo sia eccezionalmente alto anche per le piattaforme tecnologiche leader.

Il margine esatto richiesto dipende da molte variabili, ma il punto centrale rimane valido: i margini da soli potrebbero non riuscire a conciliare una domanda esplosiva con un'infrastruttura limitata.

Opzione due: più potenza di calcolo dalla formazione all'inferenza

La seconda opzione è destinare una quota maggiore della potenza di calcolo al servizio ai clienti.

Epoch AI stima che OpenAI abbia speso circa 1,8 miliardi di dollari in potenza di calcolo per inferenza nel 2024, contro circa 5 miliardi di dollari per ricerca e sviluppo. Secondo questa stima, l'inferenza rappresenta circa un quarto della spesa totale dichiarata per la potenza di calcolo.

Con l'espansione dell'uso commerciale, la quota dell'inferenza può aumentare ulteriormente.

Questo aiuta a sostenere i ricavi, ma i laboratori all'avanguardia affrontano un dilemma strategico.

I servizi di inferenza pagano le bollette correnti.

La formazione e la sperimentazione producono i modelli che potrebbero definire la prossima generazione di prodotti.

Un laboratorio che destina gran parte della propria potenza di calcolo al servizio dei modelli attuali potrebbe generare ricavi più immediati, ma avrà meno infrastruttura disponibile per:

  • Addestrare modelli più grandi
  • Eseguire esperimenti
  • Apprendimento per rinforzo
  • Valutazioni
  • Generazione di dati
  • Ricerca sull'architettura
  • Sviluppo di modelli a lungo termine

Patel descrive un effetto volano della Silicon Valley: i ricavi attuali dall'inferenza aiutano a sostenere i finanziamenti, i finanziamenti comprano più potenza di calcolo, la potenza di calcolo addestra modelli più forti, i modelli più forti portano più ricavi.

L'immagine mostra il ciclo virtuoso del volano commerciale dell'AI. 1. Le capacità AI migliorano, i modelli sono più forti, con risultati migliori e risolvono più problemi; 2. I ricavi commerciali aumentano, con più utenti, più pagamenti e crescita continua; 3. Si acquista più potenza di calcolo, con più investimenti e più GPU/risorse di calcolo; 4. Si addestrano modelli più forti, usando più potenza di calcolo e dati, per modelli più potenti; 5. Si ottengono capacità commerciali più forti, prodotti più competitivi, maggiore quota di mercato e un fossato difensivo. L'immagine è strettamente correlata al contesto e illustra visivamente la logica commerciale della crescita continua dei laboratori AI attraverso un ciclo virtuoso.

Questi laboratori non considerano tipicamente i modelli di oggi come il punto finale. Si aspettano che gli attuali sistemi all'avanguardia vengano presto superati.

Questo li rende riluttanti a trasformarsi completamente in fornitori di servizi cloud ad alto margine dedicati a servire una generazione di modelli statica.

Opzione tre: il prezzo della potenza di calcolo all'avanguardia

in aumento

L'aggiustamento rimanente è il prezzo.

Se i laboratori AI e i loro clienti possono creare più valore economico per unità di potenza di calcolo, avranno la capacità di fare offerte più aggressive per l'infrastruttura scarsa.

Questo non significa che il prezzo per ogni ora di GPU aumenti in modo uniforme.

I laboratori all'avanguardia necessitano di una categoria specializzata di potenza di calcolo:

  • Grandi cluster continui
  • Interconnessione ad alta velocità
  • Disponibilità prevedibile
  • Sicurezza robusta
  • Elevata utilizzazione
  • Alimentazione elettrica stabile
  • Distribuzione rapida
  • Accesso a lungo termine
  • Protezione dei pesi dei modelli e dei dati dei clienti

Le istanze con offerte competitive del mercato aperto non possono sostituire completamente un contratto infrastrutturale sicuro, pluriennale e multi-gigawatt.

L'accordo sulla potenza di calcolo di SpaceXAI tra Anthropic e Google

I contratti recenti riflettono il premio per la capacità immediata.

Anthropic ha confermato formalmente l'accordo con SpaceXAI per l'accesso a Colossus 1, e ha poi dichiarato di aver ampliato la capacità su Colossus 1 e Colossus 2.

SpaceXAI ha descritto Colossus 1 come contenente oltre 220.000 GPU NVIDIA, inclusi sistemi H100, H200 e GB200.

Axios ha riportato che Anthropic ha accettato di pagare circa 1,25 miliardi di dollari al mese entro il 2029 per questa disposizione.

Un documento normativo riportato successivamente da TechCrunch mostra che Google pagherà a SpaceX circa 920 milioni di dollari al mese tra ottobre 2026 e giugno 2029 per l'accesso a circa 110.000 GPU e componenti correlati.

Questi non sono normali acquisti cloud on-demand.

Riflettono il valore di ottenere rapidamente infrastruttura su larga scala disponibile, in un contesto in cui la costruzione di nuovi data center, le interconnessioni alla rete elettrica e le consegne di chip possono richiedere anni.

Patel stima che il prezzo implicito per ora di GPU nell'accordo di Google sia circa il doppio del prezzo spot attuale dell'hardware misto correlato.

Il confronto è approssimativo perché il contratto include più delle semplici GPU e il mix hardware comprende acceleratori di generazioni diverse.

Le GPU stanno diventando fabbriche, non solo server

L'articolo originale usa un'analogia industriale.

Nell'era di Internet, le aziende competevano per:

  • Traffic
  • Canali di distribuzione
  • Posizionamento nei motori di ricerca
  • Accesso dagli app store

La competizione nell'AI all'avanguardia aggiunge un livello più concreto:

  • Elettricità
  • Chip avanzati
  • Memoria
  • Terreni per data center
  • Raffreddamento
  • Connessioni alla rete elettrica
  • Rete
  • Cluster sincronizzati su larga scala

I cluster GPU all'avanguardia sono più simili a linee di produzione industriale che a semplici insiemi di server noleggiati.

Il loro prodotto non è fisico, ma intelligenza con valore economico:

  • Codice
  • Ricerca
  • Supporto
  • Design
  • Analisi
  • Media
  • Decisioni
  • Azioni di agenti

Le aziende che controllano i modelli più potenti e la potenza di calcolo più affidabile hanno la possibilità di produrre una quantità maggiore di questo lavoro digitale.

Perché i grandi laboratori non possono fare affidamento solo sul mercato spot

La capacità spot presenta diversi svantaggi per i carichi di lavoro all'avanguardia:

  • Le istanze possono essere interrotte.
  • L'hardware può essere distribuito in luoghi diversi.
  • Le prestazioni di rete possono essere instabili.
  • La capacità può scomparire durante i picchi di domanda.
  • I requisiti di sicurezza e trattamento dei dati possono essere difficili da soddisfare.
  • Gli addestramenti di lunga durata richiedono infrastrutture stabili e coordinate.

I laboratori che addestrano o eseguono modelli

Gli acquirenti che servono modelli all'avanguardia, quindi, danno più valore alla potenza di calcolo garantita rispetto a chi esegue attività batch a breve termine.

Questo aiuta a spiegare perché la potenza di calcolo contrattuale mantiene un premio anche quando le offerte di cloud pubblico sembrano più economiche.

Il lato dell'offerta è vincolato da moltiplicatori fisici

L'argomentazione di Patel si basa sull'affermazione che l'offerta di potenza di calcolo non può reagire abbastanza rapidamente a shock significativi della domanda.

Riassume la crescita annuale della potenza di calcolo come prodotto di tre moltiplicatori generali:

Crescita annuale della potenza di calcolo AI ≈
1.4× Miglioramento hardware
× 1.2× Nuova capacità produttiva di wafer
× 1.8× Riallocazione dei wafer di processo avanzato verso l'AI
≈ 3.0×

Questi numeri sono stime, non costanti fisiche immutabili.

Hanno lo scopo di illustrare le fonti della crescita recente.

Moltiplicatore uno: chip migliori

I miglioramenti nella tecnologia dei semiconduttori aumentano il calcolo effettivo fornito per watt, per chip e per dollaro investito.

I guadagni potenziali derivano da:

  • Nodi di processo più piccoli
  • Architetture migliori
  • Operazioni a precisione ridotta
  • Larghezza di banda della memoria maggiore
  • Packaging avanzato
  • Interconnessioni più veloci
  • Software e kernel migliori

Il ritmo del progresso non è senza limiti.

Ogni nuova generazione di processo diventa più difficile e più costosa. Densità di potenza, correnti di dispersione, resa, movimentazione della memoria e packaging diventano sempre più i fattori determinanti delle prestazioni reali.

I sistemi AI possono anche migliorare l'efficienza attraverso miglioramenti a livello di modello e software, che possono in una certa misura compensare la scarsità di hardware. Pertanto, qualsiasi previsione sul prezzo della potenza di calcolo dipende dalla velocità dei miglioramenti di efficienza rispetto alla crescita della domanda.

Moltiplicatore due: più fabbriche e attrezzature

Nuova capacità produttiva di semiconduttori richiede anni per pianificazione, finanziamento, costruzione, installazione delle attrezzature, validazione e ramp-up della produzione.

La catena di fornitura dipende fortemente da sistemi specializzati, inclusa la litografia ultravioletta estrema.

Le fabbriche avanzate richiedono anche:

  • Manodopera qualificata
  • Servizi pubblici affidabili
  • Forniture chimiche
  • Risorse idriche
  • Capacità di packaging
  • Capacità di test
  • Attrezzature con tempi di consegna lunghi

Patel sostiene che, almeno fino alla fine del decennio, la disponibilità di attrezzature EUV limiterà l'espansione rapida della capacità.

Prezzi più alti possono stimolare gli investimenti, ma non possono produrre istantaneamente una fabbrica di processo avanzato completamente validata.

Moltiplicatore tre: riallocare la capacità avanzata esistente all'AI

Gran parte della crescita recente dei chip AI deriva dallo spostamento della capacità produttiva avanzata da altri prodotti.

Smartphone, PC, chip di rete e altri dispositivi competono per le stesse risorse di processo avanzato e packaging.

Patel cita una stima secondo cui entro la fine del 2027 la quota dell'AI nella capacità N3 di TSMC potrebbe salire da circa il 60% all'86%.

Questa è una stima del modello di offerta, non una guida pubblica sulla capacità di TSMC.

L'implicazione è chiara: la leva della riallocazione funziona solo se la domanda non-AI occupa ancora capacità che può essere trasferita.

Una volta che l'AI ha consumato gran parte della capacità dei nodi rilevanti, questa leva di crescita si indebolisce notevolmente.

Altri colli di bottiglia potrebbero emergere prima

Anche se l'offerta di wafer si espande, l'intero sistema potrebbe essere limitato da:

  • Memoria a larghezza di banda elevata
  • Packaging avanzato
  • Reti ottiche
  • Trasformatori e attrezzature per la rete elettrica
  • Costruzione di data center
  • Generazione di energia
  • Raffreddamento
  • Permessi e approvazioni
  • Finanziamenti

L'offerta di potenza di calcolo rimane

È quindi una catena, non l'output di una singola fabbrica.

La capacità effettiva è limitata dall'anello critico più lento.

Perché gli alti costi di calcolo potrebbero favorire i modelli più forti

La fonte propone poi un'argomentazione controintuitiva: se la potenza di calcolo diventa più costosa, gli acquirenti non necessariamente si sposteranno verso modelli più deboli.

Potrebbero addirittura preferire ancora di più i modelli più forti.

Patel collega questo all'effetto Alchian-Allen.

Quando un costo fisso viene aggiunto a beni di qualità diversa, la versione di fascia alta può diventare relativamente più attraente, perché il premio di qualità incide meno sul prezzo totale.

Un esempio semplificato

Supponiamo che il costo base della potenza di calcolo sia di 20 dollari l'ora.

Un modello forte completa un'attività in un'ora, con un premio di modello di 5 dollari:

Modello forte:
20$ calcolo + 5$ premio = 25$

Un modello debole non ha premio, ma a causa di tentativi ripetuti e inferenza inefficiente, richiede due ore:

Modello debole:
2 × 20$ calcolo = 40$

Un modello apparentemente gratuito risulta più costoso per attività completata.

L'indicatore chiave non è il prezzo per token o la licenza del modello, ma il costo per risultato riuscito.

L'efficienza diventa un vantaggio di prezzo

I modelli più potenti possono ridurre i costi attraverso:

  • Meno token
  • Meno tentativi
  • Meno chiamate a strumenti
  • Meno correzioni manuali
  • Durata delle attività più breve
  • Pianificazione migliore
  • Esecuzione più affidabile

Se la potenza di calcolo è economica, il costo dei tentativi inefficienti può essere sopportabile.

Se la potenza di calcolo è costosa, sprecare risorse di calcolo diventa molto più doloroso.

I laboratori che riescono a estrarre la massima produzione utile da ogni ora di GPU scarsa potrebbero applicare un premio considerevole.

Questo non significa che i modelli piccoli spariranno

La versione più aggressiva dell'articolo originale afferma che i modelli mediocri potrebbero non avere futuro.

Questa conclusione è troppo ampia.

I modelli più piccoli e specializzati rimangono attraenti in questi casi:

  • Latenza inferiore
  • Requisiti di memoria inferiori
  • Implementazione su dispositivo
  • Protezione della privacy
  • Output strutturati prevedibili
  • Qualità sufficiente per attività ristrette
  • Consumo di calcolo molto inferiore alla media
  • Personalizzazione con pesi aperti

Un classificatore leggero non deve essere un agente di programmazione all'avanguardia.

L'argomentazione Alchian-Allen si applica quando entrambi i modelli consumano infrastrutture costose simili e il modello più debole richiede significativamente più lavoro per ottenere lo stesso risultato.

Quando il modello più piccolo è effettivamente più efficiente per quel compito, la forza dell'argomentazione si riduce.

Alcune applicazioni AI attuali potrebbero essere escluse dal mercato a causa dei prezzi elevati

Patel sostiene che l'aumento dei prezzi della potenza di calcolo potrebbe spostare la capacità da usi a basso valore.

Se una GPU può eseguire un agente che produce output software o commerciale ad alto valore, il costo opportunità di usare lo stesso hardware per contenuti media usa e getta è molto più alto.

Questo potrebbe influenzare le seguenti applicazioni:

  • Contenuti brevi a basso valore
  • Interazioni finte in massa
  • Generazione ripetitiva di immagini o video
  • Inferenza consumer estremamente economica
  • Prodotti con debole disponibilità a pagare

Il mercato non elimina necessariamente i contenuti stessi.

Potrebbe invece spingerli verso:

  • Modelli più piccoli
  • Hardware più vecchio
  • Inferenza su dispositivo
  • Output memorizzati nella cache
  • Architetture più efficienti
  • Generazione a risoluzione inferiore
  • Potenza di calcolo in ore non di punta

La chiave è l'allocazione delle risorse.

La scarsità

Il calcolo all'avanguardia tenderà a fluire verso i carichi di lavoro con la massima disponibilità a pagare.

Perché questa previsione potrebbe essere sbagliata

L'articolo originale solleva anche diverse obiezioni.

Queste sono importanti perché le previsioni di scarsità permanente delle risorse spesso si rivelano errate.

Obiezione uno: il lavoro umano non è il punto di riferimento corretto per i prezzi

Il confronto con l'ingegnere da 250.000 dollari assume che la GPU possa catturare un valore vicino all'attuale valore economico di un ingegnere.

Questa ipotesi potrebbe fallire per i seguenti motivi:

  • Gli stipendi dell'ingegneria del software potrebbero diminuire.
  • L'AI potrebbe creare output abbondante ma difficile da monetizzare.
  • La fiducia umana, la responsabilità, le relazioni e il giudizio potrebbero mantenere valore.
  • Gli agenti potrebbero richiedere supervisione umana.
  • I colli di bottiglia del mondo fisico potrebbero dominare.
  • La concorrenza potrebbe spingere i prezzi dei modelli verso il costo.

Alcuni commentatori notano che il valore iniziale di un lavoratore digitale potrebbe essere alto, ma una volta che la forza lavoro AI diventa abbondante, potrebbe stabilizzarsi intorno ai 50.000 dollari.

In questo scenario, il valore del calcolo potrebbe comunque aumentare, ma non necessariamente di 15 volte.

Obiezione due: i miglioramenti di efficienza potrebbero superare la crescita della domanda

Il prezzo dei token non equivale al prezzo del calcolo.

I modelli e i sistemi di servizio continuano a migliorare attraverso:

  • Quantizzazione
  • Distillazione
  • Sparsificazione
  • Kernel migliori
  • Decodifica speculativa

Cache

  • Routing
  • Architettura migliorata
  • Migliore utilizzo dell'hardware

In futuro, risposte video o chat di basso valore potrebbero richiedere solo una piccola frazione del costo computazionale attuale.

Anche se il calcolo per gli agenti avanzati diventa costoso, i servizi AI generici potrebbero continuare a diminuire di prezzo, poiché migreranno verso modelli e hardware più efficienti.

Controargomentazione tre: i modelli open source intensificano la concorrenza

I modelli a pesi aperti potrebbero esercitare pressione sui prezzi delle API di frontiera.

Se più modelli offrono capacità simili, gli utenti possono scegliere tra:

  • API commerciali gestite
  • Distribuzioni cloud a pesi aperti
  • Cluster privati
  • Fornitori nazionali
  • Modelli dedicati

Questo limita la capacità di un singolo laboratorio di ottenere margini di profitto estremamente elevati.

La scarsità di calcolo potrebbe comunque far salire i costi infrastrutturali sottostanti, ma la concorrenza tra modelli determina quanto valore il laboratorio può trattenere.

Controargomentazione quattro: l'offerta reagisce ai prezzi elevati

La risposta classica alla scarsità è l'investimento.

Prezzi del calcolo più elevati incoraggerebbero:

  • Più fabbriche di chip
  • Più capacità di packaging
  • Più produzione di memoria
  • Più capacità di generazione elettrica
  • Migliore raffreddamento
  • Acceleratori alternativi
  • Nuovi fornitori cloud
  • Software più efficiente

Patel concorda anche sul fatto che il calcolo alla fine tornerà a essere economico.

La sua tesi riguarda la fase di transizione attuale, in cui la crescita della domanda potrebbe superare la risposta delle infrastrutture fisiche con cicli lunghi.

La scommessa Simon–Ehrlich

La fonte confronta le previsioni sul calcolo con la famosa scommessa tra il biologo Paul Ehrlich e l'economista Julian Simon.

Nel 1980, Ehrlich scelse un paniere di cinque metalli, scommettendo che i loro prezzi reali sarebbero aumentati nei dieci anni successivi.

Entro il 1990, il prezzo del paniere, aggiustato per l'inflazione, era sceso e Ehrlich pagò la scommessa a Simon.

Questa scommessa viene spesso usata per sostenere che le previsioni di scarsità sottovalutano l'innovazione, la sostituzione e la risposta dell'offerta.

La lettura storica è

più complessa. L'analisi indica che un diverso decennio di partenza potrebbe produrre vincitori diversi.

Patel riconosce che la sua tesi sul calcolo è simile a previsioni di scarsità che spesso si sono rivelate sbagliate.

Egli sostiene che il calcolo potrebbe differire dall'estrazione mineraria, poiché la sua elasticità di offerta a breve termine è minore:

  • Gli acceleratori AI di frontiera hanno pochi sostituti.
  • Le fabbriche di chip avanzate non possono sorgere rapidamente.
  • Le apparecchiature EUV sono prodotte da una catena di fornitura altamente concentrata.
  • L'energia dei data center e la costruzione delle reti richiedono tempo.
  • I laboratori di frontiera necessitano di cluster coordinati su larga scala, non di chip commodity arbitrari.

Pertanto, il disaccordo riguarda principalmente i tempi.

I segnali di prezzo e l'innovazione possono espandere l'offerta effettiva di calcolo prima che la domanda AI travolga la costruzione in corso?

Un quadro più bilanciato per i prezzi del calcolo

Piuttosto che considerare il "10x" come una previsione fissa, l'argomento può essere trasformato in un insieme di variabili misurabili.

Variabili lato domanda

  • Crescita delle capacità dei modelli di frontiera
  • Ricavi per ora GPU
  • Tasso di adozione degli agenti
  • Disponibilità a pagare delle imprese
  • Grado di sostituzione del lavoro
  • Creazione di nuove applicazioni
  • Quota del calcolo di inferenza
  • Margini dei fornitori di modelli

Variabili lato offerta

  • Spedizioni di acceleratori
  • Prestazioni hardware per watt
  • Offerta di wafer su nodi avanzati
  • Capacità di packaging
  • Offerta di memoria a banda larga (HBM)
  • Energia per data center
  • Velocità di accesso alla rete elettrica
  • Utilizzo dei cluster
  • Efficienza dei servizi
  • Chip alternativi

Variabili di struttura di mercato

  • Numero di modelli di frontiera competitivi
  • Qualità dei modelli a pesi aperti
  • Concentrazione dei fornitori cloud
  • Contratti infrastrutturali a lungo termine
  • Vincoli geografici e normativi
  • Disponibilità di capitale
  • Capacità di instradare i carichi di lavoro verso modelli più economici

Un aumento dei prezzi di 10 volte è più probabile se:

  • Capacità e monetizzazione crescono rapidamente.
  • I laboratori di frontiera fanno offerte competitive per cluster limitati.
  • L'offerta si espande solo di circa 3 volte all'anno.
  • I guadagni di efficienza non compensano la crescita della domanda.
  • Uno o due laboratori mantengono un vantaggio qualitativo significativo.

È meno probabile se:

  • La crescita delle capacità rallenta.
  • La crescita dei ricavi si normalizza.
  • I modelli aperti diventano sostituti ravvicinati.
  • Modelli piccoli ed efficienti assorbono la maggior parte dei carichi di lavoro.
  • Nuovo hardware e forniture energetiche arrivano più rapidamente del previsto.
  • Il software riduce drasticamente il calcolo necessario per ogni attività completata.

Implicazioni per le aziende AI

Anche se i costi del calcolo non aumentassero di 10 volte, l'argomento ha implicazioni pratiche.

Misurare il costo per attività completata

Monitorare:

  • Token totali in ingresso e uscita
  • Token di inferenza
  • Numero di chiamate strumentali
  • Numero di tentativi
  • Tempo di correzione manuale
  • Latenza end-to-end
  • Tasso di successo
  • Costi infrastrutturali

Se un modello più economico fallisce ripetutamente, in realtà non è economico.

Utilizzare il routing dei modelli

Riservare i modelli di frontiera costosi alle attività che ne beneficiano realmente.

Utilizzare modelli più piccoli per:

  • Classificazione
  • Estrazione
  • Routing
  • Formattazione
  • Operazioni strutturate ripetitive

Inoltrare ai modelli avanzati solo i casi difficili.

Progettare per la portabilità del calcolo

Evitare di legare l'intero prodotto a un singolo modello o a un singolo fornitore di GPU.

Astrazioni utili includono:

  • Gateway di modelli
  • Suite di valutazione
  • Prompt portabili
  • Provider-agnostici

Memoria

  • Molteplici backend hardware
  • Esecuzione batch e asincrona

Ottimizzare contesto e uso degli strumenti

I loop di agenti a lunga esecuzione possono sprecare calcolo a causa di contesto ripetuto e output di strumenti eccessivamente grandi.

Direzioni di miglioramento:

  • Cache dei prompt
  • Recupero del contesto
  • Filtraggio degli output degli strumenti
  • Strategie di ripetizione
  • Condizioni di terminazione
  • Esecuzione parallela
  • Verifica dei risultati

Assicurarsi la capacità prima del bisogno

Le aziende con domanda prevedibile potrebbero beneficiare di:

  • Istanze riservate
  • Contratti cloud pluriennali
  • Sconti per impegno di utilizzo
  • Molteplici partner infrastrutturali
  • Capacità locale per carichi di lavoro stabili

La strategia corretta dipende dall'utilizzo. L'hardware riservato è costoso quando è inattivo.

Implicazioni per investitori e policy maker

L'argomento sposta l'attenzione dai benchmark dei modelli alle infrastrutture.

Le aree chiave includono:

  • Produzione avanzata di semiconduttori
  • Litografia
  • Memoria a banda larga (HBM)
  • Packaging
  • Energia per data center
  • Trasformatori
  • Reti ottiche
  • Raffreddamento
  • Infrastruttura di rete elettrica
  • Finanziamento cloud

Se l'intelligenza diventa un input economico principale, il controllo su questi livelli diventa strategicamente rilevante.

Il risultato potrebbe essere la concentrazione.

I laboratori con i migliori modelli e i ricavi più forti potrebbero fare offerte superiori ai nuovi entranti per le risorse di calcolo scarse. Queste risorse li aiutano a migliorare i modelli, rafforzando i ricavi e rendendo l'offerta successiva ancora più facile.

Questo è un ciclo di rafforzamento:

Modelli migliori
    ↓
Prodotti più preziosi
    ↓
Più ricavi
    ↓
Più accesso alle risorse di calcolo
    ↓
Più training e inferenza
    ↓
Modelli migliori

Il rischio è che la produzione di intelligenza possa concentrarsi nelle mani di poche aziende in grado di sostenere enormi investimenti infrastrutturali.

Domande frequenti

Perché Dhavakesh Patel ritiene che i costi del calcolo AI potrebbero aumentare di 10 volte?

Patel sostiene che i modelli AI più intelligenti potrebbero generare più ricavi per unità di calcolo, mentre l'offerta effettiva di calcolo avanzato cresce molto più lentamente. Se domanda e disponibilità a pagare crescono più rapidamente dell'offerta di chip, energia e data center, i prezzi di mercato potrebbero salire bruscamente.

Anthropic prevede ricavi annuali di 1 trilione di dollari?

No. Anthropic riporta ufficialmente ricavi annualizzati superiori a 47 miliardi di dollari a maggio 2026. La cifra di 100-150 miliardi per fine anno e quella di 1 trilione per l'anno successivo sono ipotesi nell'esperimento mentale di Patel, non indicazioni aziendali.

Perché confrontare H100 con un ingegnere software da 250.000 dollari all'anno?

Il confronto esplora come potrebbe essere prezzato il calcolo se un sistema H100 potesse ospitare un agente AI equivalente al lavoro di un ingegnere ben pagato. È un benchmark di valore ipotetico, non la prova che ogni H100 attuale sostituisca un ingegnere.

Quanto velocemente cresce il calcolo AI globale?

Epoch AI stima che il calcolo AI globale totale, equivalente a H100, sia cresciuto circa tre volte nel 2025. La crescita futura è incerta e dipende da prestazioni dei chip, produzione, packaging, energia, costruzione e spesa in conto capitale.

Perché il calcolo dei laboratori di frontiera potrebbe costare più dei prezzi spot delle GPU pubbliche?

I laboratori di frontiera richiedono cluster affidabili, su larga scala, con rete ad alta velocità e prestazioni prevedibili a lungo termine. Le istanze spot pubbliche non equivalgono a distribuzioni dedicate pluriennali con centinaia di migliaia di acceleratori coordinati.

Il calcolo costoso favorisce sempre il modello più forte?

No. Quando il modello più forte raggiunge lo stesso risultato con meno token, meno tentativi o meno tempo, il calcolo costoso lo favorisce. Ma per carichi di lavoro stretti, a bassa latenza, privati o edge, i modelli piccoli dedicati possono comunque essere più economici.

Il calcolo AI sarà sempre costoso?

Patel non sostiene che il calcolo rimarrà permanentemente costoso.

La sua argomentazione riguarda un periodo di transizione — durante il quale la domanda di IA potrebbe superare la capacità di espansione delle filiere di semiconduttori e data center; nel lungo periodo, hardware e automazione potrebbero nuovamente rendere la potenza di calcolo più economica.

Quali prove potrebbero confutare l'ipotesi del "prezzo della potenza di calcolo ×10"?

Se la crescita dei ricavi dell'IA rallentasse, le capacità dei modelli raggiungessero un tetto, i modelli open-source diventassero alternative molto vicine, l'efficienza dei servizi migliorasse più rapidamente della crescita della domanda, o l'espansione dell'offerta di semiconduttori ed elettricità superasse le aspettative, allora l'argomentazione verrebbe indebolita.

Strumenti correlati

  • Epoch AI: Ricerca e dati su potenza di calcolo IA, scaling dei modelli, infrastrutture ed economia dei laboratori di frontiera.
  • NVIDIA H100 Tensor Core GPU: Specifiche ufficiali dell'acceleratore pubblicate da NVIDIA, unità di calcolo centrale nell'esperimento mentale di Patel.
  • Istanza EC2 P5 di AWS: Istanza cloud ufficiale di Amazon costruita su GPU NVIDIA H100, progettata per carichi di lavoro IA su larga scala.
  • VM A3 di Google Cloud: Documentazione di Google Cloud sulla potenza di calcolo GPU, inclusa disponibilità e configurazione degli acceleratori.
  • GPU cloud CoreWeave: Piattaforma cloud specializzata che fornisce infrastruttura GPU su larga scala per carichi di lavoro IA.
  • Server di inferenza NVIDIA Triton: Sistema di servizi di inferenza progettato per migliorare l'utilizzo, la capacità di batch e l'efficienza di distribuzione dei modelli IA.

Link correlati

Sintesi

La tesi di Dwarkesh Patel sul prezzo della potenza di calcolo 10 volte superiore parte da un'idea semplice: se una GPU può ospitare agenti IA capaci di svolgere lavoro conoscitivo di alto valore, la disponibilità a pagare per quella GPU potrebbe spostarsi verso il valore del lavoro svolto, piuttosto che sul costo storico del server.

Questa tesi diventa più solida se combinata con la rapida crescita dei ricavi di Anthropic e con le stime secondo cui la potenza di calcolo IA globale si espande a un ritmo di circa 3 volte all'anno. Se la domanda commerciale di IA crescesse più rapidamente, l'aggiustamento avverrebbe necessariamente attraverso margini di profitto, allocazione della potenza di calcolo, aumento dei prezzi delle infrastrutture o una combinazione di questi tre fattori.

Questa previsione è lungi dall'essere certa. Miglioramenti dell'efficienza energetica, modelli open-source, sistemi specializzati più piccoli, nuovi impianti di produzione, nuovi acceleratori e un rallentamento della crescita delle capacità potrebbero tutti impedire l'aumento di 10 volte. Le previsioni storiche sulla scarsità di risorse hanno spesso sottovalutato la capacità di adattamento.

L'intuizione veramente duratura non è che la potenza di calcolo debba aumentare esattamente di 10 volte, ma che un'IA più intelligente possa aumentare il valore economico di ciascuna GPU più rapidamente di quanto il mondo fisico possa produrre e alimentare nuove GPU.

AI计算成本可能上涨10倍?Dwarkesh Patel解读Anthropic情景