FM Logo
AI BlogAI NewsAI LabLibriChi SonoPortfolio
Come posso aiutarti?
Come posso aiutarti?

INSIGHT #45SundAI Blog

Dove finisce il vantaggio competitivo quando il token costa la metà e i pesi diventano aperti?

#Costi AI/#Open source/#Agenti autonomi/#Infrastruttura AI/#Vendor lock-in/#Mistral

AutoreFabrizio Mazzei11/10/20269 min lettura
Dove finisce il vantaggio competitivo quando il token costa la metà e i pesi diventano aperti?. Immagine generata con l'AI

Immagine generata interamente con l'AI.

In Breve

"Il prezzo dei token crolla del 52%, Mistral sfodera i pesi aperti e gli agenti entrano nei flussi di lavoro. La settimana in cui il margine si sposta dall'infrastruttura a chi la usa bene."

Loading audio player...
  1. 01Il conto lo paga chi?
  2. 02Con i pesi aperti cambia la partita?
  3. 03I watermark tengono davvero?
  4. 04Gli agenti universali cambiano qualcosa?
  5. 05Cosa tenere d'occhio adesso?

Il prezzo dei token è passato da 2,07 dollari per milione a 0,99 dollari in cinque mesi, un calo del 52%. Nella stessa settimana Mistral ha aperto la preview di un modello da 1 trilione di parametri che gira nei datacenter europei, con i pesi in arrivo a fine mese. Due notizie che sembrano separate e invece raccontano la stessa cosa: il vantaggio competitivo sull'AI si sta spostando di posto.

Se il token costa poco e un modello di frontiera è scaricabile, il moat non è più il modello. È cosa ci costruisci sopra. La settimana offre diverse prove concrete di dove si sta spostando quel vantaggio, più qualche trappola contabile da tenere d'occhio.

Dove finisce il vantaggio competitivo quando il token costa la metà e i pesi diventano aperti?. Immagine generata con l'AIImmagine generata interamente con l'AI.

Il conto lo paga chi?

Partiamo dai numeri che fanno rumore. Meta ha classificato le costruzioni dei suoi data center AI come "pilot models", agganciandosi a un credito d'imposta per la ricerca introdotto in epoca Reagan. Il risultato: 2 miliardi di dollari risparmiati nel 2024 e quasi 4 miliardi nell'anno fiscale 2025, secondo il New York Times. Meta risulta il maggiore beneficiario conosciuto tra le quotate.

La nota stonata arriva dai documenti depositati dalla società stessa: potrebbe dover restituire quanto ottenuto per "incertezze con i nostri crediti di ricerca". L'IRS sta già cercando di recuperare 355 milioni per un altro escamotage fiscale del 2013 sullo sviluppo del News Feed.

Perché conta in pratica. Se una fetta del conto dei data center viene coperta dai crediti di ricerca, il prezzo reale dell'inferenza nei listini è drogato. Chi costruisce un business model sul sussidio sta prendendo in prestito margine dal futuro. Le stesse aziende AI stanno massimizzando il capitale investito con la leva fiscale come moltiplicatore, ed è fuffa contabile finché non si vede margine operativo vero.

Nella stessa settimana arriva il controcanto. L'indice di Silicon Data sui costi effettivi è passato dal picco di 2,07 dollari per milione di token di fine maggio a 0,99 dollari il 7 ottobre, con un calo del 52%. I token settimanali su OpenRouter sono cresciuti di oltre 250 volte tra gennaio 2025 e settembre 2026. Il prezzo unitario crolla mentre i volumi esplodono.

La spinta viene dai listini. Il 30 luglio OpenAI ha tagliato dell'80% i prezzi API di GPT-5.6 Luna e del 20% quelli di Terra, portando l'input di Luna a 0,20 dollari per milione. Anthropic ha differenziato i prezzi di Claude 5.5 per tipo di lavoro. Il dato più interessante dell'analisi OpenRouter non è lo sconto, ma il 32% di clienti rimasti a pagare prezzo pieno dopo la fine delle promozioni: chi torna paga perché ha trovato valore reale.

Il costo per token scende, ma la metrica che conta resta il costo per attività completata.

Un token più economico permette cicli di ragionamento più lunghi, più chiamate di verifica, agenti che si controllano a vicenda. Il vero guadagno è potersi permettere più token per arrivare a un risultato corretto. Un approfondimento sul crollo dei costi di inferenza e sui conti delle pipeline autonome aiuta a inquadrare la scala del fenomeno.

Con i pesi aperti cambia la partita?

Mistral Large 4 è il modello più grande mai costruito dalla casa francese: 1 trilione di parametri con 49 miliardi attivi, multimodale nativo, addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell dentro i datacenter europei di Mistral. La preview è su Mistral Studio, i pesi arrivano a fine mese.

Il numero che sposta il lavoro è l'82% nel test che chiede di riprodurre e poi patchare una vulnerabilità reale, il punteggio più alto di qualsiasi modello. Qui però il caveat è realistico: la barriera non è solo tecnica. Servono GPU, competenze di fine-tuning e un presidio normativo che pochi team hanno già in casa, e nei progetti che seguo è quasi sempre il secondo collo di bottiglia a far slittare le timeline. Prima di riscrivere l'architettura conviene capire cosa state davvero pagando oggi, con un audit del stack AI e dei costi. Il dettaglio interessante è che modelli chiusi come Claude Opus 5.5 e GPT-6 Astra segnano quasi zero sugli stessi test perché rifiutano il task.

Tradotto per chi progetta pipeline di security: pesi aperti più self-deployment su private cloud cambiano il modo in cui si possono mettere insieme workflow di analisi malware, prioritizzazione vulnerabilità e scrittura di detection rule. Il filtro del provider smette di bloccare la pipeline a metà incidente.

Sul lato open c'è anche il rilascio NASA + IBM del Lunar Foundation Model, addestrato su quasi 2 milioni di tile bundle derivati da 17 anni di dati del Lunar Reconnaissance Orbiter. La mossa è intelligente: dati grezzi più pesi già allenati, così i team piccoli saltano mesi di preprocessing e vanno dritti al problema. La domanda tecnica resta una sola: generalizza o è overfit sul dataset del LRO?

Chiude il quadro EmbeddingGemma 2, sotto 1B parametri, licenza Apache 2.0, un solo spazio vettoriale a 768 dimensioni per testo, codice, immagini, video e audio. Per chi costruisce retrieval, un embedding multimodale a licenza permissiva è leva gratuita. In questo scenario il tema del superamento del vendor lock-in diventa la cornice più utile per leggere i rilasci di settimana in settimana.

I watermark tengono davvero?

OpenAI ha introdotto textGrain, un watermark invisibile nei testi generati da ChatGPT e Codex per gli utenti europei. Il meccanismo lavora dentro il modello: durante la generazione modifica leggermente le probabilità dei token e costruisce uno schema statistico che un detector dedicato può cercare. Nessun carattere nascosto, nessuno spazio invisibile.

Il rilascio arriva poco più di due mesi dopo gli obblighi di trasparenza dell'AI Act. L'articolo 50 chiede una marcatura leggibile dalle macchine, efficace, interoperabile e robusta. L'accesso al detector resta inizialmente riservato a ricercatori e organizzazioni autorizzate, quindi la verifica lato impresa resta in mano al fornitore.

I test pubblicati da OpenAI mostrano che testi brevi, traduzioni e modifiche dopo la generazione indeboliscono la rilevabilità in modo netto. Un watermark che regge solo l'output grezzo serve a poco: i testi che escono dalle pipeline passano per riscrittura, riassunto, traduzione e formattazione. Ogni passaggio erode il segnale e rende il detector meno affidabile.

Google ha aperto al pubblico SynthID Detector, con oltre 180 miliardi di immagini e video marcati fino a oggi. Chiunque può caricare un file JPG, PNG, MP4 o MP3 e verificare se porta la firma di Gemini, Veo o Lyria. La rilevazione è integrata in Search, nell'app Gemini e in Chrome, con circa un milione di verifiche al giorno.

Il limite è il perimetro. SynthID rileva solo i watermark SynthID. Un'immagine generata da un modello concorrente resta invisibile. OpenAI controlla i suoi, Google i suoi, Nvidia e Kakao si appoggiano a SynthID per i media. Il risultato è un mosaico di silos dove l'assenza di marcatura non dimostra nulla.

Per chi costruisce workflow di content ops il valore pratico è comunque concreto: SynthID diventa un primo filtro in una pipeline di ingestione, con un secondo livello di analisi per tutto il resto. Chi promette una soluzione unica sta vendendo fumo.

Insight tecnico. Immagine generata con l'AIImmagine generata interamente con l'AI.

Gli agenti universali cambiano qualcosa?

Al Gemini at Work 2026 Google Cloud ha presentato Gemini agent, un agente unico dentro una sola casella di prompt. Si appoggia a Gmail, Drive, Docs, Slides, Sheets, Chat e Calendar, portandosi dietro la stessa memoria, le stesse skill e gli stessi controlli su ogni superficie. Sceglie il modello per ogni job, orchestrando Gemini e Claude di Anthropic oggi e altri domani.

La feature più interessante sono i coworker agent: identità propria, email tipo @agents.company.com, storage dedicato e accesso limitato al contesto fornito. Aggiungici i sub-agenti temporanei per i task multi-step e ottieni qualcosa che assomiglia a un team virtuale con permessi e responsabilità definite.

Claude Managed Agents spinge il fan-out fino a 1.000 sotto-agenti su una singola codebase. Il server MCP stateless in Python è il tutorial da un'ora che rende esponibili tool, risorse e prompt via HTTP. La governance con identity e policy management resta la parte noiosa che però decide se un progetto va in produzione o resta in demo, e con centinaia di agenti che girano in parallelo la domanda su chi controlla gli agenti autonomi smette di essere teorica.

Sul lato costi, Smart Routing e spend cap in tempo reale cancellano il layer di cost tracking che fino a ieri si costruiva a mano. È esattamente il pezzo di orchestrazione che serviva per rendere sostenibile un team di agenti su task lunghi.

Cosa tenere d'occhio adesso?

La settimana ha lasciato diversi strumenti che vale la pena isolare dal resto del rumore.

  • Claude Code Mods, middleware JavaScript e TypeScript dentro Claude Code per pannelli custom, intercettazione delle tool call e nuovi comandi. È il tipo di estensione che trasforma un coding agent in un ambiente su misura.

  • BootLoops, harness open source per calcoli scientifici precisi, già usato per produrre paper su 18 campi. Interessante perché affronta un limite noto dei modelli sui numeri, senza riaddestrare.

  • Manus, agente autonomo con macchina virtuale, browser reale e filesystem persistente nel cloud. Non è una chat: esegue task completi.

  • Jev, framework open source che trasforma le decisioni nascoste degli agenti in scelte tipizzate con probabilità, al posto del solo testo libero.

  • LiteLLM, router open source con una sola API per centinaia di modelli, budget, retry e fallback per provider. Diventa quasi obbligatorio quando lo stack mescola Gemini, Claude e modelli a pesi aperti.

  • Claude Haiku 5.5 su Bedrock a un quarto del costo del predecessore, Gemini Flash-Lite gratuito per alto volume. Due opzioni concrete per i task semplici che tenevano su la bolletta.

  • AI Edge Foresight, note-taker offline di Google che trascrive riunioni e risponde a domande on-device senza cloud.

  • Cyber Mission scanner di Anthropic, gratuito per progetti open source e infrastrutture critiche.

Il filo che tiene insieme tutto: la leva si sposta sempre più sul come e sempre meno sul quanto costa il modello. Chi oggi costruisce routing, cache, verifiche incrociate e self-deployment sta già lavorando sul layer che resta quando i prezzi continuano a scendere e i pesi circolano liberi.

Testo creato con l'aiuto dell'AI e revisionato da me.

Ti è stato utile? Ne ho altri così.

Ogni settimana scelgo le notizie AI più interessanti e di impatto e le condivido in una recap via email. Iscriviti per non perdere il prossimo.

Una mail a settimana. Disiscrizione in un click.

Condividi l'Insight di SundAI Blog
LinkedInXEmail
Copertina libro

Lavora Meglio con l'Intelligenza Artificiale

La guida pratica che trasforma l'AI in risultati concreti nel lavoro di tutti i giorni: 200+ prompt pronti, 12 problemi quotidiani, esempi reali e metodo operativo per lavorare meglio e risparmiare tempo senza tecnicismi inutili.

Scopri il libro

Prima di andare via, ti consiglio anche questi insights.

Quanto costa davvero l'autonomia dei nostri agenti AI?

Quanto costa davvero l'autonomia dei nostri agenti AI?

Gli agenti di OpenAI bucano siti governativi, Nvidia risponde con guardrail hardware e il Pentagono riscrive la supply chain: la settimana in cui il conto dell'autonomia è arrivato.

Leggi tutto
L'e-commerce agentico e il crollo dei costi di inferenza ci salveranno dalla bolla del debito AI?

L'e-commerce agentico e il crollo dei costi di inferenza ci salveranno dalla bolla del debito AI?

I modelli open-weight e Claude Opus 5 abbattono i costi operativi, mentre l'AI inizia a fare acquisti in autonomia. Il debito nascosto delle Big Tech impone però di diversificare l'infrastruttura.

Leggi tutto
Serve ancora una governance globale dell’AI se USA, UE e Cina corrono da sole?

Serve ancora una governance globale dell’AI se USA, UE e Cina corrono da sole?

Trump lancia l'AI Force e l'Italia rende penale l'omessa sorveglianza umana: regole a due velocità, prezzi dei modelli in caduta e la Cina al 59% dei robot. Per chi costruisce, i guardrail sono già backlog.

Leggi tutto

L'Insight fatto Podcast

AI Audio Version

Ascoltalo mentre guidi o sei in palestra.

Ready
Fabrizio Mazzei, AI Solutions Architect e consulenza AI
Autore

Fabrizio Mazzei

AI Solutions Architect

Come AI Solutions Architect progetto ecosistemi digitali e flussi di lavoro autonomi. 10 anni nel marketing digitale, oggi integro l'AI nei processi aziendali: da Next.js e sistemi RAG a strategie GEO e formazione dedicata. Mi piace parlare di AI e automazioni, ma non solo: ci ho anche scritto un libro, "Lavora Meglio con l'Intelligenza Artificiale", un manuale pratico con 12 capitoli e oltre 200 prompt pronti all'uso per chi vuole usare ChatGPT e l'AI senza programmare. Il mio punto di forza? Guardare un processo manuale e vedere già l'architettura automatizzata che lo sostituirà.

Scopri il libro che ho scrittoPosso aiutarti con l'AI?Hai bisogno d'aiuto con l'AI?Connettiamoci su LinkedIn