Tech News, powered by Quinck — tre notizie della settimana che sembrano appartenere a mondi diversi: un chip di OpenAI, un modello di Anthropic criticato dai suoi stessi utenti, due processori Apple. In realtà raccontano lo stesso passaggio. La potenza di calcolo grezza ha smesso di essere il collo di bottiglia. Adesso il problema è quanto costa erogare l'intelligenza, e quanto costa riceverla.
Le 3 notizie in 30 secondi
- OpenAI ha pubblicato i primi numeri di Jalapeño, il chip di inferenza disegnato con Broadcom: fino a 1,9 volte più lavoro utile per kilowatt e fino a 3,6 volte meno latenza end-to-end rispetto ai sistemi di confronto. Misurazioni fatte in casa, su silicio ingegneristico, contro Blackwell: non contro Rubin.
- Claude Opus 5 è in cima alle classifiche di intelligenza e in fondo a quelle di gradimento. Il motivo non è la qualità delle risposte: è la loro lunghezza. Anthropic aveva documentato il comportamento prima del lancio, e il 20 agosto ha rilasciato uno stile di output "Concise" per contenerlo.
- Apple ha annunciato M6, il suo primo chip a 2 nanometri, e M5 Ultra, il più potente mai prodotto a Cupertino. Mancano all'appello le versioni Pro, Max e Ultra dell'M6: secondo Bloomberg non sono in ritardo, sono cancellate.
1. Jalapeño: OpenAI porta i numeri, e il confronto è con Blackwell
Il 24 giugno OpenAI e Broadcom avevano presentato Jalapeño, il primo acceleratore progettato da OpenAI: un ASIC di dimensione reticolare, arrivato al tape-out in nove mesi, una tempistica che nel mondo del silicio custom è quasi anomala. All'annuncio mancava però la parte che conta: i dati. Da qui lo scetticismo con cui la notizia era stata accolta a giugno.
Il 25 agosto i dati sono arrivati. OpenAI ha pubblicato le prime misurazioni su silicio funzionante, eseguite con InferenceX, il benchmark di SemiAnalysis che valuta il percorso completo di una richiesta invece di un kernel sintetico. I workload sono tre modelli aperti: GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 da un bilione di parametri (mille miliardi).
I risultati dichiarati:
| Metrica | Jalapeño vs sistemi di confronto |
|---|---|
| Lavoro AI di picco per kilowatt | da 1,5× a 1,9× |
| Latenza end-to-end | da 1,7× a 3,6× più bassa |
| TDP di package | 700 W (contro 1.200 W e 1.400 W) |
Il punto tecnico interessante non è il singolo numero, ma la combinazione. Nei sistemi di inferenza throughput e latenza si comprano l'uno a scapito dell'altra: si aumentano i batch, il costo per token scende, il tempo di risposta sale. Jalapeño dichiara di migliorare entrambi con la stessa architettura, avendo ottimizzato in particolare le fasi di prefill e di comunicazione, cioè i punti dove i dati si spostano invece di essere calcolati. È esattamente il collo di bottiglia che gli agenti rendono più doloroso: un agente concatena molti passi, e ogni ritardo si somma lungo tutto il task.
Due precisazioni che cambiano la lettura
Il confronto è con Blackwell, non con Rubin. I sistemi di riferimento sono le piattaforme Nvidia attualmente in campo; sulla generazione Rubin, che è il vero termine di paragone temporale per un chip in deployment a fine 2026, non ci sono numeri. È la domanda che resta aperta, ed è quella che deciderà se Jalapeño è un vantaggio strutturale o una fotografia di un momento.
I numeri sono di OpenAI. L'hardware non è disponibile a team esterni, nessuno ha rieseguito i test in modo indipendente, e l'efficienza è normalizzata sul TDP di package dichiarato di ciascun acceleratore — una scelta metodologicamente legittima ma non neutra. I workload sono nominali: 8.000 token in input, 1.000 in output, predizione a token singolo.
Restano fatti solidi: il chip esiste, gira, e i risultati sono operativi e non di picco teorico. Il deployment interno parte entro fine 2026, in volumi piccoli, con la scala vera attesa nel 2027; le generazioni 2 e 3 sono già in lavorazione. Hock Tan di Broadcom ha parlato di costi operativi inferiori di circa il 50% rispetto alle GPU comunemente usate per l'inferenza.
Per chi compra inferenza (cioè, ormai, chiunque costruisca software) la conseguenza non è immediata: Jalapeño non si acquista, si userà servendo modelli OpenAI. Ma il segnale è che il costo per token dei fornitori grandi ha ancora molto margine di discesa, e che quel margine arriverà da silicio verticale, non da sconti commerciali.
2. Opus 5: primo in classifica, ultimo in leggibilità
Claude Opus 5 è uscito il 24 luglio, posizionato da Anthropic come vicino all'intelligenza di frontiera di Fable 5 a metà del prezzo. Sui benchmark la promessa regge: il modello sta in cima alle classifiche aggregate di intelligenza e compete con GPT-5.6 su coding, ricerca agentica e computer use.
Poi è arrivata la community, e il verdetto è stato molto meno gentile.
Il problema non è la correttezza delle risposte. È che Opus 5 produce circa il doppio dei token in output rispetto ai modelli precedenti, con una tendenza a spiegare, premettere, verificare e delegare anche quando la domanda era banale. Su Reddit la battuta che ha fatto il giro chiedeva quale gusto di gelato scegliere e riceveva in cambio un piano industriale. Recensori in anticipo sul rilascio hanno usato parole come "nevrotico" e "slop"; sviluppatori di tool hanno segnalato la tendenza a trattare ogni problema minore come un incidente grave da risolvere con centinaia di righe di codice.
Il dettaglio più interessante è che il giudizio si spacca lungo una linea precisa: il modello piace quando lavora da solo e non piace quando lavora con te. Lasciato per ore su un obiettivo verificabile, produce risultati che gli stessi critici definiscono ottimi. Messo in una conversazione, sommerge.
Cosa ha fatto Anthropic
Va detto che il comportamento non è una sorpresa emersa dopo: la guida di prompting di Opus 5 pubblicata da Anthropic documentava già al lancio risposte più lunghe della media, maggiore narrazione durante i task agentici, auto-verifica spontanea e una delega ai subagent più disinvolta: con l'avvertenza esplicita che su task piccoli quella delega moltiplica costo e tempo.
Documentare un comportamento, però, non è la stessa cosa che sceglierlo insieme all'utente. Per settimane la risposta pubblica è rimasta ferma alla documentazione, mentre le lamentele si accumulavano; poi sono arrivati il riconoscimento diretto da parte di un ingegnere Anthropic e, il 20 agosto, uno stile di output "Concise" integrato in Claude Code, attivabile da /config o via "outputStyle": "Concise" nelle impostazioni. Nel frattempo si è capito che il rimedio più diffuso, abbassare l'effort, non funziona come si spera: riduce quanto il modello pensa, non quanto scrive. Funziona meglio il contrario, cioè togliere dai propri prompt le vecchie istruzioni tipo "ricontrolla il tuo lavoro", che su questa generazione sono ridondanti e alimentano proprio il comportamento che si vuole evitare.
Perché la notizia non è una lamentela
Qui c'è un fatto che vale più della singola release, e che si tende a trascurare.
In un mondo in cui l'AI diventa più intelligente, più autonoma e capace di gestire task sempre più vari, l'essere umano continua a essere il punto in cui il lavoro viene approvato, corretto e messo in produzione. Se vogliamo mantenere il controllo e incassare i benefici dell'automazione, dobbiamo interfacciarci con questi sistemi. E una risposta opaca, o che va decifrata, rompe esattamente il punto di contatto in cui il controllo si esercita.
Detto in termini economici: un modello che impiega tremila parole per dire ciò che ne richiedeva quaranta non ha sbagliato il contenuto, ha spostato il costo. L'ha spostato dal calcolo alla lettura, cioè sul lato dove il collo di bottiglia è umano e non scala. La sinergia da cui dovrebbe arrivare l'aumento di produttività previsto (la persona che legge, verifica, corregge e decide) si inceppa lì.
Watt per token da una parte, parole per risposta dall'altra: sono la stessa metrica di efficienza applicata ai due estremi della catena. Sul primo estremo l'industria misura ossessivamente. Sul secondo ha cominciato adesso.
(Sì, siamo consapevoli dell'ironia di scrivere tre paragrafi sulla verbosità. Ci fermiamo qui.)
3. Apple: 2 nanometri sul desktop, e una generazione che non arriverà
Il 25 agosto Apple ha annunciato M6 e M5 Ultra, con un comunicato stampa e senza keynote: cosa già di per sé insolita per un salto di processo produttivo.
M6 è il primo chip Apple costruito a 2 nanometri (processo N2 di TSMC): CPU a 12 core, GPU a 12 core con Neural Accelerator, Neural Engine dual da 16 core e fino a 170 GB/s di banda di memoria unificata. Va nel nuovo Mac mini, dove Apple dichiara prestazioni AI fino a 4 volte superiori, grafica e storage fino a 2 volte più veloci e CPU più rapida del 40% rispetto alla generazione precedente. È il chip per i workflow standard.
M5 Ultra è un'altra categoria. È il primo chip quad-die di Apple: due M5 Max dual-die fusi con la nuova generazione di UltraFusion, per arrivare fino a 36 core di CPU, 80 core di GPU, 1,2 TB/s di banda di memoria unificata (il 50% in più dell'M3 Ultra) e fino a 512 GB di memoria unificata. Sta solo nel nuovo Mac Studio, in vendita dal 22 settembre, con le configurazioni da 512 GB attese a fine ottobre.
Quel numero, 512 GB di memoria unificata accessibile dalla GPU, è la ragione per cui questo annuncio interessa anche chi non compra Mac. Significa eseguire in locale modelli che oggi richiedono un cluster affittato, con i dati che non escono mai dalla macchina. È la stessa questione di sovranità del dato di cui abbiamo parlato a proposito dei modelli open weights, affrontata dal lato hardware invece che dal lato licenza.
Il buco nella lineup
Manca qualcosa, ed è vistoso: non esistono M6 Pro, M6 Max e M6 Ultra. Il Mac mini affianca all'M6 un M5 Pro, e il Mac Studio monta M5 Max e M5 Ultra. Tutta la fascia alta resta sulla generazione precedente.
L'ipotesi benevola è che Apple abbia tenuto gli annunci per dopo, anche per non oscurare l'M5 Ultra. Le indiscrezioni dicono l'opposto. Secondo Mark Gurman di Bloomberg, quelle varianti non sono rinviate: non verranno sviluppate, per la prima volta nell'era Apple Silicon. La roadmap riportata è M7 base nella prima metà del 2027, M7 Pro e M7 Max a fine 2027, M7 Ultra nel 2028: con quest'ultimo indicato come un salto "drammatico" sulle prestazioni AI e come possibile motore dei server Apple Intelligence dal 2029.
Il motivo dichiarato è uno solo: l'AI. Apple aveva pianificato per la famiglia M7 aggiornamenti importanti al neural processing e ha deciso che valeva la pena accelerare la generazione successiva invece di completare quella in corso.
È una scelta che dice più di molti comunicati. Saltare metà di una generazione di chip (la parte più redditizia, per giunta) per arrivare prima con l'unità che esegue i modelli significa che l'AI ha smesso di essere una feature che il silicio deve supportare ed è diventata il criterio con cui il silicio viene progettato e calendarizzato.
Il filo rosso: l'intelligenza è abbondante, l'efficienza no
Tre notizie, un solo movimento.
OpenAI progetta silicio proprio per abbassare il costo energetico e la latenza dell'inferenza. Apple riscrive la propria roadmap per portare prima l'esecuzione dei modelli sulla scrivania. E Anthropic scopre che un modello ai vertici dell'intelligenza può risultare frustrante perché spende male l'unica risorsa che nessun processo produttivo può raddoppiare: l'attenzione di chi legge.
Nessuna delle tre riguarda il rendere i modelli più bravi. Riguardano tutte e tre il costo di consegnare quella bravura: in watt, in millisecondi, in parole.
Per chi costruisce software le voci operative sono tre, e sono concrete.
Misurare la latenza end-to-end, non il picco. È la metrica che percepisce l'utente ed è quella che si accumula lungo un flusso agentico. Un throughput di picco eccellente con una coda lunga dà un prodotto lento.
Trattare verbosità e formato di output come parametri di progetto. Non sono un dettaglio estetico: sono costo per token, tempo di revisione e rischio che un'istruzione importante finisca sepolta. Vanno impostati, misurati e verificati come qualunque altro requisito — e conviene ripulire i prompt ereditati, perché con questa generazione di modelli le vecchie istruzioni difensive spesso peggiorano il risultato.
Tenere la scelta del modello e del fornitore reversibile. In dieci settimane sono cambiati il costo dell'inferenza al watt, la fascia di hardware su cui girano i modelli in locale e il modello di riferimento per metà dei team. Un'architettura che dà per scontato un fornitore specifico è un'architettura che va riscritta a ogni ciclo.
Domande frequenti
Cos'è Jalapeño e chi lo produce? È il primo acceleratore di inferenza progettato da OpenAI, sviluppato con Broadcom per l'implementazione su silicio e la parte di networking. È stato presentato il 24 giugno 2026 ed è arrivato al tape-out in nove mesi. Il deployment nell'infrastruttura OpenAI è previsto entro la fine del 2026, in volumi iniziali contenuti.
Cosa dicono i primi benchmark di Jalapeño? Misurati sul benchmark InferenceX di SemiAnalysis su GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5, i risultati pubblicati il 25 agosto 2026 indicano da 1,5 a 1,9 volte più lavoro AI di picco per kilowatt e da 1,7 a 3,6 volte meno latenza end-to-end rispetto ai sistemi di confronto.
Jalapeño è più veloce dei chip Nvidia? Sui test pubblicati sì, ma il confronto è con la generazione Blackwell attualmente in campo, non con Rubin. I dati provengono da OpenAI, l'hardware non è accessibile a terze parti e nessuno ha rieseguito i test in modo indipendente.
Posso comprare o affittare Jalapeño? No. Non è un prodotto venduto sul mercato: è silicio interno che OpenAI userà per servire i propri modelli. L'effetto per chi sviluppa si vedrà eventualmente su costo, latenza e disponibilità delle API.
Perché Claude Opus 5 è criticato se va bene sui benchmark? Perché il problema riguarda l'esperienza d'uso, non la correttezza. Il modello produce circa il doppio dei token in output rispetto ai precedenti, con spiegazioni, premesse e verifiche non richieste. Il giudizio migliora nettamente quando lavora in autonomia su obiettivi verificabili e peggiora nell'uso conversazionale.
Anthropic ha riconosciuto il problema di Opus 5? Il comportamento era documentato nella guida di prompting fin dal lancio del 24 luglio 2026. Dopo settimane di critiche è arrivato un riconoscimento pubblico da parte di un ingegnere dell'azienda e, il 20 agosto, uno stile di output "Concise" integrato in Claude Code. La correzione strutturale è attesa nei modelli successivi.
Come si riduce la verbosità di Opus 5 oggi? Attivando lo stile di output "Concise" e, soprattutto, rimuovendo dai propri prompt le istruzioni ereditate del tipo "ricontrolla il tuo lavoro": su questa generazione sono ridondanti e amplificano il problema. Abbassare l'effort riduce il ragionamento, non la lunghezza della risposta.
Cosa cambia con il chip Apple M6? È il primo chip Apple a 2 nanometri, con CPU e GPU a 12 core, Neural Engine dual da 16 core e fino a 170 GB/s di banda di memoria unificata. Nel nuovo Mac mini Apple dichiara prestazioni AI fino a 4 volte superiori alla generazione precedente.
Quanto è potente M5 Ultra? È il chip più potente mai realizzato da Apple e il suo primo quad-die: due M5 Max dual-die uniti tramite UltraFusion, fino a 36 core CPU, 80 core GPU, 1,2 TB/s di banda di memoria e fino a 512 GB di memoria unificata. È esclusivo del nuovo Mac Studio, disponibile dal 22 settembre 2026.
Apple lancerà M6 Pro, M6 Max e M6 Ultra? Secondo le indiscrezioni di Bloomberg no: quelle varianti sarebbero cancellate, non rinviate. La fascia alta passerebbe direttamente alla famiglia M7, con il modello base nella prima metà del 2027, Pro e Max a fine 2027 e Ultra nel 2028. Sono report, non annunci ufficiali di Apple.
Fonti
- OpenAI: Jalapeño's first results show industry-leading speed and efficiency in AI inference
- OpenAI e Broadcom: OpenAI and Broadcom unveil LLM-optimized inference chip
- TechCrunch: OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show
- Tom's Hardware: Broadcom and OpenAI unveil custom-built Jalapeño inference processor
- Thariq Shihipar, Anthropic: dichiarazione su Opus 5 su X
- Anthropic: Prompting Claude Opus 5
- Anthropic: Prompting best practices
- Apple Newsroom: Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute
- Apple Newsroom: Apple unveils a more powerful Mac mini featuring the all-new M6 and M5 Pro
- Bloomberg: Apple to Skip High-End M6 Mac Chips, to Launch M7 Pro, M7 Max, M7 Ultra Instead


