DeepSeek ha completato la transizione del proprio ecosistema API verso il nuovo modello V4.1 Flash, segnando un cambio di strategia in cui il tier "leggero" supera ora il precedente flagship. Rilasciato il 10 settembre 2026, V4.1 Flash non è un semplice aggiornamento incrementale, ma una sostituzione architettonica completa dei precedenti modelli V4 Flash e V4 Flash Vision Exp.
L'aspetto più dirompente di questo rilascio è il pensionamento programmato di V4 Pro. A partire dal 14 settembre 2026, alle ore 12:00 (ora di Pechino), tutte le richieste indirizzate al modello Pro saranno automaticamente reindirizzate a V4.1 Flash. Questa mossa è supportata da test interni ed esterni che dimostrano come il nuovo modello Flash superi a livello globale V4 Pro in tutte le metriche chiave, inclusa la potenza di calcolo, la velocità di inferenza e i tempi di completamento dei task.
Architettura asimmetrica e multimodality

Scraped da https://x.com/deepseek_ai/status/2097930608790167907
Come già analizzato durante il rilascio della beta, V4.1 Flash adotta una nuova architettura Causal-Encoder-Decoder basata su un framework Mixture-of-Experts (MoE) da 552 miliardi di parametri. L'innovazione centrale risiede nel design asimmetrico: solo 8 miliardi di parametri vengono attivati durante la fase di input, mentre 16 miliardi di parametri sono attivi per l'output. Questo squilibrio permette al modello di mantenere un elevato soffitto di capacità riducendo drasticamente il costo computazionale nell'elaborazione di prompt lunghi.
Inoltre, V4.1 Flash integra la comprensione visiva nativamente all'interno dell'architettura di base. A differenza delle iterazioni precedenti, dove la visione era spesso un modulo separato o un'aggiunta sperimentale, questa integrazione nativa permette un throughput più elevato e un ragionamento multimodale più fluido.
Nuova struttura di pricing dinamico
Il lancio introduce un modello di prezzi a scaglioni che fluttua in base alla domanda, riflettendo l'allontanamento dell'azienda dall'era dell'AI "ultra-economica" verso un modello infrastrutturale più sostenibile. Il pricing è diviso tra ore di bassa affluenza (off-peak) e ore di picco (1:00–4:00 e 6:00–10:00 UTC, dal lunedì al venerdì).
| Tipo di Token | Prezzo Off-peak (per 1M) | Prezzo Peak (per 1M) |
|---|---|---|
| Input (Cache Hit) | 0,003 dollari | 0,006 dollari |
| Input (Cache Miss) | 0,15 dollari | 0,3 dollari |
| Output Tokens | 0,6 dollari | 1,2 dollari |
Rispetto al precedente V4 Flash, queste tariffe rappresentano una riduzione di circa l'11% - 57% a seconda del tipo di token, abbassando ulteriormente la barriera d'ingresso per i workflow agentici ad alto volume.
Implicazioni strategiche: la fine del mid-tier
La decisione di reindirizzare le richieste Pro verso un modello Flash segnala un cambio di paradigma nello scaling dell'AI. Per mesi, l'industria ha seguito una gerarchia rigida: Flash per la velocità, Pro/Ultra per l'intelligenza. Dimostrando che un'architettura MoE ottimizzata può offrire ragionamenti di livello "Pro" a velocità e costi da "Flash", DeepSeek mette in discussione la necessità di modelli densi e massivi per la maggior parte dei task aziendali.
Questa evoluzione segue un periodo di intensa competizione in cui le versioni precedenti, come la V4-Flash 0731, avevano già iniziato a sfidare il rapporto costo-prestazioni di modelli come GPT-5.6 Luna. L'attuale transizione suggerisce che DeepSeek stia privilegiando l'efficienza architettonica rispetto al semplice numero di parametri, puntando a un framework scalabile che possa essere espanso verso modelli ancora più grandi senza un aumento lineare della latenza.

Ancora nessun commento. Puoi essere il primo!