Tre modelli aperti di ultima generazione sono stati messi a confronto su task reali e non su benchmark sintetici: Qwen 3.8 Max di Alibaba (2,4 trilioni di parametri), DeepSeek V4 Flash (284 miliardi totali, 13 miliardi attivi) e Kimi K3 di Moonshot AI (2,8 trilioni di parametri).
Il test ha utilizzato le stesse condizioni e gli stessi prompt per tutti. Le due prove principali sono state la riparazione di un’applicazione full-stack rotta (coastal cabins booking manager con cinque bug inseriti deliberatamente) e la generazione di una landing page 3D completamente self-contained in un unico file HTML con Three.js e animazioni scroll.
Risultati sul bug-fixing
Tutti e tre i modelli hanno corretto ogni bug e hanno eseguito verifiche autonome. Le differenze emergono nei tempi e nel metodo:
- Qwen 3.8 Max ha completato il lavoro in 6 minuti e 37 secondi. Ha scritto uno script di verifica, ha lanciato lo stack, ha controllato gli endpoint e ha eseguito un cleanup completo.
- Kimi K3 ha impiegato circa 8-9 minuti, con 17 asserzioni live. Il risultato era corretto ma ha lasciato un booking residuo.
- DeepSeek V4 Flash ha impiegato 23 minuti. Ha risolto i bug ma ha generato molti controlli non necessari, rallentando il processo.
Risultati sulla landing page 3D
Il brief chiedeva una piattaforma petrolifera semisommersa con effetto giorno-notte, camera orbitante e scroll-to-dive.
- Qwen 3.8 Max ha prodotto il risultato più editoriale e pronto all’uso, con il miglior first-frame.
- DeepSeek V4 Flash ha generato la geometria più dettagliata e letterale.
- Kimi K3 ha mostrato un problema di framing della camera all’inizio, risolto solo durante lo scroll.
Cosa significa per chi sviluppa
Tutti e tre i modelli supportano 1 milione di token di contesto e ragionamento agentico. Kimi K3 è già disponibile con pesi aperti. Qwen 3.8 Max e DeepSeek V4 Flash dovrebbero seguire a breve.
Il confronto conferma che le specifiche tecniche contano meno delle prestazioni su task end-to-end. Velocità di risoluzione, qualità del cleanup e gusto progettuale fanno la differenza quando si costruiscono agenti e pipeline lunghe.
Fonti ufficiali: Qwen 3.8 Max, DeepSeek V4 Flash, Kimi K3.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




