Un sistema generativo compatto da 4B parametri
Il 22 luglio 2026 Microsoft Research ha pubblicato Mage-Flow, un sistema generativo compatto da soli 4 miliardi di parametri dedicato alla generazione di immagini da testo e all'editing basato su istruzioni.
A differenza della maggior parte dei modelli che scalano a decine di miliardi di parametri, Mage-Flow punta sull'efficienza attraverso una co-progettazione attenta di tre elementi:
- Mage-VAE: un tokenizer latente leggero basato su one-step diffusion che riduce drasticamente il costo di encode/decode rispetto ai VAE tradizionali, mantenendo alta fedeltà.
- NR-MMDiT: un Multimodal Diffusion Transformer nativo-resolution da 4B addestrato con rectified flow matching.
- Ottimizzazioni di sistema (native-resolution packing + kernel CUDA fusi) che accelerano il training di circa 2,5×.
Il modello gestisce nativamente risoluzioni da 512 a 2048 pixel su qualsiasi aspect ratio, comprese le proporzioni estreme 4:1, con un unico checkpoint.
Tre varianti per ogni caso d'uso
Sono disponibili tre varianti per generazione e per editing:
- Base
- RL-aligned (allineata con Diffusion-NFT)
- Turbo (distillata a 4 step)
Le versioni Turbo sono particolarmente interessanti per l'uso interattivo: su una singola A100 a 1024² generano un'immagine in 0,59 secondi e completano un edit in 1,02 secondi, con un picco di memoria di soli 18-20 GB.
Disponibilità
I pesi sono disponibili su Hugging Face sotto licenza MIT, insieme al codice e al paper tecnico.
Mage-Flow dimostra ancora una volta che un design di sistema accurato può competere con modelli molto più grandi in termini di qualità, velocità e accessibilità.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




