MiniMax-M3 è ora disponibile pubblicamente su Hugging Face come modello open-weight. Si tratta di un Mixture-of-Experts nativo multimodale con circa 428 miliardi di parametri totali e circa 23 miliardi attivati, progettato per combinare tre capacità finora difficili da trovare insieme in un singolo modello aperto: coding e agentic di livello frontier, context window da 1 milione di token e multimodality nativa.
Il modello è stato annunciato il 1 giugno 2026 e i pesi sono stati rilasciati nei giorni successivi. È il primo open-weight a unire queste tre caratteristiche in un'unica architettura.
Architettura MSA e context da 1M token
Il cuore tecnico di MiniMax-M3 è MiniMax Sparse Attention (MSA). Si tratta di un meccanismo di attenzione sparsa blockwise costruito sopra Grouped Query Attention. Un Index Branch leggero seleziona i blocchi KV più rilevanti; il Main Branch esegue poi l'attenzione esatta solo su quei blocchi.
Rispetto alla generazione precedente (M2), a 1M di token MSA offre circa 9× di speedup in prefill e 15× in decode, riducendo il compute per token a circa 1/20. L'API garantisce un minimo di 512K token di context.
Questa efficienza rende praticabile l'uso di finestre ultra-lunghe per task agentic multi-step, coding su codebase intere e analisi multimodali prolungate.
Performance su coding e agentic
MiniMax-M3 raggiunge risultati di livello frontier sui benchmark di software engineering e agentic:
- SWE-Bench Pro: 59.0%
- SWE-Bench Verified: 80.5%
- Terminal-Bench 2.1: 66.0%
- SWE-fficiency: 34.8%
- KernelBench Hard: 28.8%
- MCP Atlas: 74.2%
Il modello è orientato a decomposizione autonoma dei task, invocazione di tool e ragionamento multi-step. MiniMax ha mostrato esempi reali di agent che riproducono paper accademici e ottimizzano kernel CUDA in modo autonomo su periodi di 12-24 ore.
Multimodalità nativa
A differenza di modelli che aggiungono capacità vision in post-training, M3 è stato addestrato in mixed-modality fin dal primo step. Supporta input di testo, immagini e video con output testuale. Questo permette una fusione semantica più profonda tra le modalità.
Disponibilità e licenza
I pesi sono disponibili su Hugging Face (MiniMaxAI/MiniMax-M3) e GitHub (MiniMax-AI/MiniMax-M3). Sono supportati framework come vLLM, SGLang, Transformers, KTransformers e unsloth. Esistono già quantizzazioni (tra cui MXFP8 e GGUF).
La licenza è MiniMax Community License: uso non commerciale libero; uso commerciale per aziende sotto una certa soglia di revenue richiede notifica e attribution; per revenue più alte è necessario un accordo commerciale.
Il paper tecnico su MSA è disponibile su arXiv (2606.13392).
Perché è rilevante
Per sviluppatori e team che costruiscono coding assistant, agent o workflow a lungo orizzonte, MiniMax-M3 offre una combinazione di capacità e costo di inferenza che fino a pochi mesi fa era riservata ai modelli chiusi più costosi. L'architettura MSA rende il context da 1M token effettivamente utilizzabile, non solo teorico.
I pesi sono pubblici. Si può testare localmente (con hardware adeguato) o tramite API e provider terzi.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




