Introduzione
Nanbeige LLM Lab (BOSS Zhipin) ha rilasciato Nanbeige4.2-3B, un modello agentico open-source con soli 3 miliardi di parametri non-embedding (4B totali). Nonostante le dimensioni ridotte, supera modelli molto più grandi su una vasta gamma di benchmark agentici e di reasoning.
Architettura Looped Transformer
Il cuore del modello è l'architettura Looped Transformer. Dopo un passaggio bottom-to-top, gli hidden states vengono rinviati attraverso gli stessi layer Transformer. Questo riuso aumenta significativamente la capacità del modello senza incrementare il numero di parametri.
Il modello include anche miglioramenti architetturali come LoopSplit, mHC con depth attention e concatenated n-gram embeddings (già in fase di integrazione per le versioni future).
Training e dati
Il base model è stato addestrato da zero su 28 trilioni di token (in aumento rispetto ai 23T della generazione precedente), con un upsampling più aggressivo di dati di matematica, codice, STEM e Synthetic-QA.
Nella fase di post-training il focus è stato posto sul comportamento agentico:
- SFT con ambienti reali e sintesi su larga scala di ambienti, task e scaffold agentici
- filtraggio a livello di trajectory e di turn con test case e rubric
- RL che combina outcome rewards e process rewards per stabilizzare l'addestramento su un modello così compatto
Prestazioni
Su benchmark agentici e coding Nanbeige4.2-3B supera in modo consistente Qwen3.5-9B e Gemma4-12B:
- SWE-Bench Verified: 63.6 (vs 53.1 e 44.2)
- SWE-Bench Pro: 46.9 (vs 33.8 e 21.9)
- Terminal-Bench 2.0: 44.1
- Pinch-Bench-V2: 74.7
- GPQA-Diamond: 87.4
- GDPval rubrics: 74.3
- Claw-Gym: 65.0
- MCP-Atlas: 57.8
Anche sui task di reasoning matematico e scientifico il modello guida la categoria dei modelli di dimensioni comparabili.
Specifiche e disponibilità
- Parametri: 4B totali / 3B non-embedding
- Context: 262.144 token
- Lingue: inglese e cinese
- Licenza: Apache 2.0
- Modalità: thinking e non-thinking (con preserve_thinking configurabile)
- Tool-calling: formato XML consigliato, JSON supportato
- Inferenza: Transformers (trust_remote_code), SGLang, vLLM, Ollama, llama.cpp
Quando integrato con scaffold agentici come OpenClaw, il modello si comporta in modo efficace come personal assistant locale per task quotidiani, office e deep research.
Conclusioni
Nanbeige4.2-3B dimostra che, con un'architettura intelligente e un training recipe mirato, un modello da 3B può competere e superare modelli 3-4 volte più grandi sui task che contano davvero per gli agent. È uno dei rilasci più interessanti del 2026 per chi lavora con local AI e sistemi agentici.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




