Microsoft Research AI Frontiers ha reso pubblici i pesi di Fara1.5-27B, il modello più grande della famiglia di computer use agent progettati per interagire con il browser in modo nativo. Il modello, basato su Qwen3.5-27B, osserva le pagine web esclusivamente attraverso screenshot e genera azioni strutturate (click, type, scroll, visit_url, web_search e altre) per completare task end-to-end.
A differenza di molti sistemi che si affidano al DOM o all'albero di accessibilità, Fara1.5-27B lavora in modalità vision-only. Riceve l'obiettivo dell'utente, gli screenshot più recenti e la storia delle azioni precedenti, poi produce un blocco di ragionamento seguito da una tool call in formato XML. Il contesto supportato arriva a 262.144 token, sufficiente per traiettorie lunghe.
Risultati sui benchmark
I risultati sui benchmark pubblici sono rilevanti. Su Online-Mind2Web (300 task su 136 siti) Fara1.5-27B ottiene il 72,3% di successo. Su WebVoyager raggiunge l'89,3%. Questi numeri superano OpenAI Operator (58,3% e 87,0%) e Gemini 2.5 Computer Use (57,3% su Online-Mind2Web). Anche la variante da 9B della stessa famiglia risulta competitiva con sistemi proprietari molto più grandi.
Architettura e training
La famiglia completa comprende tre scale: 4B, 9B e 27B. Il training è stato effettuato con supervised fine-tuning su traiettorie generate da FaraGen1.5, un pipeline multi-agente che sintetizza task, esegue le soluzioni e le verifica. I dati includono ambienti sintetici per siti autenticati e azioni irreversibili, oltre a dataset di grounding, VQA e safety. Il training del 27B ha richiesto 64 GPU NVIDIA B200 per sei giorni.
Fara1.5 è co-progettato per MagenticLite, l'applicazione agentica di Microsoft che fornisce sandboxing, allow-list, modalità di supervisione e possibilità di interrompere l'agente in qualsiasi momento. L'uso consigliato è proprio all'interno di questo harness o del repository ufficiale microsoft/fara.
Come funziona l'agente
Il ciclo è observe-think-act. L'utente fornisce un goal testuale. Il modello riceve gli ultimi tre screenshot e la storia delle azioni. Produce un pensiero e un'azione atomica (coordinate pixel per i click, stringhe per la digitazione, comandi di navigazione). Il browser sandboxed esegue l'azione e restituisce un nuovo screenshot. Il loop continua fino al comando terminate o a una richiesta di intervento umano.
Posizionamento rispetto agli altri modelli
La tabella dei risultati mostra un chiaro scaling positivo all'interno della famiglia. Passare da 4B a 27B porta +14,7 punti su Online-Mind2Web. Il 9B cattura già gran parte del guadagno e rappresenta il punto di equilibrio consigliato per molti casi d'uso. Il 27B chiude ulteriormente il gap con i sistemi frontier proprietari.
Limiti dichiarati
Training solo in inglese, rischio di errore cumulativo nelle traiettorie multi-step, possibile allucinazione dello stato della pagina e sensibilità a rendering ambigui o prompt injection visuali. Il modello non è pensato per domini ad alto rischio (legale, sanitario, finanziario) né per deploy non sandboxed.
Disponibilità
I pesi sono disponibili su Hugging Face sotto licenza MIT, insieme alle varianti 4B e 9B. Il codice e gli script di valutazione si trovano sul repository GitHub ufficiale. Il paper tecnico "Fara-1.5: Scalable Learning Environments for Computer Use Agents" è pubblico su arXiv. I modelli sono scaricabili da Hugging Face e deployabili via Microsoft Foundry. Per esperimenti locali, le raccomandazioni hardware indicano GPU di classe A100/H100/B200, preferibilmente in multi-GPU con vLLM e precisione bfloat16.
Fara1.5-27B non risolve tutti i problemi del computer use, ma sposta in avanti il confine di ciò che è possibile con modelli aperti e di dimensioni ragionevoli. È un segnale chiaro sulla direzione che Microsoft Research sta prendendo: agent capaci, ispezionabili e sotto controllo dell'utente.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




