Un parser documenti compatto da 0.8B parametri
Alibaba, attraverso il team ATH-MaaS, ha reso open-source OvisOCR2, un modello di document parsing end-to-end da soli 0.8B parametri.
L'obiettivo è semplice ma ambizioso: data un'immagine di pagina di documento, generare in un solo passaggio una rappresentazione Markdown completa e ordinata, che include testo, formule matematiche, tabelle e regioni visuali.
Architettura e training
OvisOCR2 nasce dal post-training di Qwen3.5-0.8B. Il processo di addestramento è articolato in più fasi:
- Supervised Fine-Tuning su un mix di dati reali e sintetici
- Reinforcement Learning su un ramo più grande da 4B con un sistema di reward multi-componente
- On-policy distillation dal modello 4B al modello 0.8B
- Model fusion finale
Il data engine combina annotazioni filtrate di documenti reali con pagine sintetiche generate a partire dallo stesso HTML, garantendo allineamento perfetto tra immagine e target Markdown.
Risultati
Su OmniDocBench v1.6 OvisOCR2 ottiene un overall score di 96.58, diventando il primo modello end-to-end a scalare la vetta di una classifica finora dominata da sistemi a pipeline (come PaddleOCR-VL e MinerU).
Su PureDocBench raggiunge il miglior Avg3 score di 75.06.
Anche su un benchmark interno progettato per scenari long-tail (manoscritti, tabelle complesse, documenti degradati) risulta il più robusto tra i modelli confrontati.
Disponibilità
Il modello è disponibile su Hugging Face sotto licenza Apache 2.0 e supporta inference con vLLM. Esiste anche uno Space demo ufficiale.
Per chi costruisce sistemi di RAG, archivi digitali o pipeline di estrazione automatica, OvisOCR2 rappresenta un punto di svolta concreto: prestazioni di alto livello con un footprint estremamente contenuto.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




