Cosa è cambiato con la versione 2.0
LingBot-World 2.0 (chiamato anche LingBot-World-Infinity) rappresenta un salto netto rispetto alla versione precedente. Mentre LingBot-World 1.0 riusciva a mantenere stabilità per alcuni minuti, la nuova release spinge l'orizzonte di interazione verso l'illimitato.
Il modello genera video interattivi a 720p e 60 frame al secondo con latenza di controllo sotto il secondo. In test di stress di 60 minuti continui non mostra drift di texture, collasso geometrico o perdita di coerenza scenica.
I quattro upgrade principali
-
Orizzonte di interazione non limitato Grazie a un paradigma di causal pretraining e al meccanismo MoBA (Mixture of Bidirectional and Autoregressive Attention), ogni frame dipende solo dal contesto passato e dall'input corrente. Questo elimina l'accumulo di errori tipico dei modelli video non causali.
-
Distillazione real-time Una versione distillata del modello 14B permette di raggiungere 720p/60fps con inferenza efficiente, inclusa una variante leggera da 1.3B utilizzabile su singola GPU.
-
Azioni e eventi molto più ricchi Oltre al controllo della camera e al movimento, il sistema supporta azioni semanticamente complesse: attacco, tiro con l'arco, lancio di spell, sparo. È possibile anche guidare eventi testuali (cambi di meteo, spawn di entità, modifiche ambientali).
-
Agentic harness nativo Due agenti collaborano in loop continuo:
- Pilot agent: pianifica ed esegue i comportamenti del personaggio.
- Director agent (basato su VLM): ragiona causalmente e propone/inserisce nuovi elementi ambientali.
Questo permette mondi che non solo rispondono all'utente, ma evolvono in modo autonomo e coerente.
Disponibilità e licenza
Il modello è open-source (CC BY-NC-SA 4.0). Pesi e codice di inferenza sono disponibili su Hugging Face e GitHub. Una versione interattiva è già provabile online sulla piattaforma Reactor. Una demo live ufficiale è prevista al WAIC 2026 di Shanghai.
Perché conta
Per la ricerca su embodied AI, simulazione robotica e generazione di dati sintetici interattivi, avere un world model open-source capace di sessioni di un'ora senza collasso apre possibilità concrete di training di policy, prototipazione di ambienti e sperimentazione multi-agente che prima erano riservate a sistemi chiusi.
Il paper tecnico completo è su arXiv (2607.07534).
Testo: assistito da AI · revisionato da Carlos H. P. Ross




