X Square Robot’s open-source (Apache-2.0) world action model (WALL series): event-grounded VLA pretraining, video and action prediction, Muon optimizer.
✓ Active✓ Public access⚖ Open sourceWorld ModelRobotics foundation modelVision-Language-Action model📁 WALL
Release date
29 May 2026
Access:DownloadDeployment:💻 Local📱 On-device
Overview
Access & deployment
Download
LocalOn-device
Weights: Open source
Key parameters
✓ Fine-tuning
📥 Input: text, image, video, robot state data
Robotics
Environment modelingSpatial predictionMotion planningEmbodied task planningRobot manipulation
Platforms
Technical specification
License
Apache-2.0
Hardware requirements
Open-source model deployed locally/on-device; training and inference require GPU acceleration.
Features:✓ Fine-tuning
Modalities
⬇ Input
textimagevideorobot_state_data
⬆ Output
videorobot_actionsmotion_trajectories
Capabilities and applications
Native model capabilities
World simulation
Model's ability to generate coherent, interactive simulations of physical environments — maintaining geometry, lighting, and physics during exploration.
Category: multimodal
Video generation
The model's ability to generate video clips from a text prompt, image or another video, with control over length, resolution and visual characteristics.
Category: video
Video understanding
The model's ability to analyse and interpret video content — recognising actions, motion, events and relationships between objects over time.
Category: video
Planning
Forming and executing action plans for complex tasks.
Category: planning
Multimodal understanding
Category: multimodal
Robotics
Environment modelingSpatial predictionMotion planningEmbodied task planningRobot manipulation
Technical architecture
Core Architecture
Model Form
Training Techniques
Deployment and security
☁ Available on platforms
