A 4B-class vision-language model from Alibaba's Qwen3.5-VL family, known primarily as the planning-layer backbone of PsiBot's Psi-R2.5 foundation model.
Access:DownloadDeployment:💻 Local☁ Cloud
Overview
Access & deployment
Download
LocalCloud
Weights: Open weights
Key parameters
📥 Input: text, image, video
Technical specification
Modalities
⬇ Input
textimagevideo
⬆ Output
textstructured_data
Capabilities and applications
Native model capabilities
Multimodal understanding
Category: multimodal
Image understanding
Analysing and interpreting the content of images.
Category: vision
Video understanding
The model's ability to analyse and interpret video content — recognising actions, motion, events and relationships between objects over time.
Category: video
Planning
Forming and executing action plans for complex tasks.
Category: planning
Instruction following
Precisely following instructions contained in the prompt: response format, length, style, constraints (e.g. 'reply in six words'). GPT-5.1 significantly improved this capability compared to GPT-5.
Category: language
Vision encoder
The model's ability to encode images and video frames into dense representations (embeddings), used for downstream tasks or as a backbone for vision-language models.
Category: vision
