Image generation and editing model from Alibaba's Qwen family. Lightweight Single-Stream DiT architecture (~7B) with text-to-image, reference-based editing and native RGBA transparency.
Parameters
~7B (komponent generacji wizualnej)
parameters
Access:DownloadDeployment:💻 Local☁ Cloud
Overview
Access & deployment
Download
LocalCloud
Weights: Open weights
Key parameters
🧩 Parameters: ~7B (komponent generacji wizualnej)
📥 Input: text, image
Technical specification
Parameters
~7B (komponent generacji wizualnej)
parameters
License
Qwen Research License
Hardware requirements
Requires a GPU with enough memory for a ~7B-class diffusion model; exact requirements depend on resolution and mode (generation vs editing).
Modalities
⬇ Input
textimage
⬆ Output
image
Capabilities and applications
Native model capabilities
Text-to-image generation
A model's ability to create images from a text description (prompt), including control of style, composition, aspect ratio and rendering text within the image.
Category: vision
Image editing
Modifying an existing image based on a text instruction or direct annotations: removing objects, changing style, adding elements, filling in regions (inpainting/outpainting), while preserving the identity of people and scene coherence.
Category: vision
Technical architecture
Core Architecture
