appearance-pointers-multimodal-region-control-of-diffusion-transformers-d18d57a5·1 events·first seen Aliases: Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
Researchers introduce 'appearance pointers,' compact tokens that enable precise regional control in Diffusion Transformers (DiTs) by aligning text or image inputs with user-specified spatial masks. A region correspondence network produces these tokens, refined via spatial aggregation, allowing multi-region guidance without retraining the base model or significantly increasing token load. The method claims to be the first modality-agnostic interface for localized multimodal control in DiTs, matching or surpassing modality-specific state-of-the-art methods across evaluated metrics.