Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
Paper • 2609.09143 • Published • 17
Robotics, deep learning, navigation, perception
Studying Image Tokenizers as Visual Languages in Unified Multimodal Models
Autoregressive Image Generation with Masked Bit Modeling