BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Summary

Model Architecture

<1st stage>

Frozen pre trained image encoder를 이용해서 representation을 얻고, Q-Former를 이용해 LLM에 전달

Untitled

Untitled

Untitled

Untitled