Summary
- LLM과 pre-trained image encoder를 함께 사용하고자 하는 시도들
- LLM이 학습 과정에서 이미지 정보를 받기 위해서는, image & text 데이터를 align하는 단계가 선행되어야 함
- BLIP-2는 frozen image encoder와 LLM을 연결하는 방식, Q-former를 제시함
- frozen된 모델을 가져옴으로서 파라미터 효율을 향상시키고, LLM의 representation learning을 활용해 다양한 VL task에서 SOTA 달성
- Encoder에 frozen Pretrained Model을 도입하고, 그로 인한 Modality gap은 Q-former를 통해 해결
Model Architecture
<1st stage>
Frozen pre trained image encoder를 이용해서 representation을 얻고, Q-Former를 이용해 LLM에 전달



- 실험에서는 각 쿼리의 차원이 q former의 hidden dimenstion과 동일하게 768차원 *32 쿼리
- 출력 쿼리 z의 크기는 32*768은 기존 frozen된 이미지 feature 크기보다 훨씬 작음
- bottlenech architecture는 pretraining object와 함께 작용하여 query가 text와 가장 관련성 높은 visual feature를 추출하도록 강제함
