research
∙
09/09/2021
Vision-and-Language or Vision-for-Language? On Cross-Modal Influence in Multimodal Transformers
Pretrained vision-and-language BERTs aim to learn representations that c...
research
∙
05/02/2016