This research project investigates whether Vision-Language Models (VLMs) like CLIP/BLIP truly "understand" compositions or simply memorize patterns. It features a sophisticated diagnostic suite—including CKA, Concept Probing, and Negation Consistency—to quantify generalization gaps and visualize model attention via Grad-CAM.
nlp computer-vision deep-learning grad-cam pytorch representation-learning clip memorization vlm blip interpretability robustness generalization cka ai-research compositionality vision-language-models concept-probing
-
Updated
Mar 31, 2026 - Python