Motion Prediction, Generative Model, Diffusion Model, Latent Diffusion Space.
Scene Graph Generation, Large Vision-Language Model, Image Caption, Visual Context Parsing, Instruction Tuning
Video anomaly detection, Self-supervised learning, Pretext task