Optimizing Visual Demonstration Selection for MLLMs

Discover how Learning to Select Demonstrations (LSD) improves visual in-context learning in MLLMs, outperforming kNN in complex regression tasks.

Multimodal Annotation Framework for Broadcast TV Analytics

Explore a multimodal annotation framework enhancing broadcast TV analytics with AI models, improving content classification and audience engagement insight...

Edge Reliability Challenges in Compressed Vision-Language Models

Explore failure modes of compressed vision-language models under visual corruption and their impact on edge deployment reliability.

Chinese Handwriting Assessment Using Vision-Language Models

Leverage vision-language models for advanced Chinese handwriting assessment with multi-level feedback to improve learners' writing skills effectively.

Tiny-ViT: Efficient Potato Leaf Disease Detection Model

Discover Tiny-ViT, a compact Vision Transformer for accurate, fast, and explainable potato leaf disease classification to boost crop health and yield.

Popular

Subscribe