video-understanding
23 个项目 · ⭐ 18.9kOpenMMLab's Next Generation Video Understanding Toolbox and Benchmark
One-for-All Multimodal Evaluation Toolkit Across Text, Image, Video, and Audio Tasks
[ECCV2024] Video Foundation Models & Data for Multimodal Understanding
NVIDIA AI Blueprint for video search and summarization (VSS) is a GPU-accelerated reference architecture for building video analytics agents with real-time verified alerts, visual Q&A, and automated reporting. The VSS Blueprint uses vision language models (VLMs) such as NVIDIA Cosmos, LLMs such as NVIDIA Nemotron, RAG, and NVIDIA NIMs.
[ICLR 2025] AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
[ICLR 2026] DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
[CVPR 2026 Highlight] WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
[NeurIPS 2025] Deep Memory Backtracking for Long Video Understanding
Graph Distillation for Action Detection
ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
Code for LifelongMemory: Leveraging LLMs for Answering Queries in Long-form Egocentric Videos
共 23 条 · 第 1 / 2 页