multimodal
972 个项目 · ⭐ 708.2k[ICLR 2026] VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
Implementation of "PaLM-E: An Embodied Multimodal Language Model"
(NeurIPS D&B 2024) STaRK: Benchmarking LLM Retrieval on Textual and Relational Knowledge Bases
Fusing Histology and Genomics via Deep Learning - IEEE TMI
Easily convert common crawl to a dataset of caption and document. Image/text Audio/text Video/text, ...
HPT - Open Multimodal LLMs from HyperGAI
Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Pre-training Dataset and Benchmarks
Pixel-Level Reasoning Model trained with RL [NeuIPS25]
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
Multi-Agent System Powered by LLMs for End-to-end Multimodal ML Automation
Seamlessly integrate state-of-the-art transformer models into robotics stacks
[ICLR'24] Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
共 972 条 · 第 11 / 49 页