UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Paper • 2608.27456 • Published 7 days ago • 110
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist Paper • 2608.13558 • Published 21 days ago • 92
HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning Paper • 2607.15255 • Published Jul 16 • 17
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist Paper • 2608.13558 • Published 21 days ago • 92
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist Paper • 2608.13558 • Published 21 days ago • 92
Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment Paper • 2604.19548 • Published Apr 21 • 16
Reasoning Implicit Sentiment with Chain-of-Thought Prompting Paper • 2305.11255 • Published May 18, 2023 • 2
CMNER: A Chinese Multimodal NER Dataset based on Social Media Paper • 2402.13693 • Published Feb 21, 2024
PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis Paper • 2408.09481 • Published Aug 18, 2024 • 1
LasUIE: Unifying Information Extraction with Latent Adaptive Structure-aware Generative Language Model Paper • 2304.06248 • Published Apr 13, 2023
NUS-Emo at SemEval-2024 Task 3: Instruction-Tuning LLM for Multimodal Emotion-Cause Analysis in Conversations Paper • 2501.17261 • Published Aug 22, 2024
On Path to Multimodal Generalist: General-Level and General-Bench Paper • 2505.04620 • Published May 7, 2025 • 84
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist Paper • 2511.08521 • Published Nov 11, 2025 • 39
FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents Paper • 2506.01520 • Published Jun 2, 2025