机构
*
Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA)
;
Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA)
;
West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA)
;
Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)
专题命中
视觉推理
:VLM(title_cn);vision-language model(abstract);vision language model(abstract);visual reasoning(abstract)
Comments14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068
TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs
TriViewBench: 多视图结构推理中受控复杂度缩放
Yu-Yang Chen, Lan-Zhe Guo
机构
*
School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
;
National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中
视觉推理
:visual reasoning(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
AI2(艾伦人工智能研究所)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)