From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models
从像素到概念:利用基础模型构建丰富的3D语义场景图森林
David Oberacker, Meike Deitersen, Niklas Spielbauer, Tristan Schnell, Georg Heppner, Arne Roennau
机构
*
FZI Research Center for Information Technology(FZI信息技术研究中心)
;
Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(卡尔斯鲁厄理工学院机器智能与机器人实验室)
CommentsPeer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Ant Group(蚂蚁集团)
;
Zhejiang University(浙江大学)
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Beihang University(北京航空航天大学)
;
Fuzhou University(福州大学)
;
Muka Robotics(木卡机器人)
Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM
Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理
Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Linköping University(林雪平大学)
UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics
UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试
Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui
机构
*
University of Helsinki(赫尔辛基大学)
;
Zhongguancun Academy(中关村学院)
;
University of Oxford(牛津大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.AI
NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video
NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准
Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert, Edison Marrese-Taylor, Jianjun Zhao, Lei Ma
机构
*
The University of Tokyo(东京大学)
;
Kyushu University(九州大学)
;
Macau University of Science and Technology(澳门科技大学)
;
Infinimind Japan Inc.(Infinimind日本公司)
;
University of Alberta(阿尔伯塔大学)
I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
机构
*
Beijing Jiaotong University(北京交通大学)
;
HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团)
;
MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
机构
*
College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院)
;
School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
School of Automation, Southeast University(东南大学自动化学院)
;
Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架
Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR))
;
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Jilin University(吉林大学)
专题命中
视觉推理
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Manchester(曼彻斯特大学)
;
Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所)
;
China University of Geosciences(中国地质大学)
Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
AI2(艾伦人工智能研究所)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)