arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-01 至 2026-06-01 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2605.30248 2026-06-01 cs.CV 57%

GenClaw: Code-Driven Agentic Image Generation

GenClaw: 代码驱动的智能体图像生成

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08385 2026-06-01 eess.IV cs.CV 57%

Rectified flow-based prediction of post-treatment brain MRI from pre-radiotherapy priors for patients with glioma

基于整流流的胶质瘤患者放疗前先验信息治疗后脑MRI预测

Selena Huisman, Nordin Belkacemi, Vera C. Keil, Joost Verhoeff, Szabolcs David

机构 * Amsterdam UMC, Department of Radiation Oncology(阿姆斯特丹大学医学中心放射肿瘤科) Cancer Center Amsterdam, Imaging and Biomarkers(阿姆斯特丹癌症中心影像与生物标志物) Department of Radiology and Nuclear Medicine(放射科与核医学科) Amsterdam UMC, Vrije Universiteit Amsterdam, Amsterdam Neuroscience, Brain Imaging(阿姆斯特丹大学医学中心、阿姆斯特丹自由大学、阿姆斯特丹神经科学、脑成像)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出一种基于整流流的条件图像生成模型,利用放疗前MRI和剂量图预测治疗后任意时间点的脑MRI,实现快速推理并保持语义和视觉保真度。

Comments 10 pages, 6 figures, 1 supplementary table, added GitHub url, corrected figure captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31321 2026-06-01 cs.RO 50%

Surface Constraint Policy for Learning Surface-Constrained and Dynamically Feasible Robot Skills

表面约束策略:学习受表面约束且动态可行的机器人技能

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(智能制造装备与技术国家重点实验室,华中科技大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出表面约束策略(SCP),通过二维加权高斯核编码表面几何约束,结合扩散策略和基于相似性的动作映射生成动态可行的表面约束运动,解决了自由曲面约束下动作随机性和接触不稳定的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 19 篇

2605.25842 2026-06-01 cs.AI cs.CL 84%

MuCRASP: Multimodal Chain-of-thought Reasoning aware Structured Pruning

MuCRASP: 多模态思维链推理感知的结构化剪枝

Aritra Dutta, Somak Aditya

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。

Comments Preprint ver. 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 83%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 81%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26396 2026-06-01 cs.AI cs.CL cs.LG 81%

Advancing Creative Physical Intelligence in Large Multimodal Models

推进大型多模态模型中的创造性物理智能

Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Emre Can Acikgoz, Bingxuan Li, Kunlun Zhu, Jiateng Liu, Aditi Tiwari, Zhenhailong Wang, Xiusi Chen, Mahdi Namazifar, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。

Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31410 2026-06-01 cs.AI 79%

FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

FAM-Bench:面向条件感知的“食物即药物”推理的多模态基准

Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover, Tanvir Ibrahim, Wenyan Li, Tingting Zhang, Xiaomin Lin

机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Muma College of Business, University of South Florida(佛罗里达州立大学Muma商学院) Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 提出FAM-Bench多模态基准,包含2500个营养专家验证的实例,通过菜肴适宜性评估和比较分析两个任务,测试模型在特定健康状况下对食物选择的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30900 2026-06-01 cs.AI physics.app-ph 79%

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动力学基准测试

Ben Wang, Xiaogang Li, Ruochen Gao, Peiyao Xiao, Chengliang Xu, Zeyu Wang, Zichao Chen, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出BilliardPhys-Bench基准,通过合成台球环境评估多模态大语言模型在物理推理(碰撞、反弹、最终位置预测)上的能力,发现模型存在“静态偏差”且性能随模拟时间与场景复杂度下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 79%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31504 2026-06-01 cs.LG stat.ML 78%

When Are Multimodal Predictions Biologically Supported? A Diagnostic Evaluation Framework

何时多模态预测具有生物学支持?一个诊断性评估框架

Dylan Steiner, Gustavo Arango-Argoty, Gerald Sun, Etai Jacob

机构 * Oncology Data Science & AI, R&D(肿瘤数据科学与人工智能,研发)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出DECAT框架,通过五个零参考指标和规则决策,将多模态表示分类为四种诊断场景,以检测模型是否学到共享生物学、单模态生物学或虚假相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30658 2026-06-01 stat.ME 78%

Consistent Bayesian Local Spatial Feature Selection with Application to Spatial Multimodal Omics

一致贝叶斯局部空间特征选择及其在空间多模态组学中的应用

Kun Huang, Xiyu Peng, Huiyan Sang, Ligang Lu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对空间多模态组学中的高维回归问题,提出一种贝叶斯局部空间特征选择框架,通过随机域划分先验和局部特征选择先验实现域划分与特征选择的一致性理论,并开发高效的可逆跳跃MCMC算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12579 2026-06-01 cs.LG 78%

EEG-Based Multimodal Learning via Hyperbolic Mixture-of-Curvature Experts

基于EEG的多模态学习:曲率混合专家双曲空间方法

Runhe Zhou, Shanglin Li, Guanxiang Huang, Xinliang Zhou, Qibin Zhao, Motoaki Kawanabe, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) BIFOLD, Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) University of Cambridge, Cambridge, UK(剑桥大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出EEG-MoCE框架,通过可学习曲率的双曲空间为每个模态分配专家,并采用曲率感知融合策略,实现层次结构建模,在情绪识别、睡眠分期和认知评估任务上达到最优性能。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-06-01 cs.CV 77%

The Regularizing Power of Language-Training Deepfake Detectors

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-06-01 cs.CL cs.AI cs.CV cs.MM 70%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30983 2026-06-01 cs.CV 70%

Can BEV Perception Gracefully Degrade under Sensor Failures?

BEV感知能否在传感器故障下优雅降级?

Haifa Zhang, Yijing Wang, Haoyu Wang, Zheng Li, Zhiqiang Zuo

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System(天津智能无人群技术与系统重点实验室) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(系统控制与信息处理重点实验室,中华人民共和国教育部)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态BEV感知在传感器损坏时性能骤降的问题,提出Grace-BEV框架,通过主动可靠性评估和动态特征重校准实现优雅降级,在极端LiDAR故障下将mAP从0.0%恢复至34.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22971 2026-06-01 cs.AI 70%

SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy

SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试

Peiyao Xiao, Xiaogang Li, Xinyi Gao, Chengliang Xu, Ben Wang, Zichao Chen, Zeyu Wang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16682 2026-06-01 cs.CV 70%

SAW-Bench: Learning Situated Awareness in the Real World

SAW-Bench:在现实世界中学习情境感知

Chuhan Li, Rilyn Han, Joy Hsu, Yongyuan Liang, Rajiv Dhawan, Jiajun Wu, Ming-Hsuan Yang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Maryland, College Park(马里兰大学学院市分校) Amazon(亚马逊) University of California, Merced(加州大学默塞德分校)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30510 2026-06-01 cs.CV cs.AI 62%

A Novel Global Context-aware Deep Neural Network for Enhanced Brain Tumor Segmentation using Magnetic Resonance Images

一种新颖的全局上下文感知深度神经网络用于基于磁共振图像的增强脑肿瘤分割

Sourjya Mukherjee, Ananya Bhattacharjee, R. Murugan

机构 * National Institute of Technology Silchar(全国理工学院锡拉char分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出全局上下文感知的挤压激励残差UNet(GCSER-UNet),融合空间和通道注意力,在TCGA LGG和BraTS 2020数据集上取得优于现有技术的Dice分数。

Comments 11 pages, 9 figures, 6 tables. Submitted to arXiv cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31177 2026-06-01 cs.CV 57%

Vanilla ViT for Automotive Point Cloud Semantic Segmentation

用于汽车点云语义分割的普通ViT

Gilles Puy, Nermin Samet, Alexandre Boulch, Spyros Gidaris, Tuan-Hung VU, Renaud Marlet

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, IP Paris, France(LIGM、CNRS、Université Gustave Eiffel、ENPC、IP Paris、法国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VaViT,通过精心设计的标记器、轻量级解码器头和定制数据增强,使普通非分层ViT在大规模激光雷达点云语义分割中达到或超越现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28442 2026-06-01 cs.RO cs.CV 57%

Self-Supervised Online Robot-Agnostic Traversability Estimation for Open-World Environments

面向开放世界的自监督在线机器人无关可通行性估计

Julia Hindel, Simon Bultmann, Houman Masnavi, Daniele Cattaneo, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出COTRATE框架,通过自监督在线学习从多模态未标记机器人经验中估计可通行性,采用机器人无关的地形评估模块和多样性感知特征选择策略,实现跨平台知识迁移并降低遗忘。

Comments 14 pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30670 2026-06-01 cs.CY 50%

Reinforcement Learning for Special Education: Aligning LLM Tutors to Diverse Learners through Disability-Adaptive Training

特殊教育的强化学习:通过残疾适应性训练使LLM导师适应多样化学习者

Unggi Lee, Jihoi Na, Yeil Jeong, Haeun Park, Yeonju Jang

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出Special-R1框架,通过二维自适应系统提示和基于残疾特征的思维奖励,将强化学习扩展到特殊教育,显著提升对残疾学习者的适配性和帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 12 篇

2605.31075 2026-06-01 cs.CV 85%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30924 2026-06-01 cs.CL 81%

EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents

EMBGuard:为具身智能体安全规划构建危险感知护栏

Dongwook Choi, Taeyoon Kwon, Bogyung Jeong, Minju Kim, Yeonjun Hwang, Hyojun Kim, Byungchul Kim, Young Kyun Jang, Jinyoung Yeo

机构 * Independent Researcher(独立研究者) Department of Biomedical Engineering(生物医学工程系) the Department of Intelligent Precision Healthcare Convergence, Sungkyunkwan University(智能精准医疗融合系,全州大学) Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CL

AI总结 提出首个基于MLLM的具身安全护栏EMBGuard,通过解耦物理风险推理与智能体策略,评估(视觉观察,动作)对来识别危险配置并提供自然语言解释,同时构建训练数据集EMBHazard和基准测试EMBGuardTest,在紧凑模型尺寸下达到与专有MLLM竞争的性能并降低误报率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30639 2026-06-01 cs.CV cs.AI cs.RO 79%

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

PInVerify:面向主动实例验证的离线具身基准

Yuhang Jiang

机构 * University of Trento(特伦托大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。

Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31174 2026-06-01 cs.CV cs.LG 77%

Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning

任意场景检测:一种具有经验感知推理的目标检测智能体框架

Wenlun Zhang, Jun Yin, Kentaro Yoshioka

机构 * Keio University(Keio大学) Tsinghua University(清华大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出DetAS/DetAS-X智能体框架,利用多模态大语言模型自适应组合恢复模块和专用检测器,通过自进化经验积累实现经验感知推理,在六个基准上平均F1提升28.36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31096 2026-06-01 cs.CV 70%

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Independent Researcher(独立研究者) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29879 2026-06-01 cs.CV cs.RO 70%

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图

Luzhou Ge, Xiangyu Zhu, Jinyan Liu, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31041 2026-06-01 cs.CV cs.AI 62%

Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?

视觉信息在视觉-语言-动作模型驾驶行为中是否起决定性作用?

Jingtao He, Hongliang Lu, Xiaoyun Qiu, Yixuan Wang, Xinhu Zheng

机构 * Intelligent Transportation Thrust, The Hong Kong University of Science and Technology (Guangzhou)(科技与交通智能 thrust,香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化多级视觉扰动框架,系统分析VLA驾驶模型对视觉信息的依赖程度,揭示依赖模式随评估方式变化且在不同抽象层次上不均匀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30698 2026-06-01 cs.CV cs.AI cs.MA 62%

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏