MVP-Nav: Multi-layer Value Map Planner Navigator
MVP-Nav: 多层价值地图规划导航器
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。
高校专区
MVP-Nav: 多层价值地图规划导航器
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。
面向医学图像分割的体素间距一致性
机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医疗机器人研究院) ; Department of Ultrasound, Shanghai Chest Hospital(上海市胸科医院超声科) ; CAMPAR, Technical University of Munich(慕尼黑工业大学CAMPAR)
AI总结 提出Consispace框架,通过ODE约束和语义特征重加权实现轴向体素间距一致,提升重采样质量与下游分割性能。
Comments 12 pages, 6 figures
UniTacVLA:视觉语言动作模型中的统一触觉理解与预测
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Great Bay University(大湾区大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Daimon Robotics
AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。
PrISM-IQA:面向智能手机摄影的实用图像质量评估
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; School of Computer Science, Institute of AI, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院) ; OPPO Research Institute(OPPO研究院) ; School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)
AI总结 提出PrISM-IQA,将智能手机IQA重构为多问题有序诊断,预测每个ISP相关问题的严重等级,支持可操作的ISP调优。
哪些Token重要?基于相对惊讶指数的自适应Token选择用于RLVR
机构 * ModelScope Team(ModelScope团队) ; Alibaba Group(阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出相对惊讶指数(RSI)度量,通过自适应Token过滤方法RSI-S解决RLVR中高熵与低概率Token的矛盾,在AIME和AMC基准上提升avg@32准确率2-3个百分点。
Comments 13 pages, 4 figures
ACE: 跨智能体的可插拔自适应上下文弹性化器
机构 * Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出ACE模块,通过无损消息存储和自适应上下文编排,实现历史步骤信息的弹性化处理,在多种智能体框架中优于截断和摘要方法。
UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型
机构 * Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; University of Oxford(牛津大学) ; MIT(麻省理工学院) ; Shanghai Jiaotong University(上海交通大学) ; UNIX AI
AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。
Comments This paper has been accepted by ECCV 2026
重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。
Comments 22 pages, 3 figures, ECCV 2026 Conference
超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。
Comments 13 pages, 4 figures
CasaMaestro:用于房屋级3D重建的多视角全景图
机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)
AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。
Comments Accepted to ECCV2026
DSIP: 基于扩散模型的多智能体运动规划的无信号交叉口动态协调规划器
机构 * Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学全球未来技术学院) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Department of Electrical Engineering, The University of Texas at Arlington(德克萨斯大学阿灵顿分校电气工程系)
AI总结 提出DSIP框架,利用扩散模型生成多车连续轨迹优化,替代传统信号相位控制,在SUMO仿真中显著降低平均延误并提高平均速度。
Reflect-R1:长视频理解中基于证据驱动的自纠正反思
机构 * Tsinghua University(清华大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; University of California(加利福尼亚大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。
Comments 2026 ECCV