arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2512.00814 2026-05-28 cs.CV

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06928 2026-05-28 cs.CV

IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction

IAR2:通过语义-细节关联令牌预测改进自回归视觉生成

Ran Yi, Teng Hu, Zihan Su, Jiangning Zhang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出IAR2框架,通过语义-细节关联双码本和分层预测机制,实现从粗到细的图像生成,在ImageNet上取得FID 1.50的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27186 2026-05-27 cs.CL

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

MAIGO: 通过历史清理的在线策略自蒸馏缓解对话丢失

Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Fuzhou University(福州大学) Tencent(腾讯)

AI总结 针对大语言模型在多轮对话中性能下降(对话丢失)的问题,提出MAIGO方法,通过在线策略自蒸馏和清理历史助手回复来减少自污染,无需验证器或推理时辅助,显著提升多轮对话准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27157 2026-05-27 cs.AI

Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs

检测不等于解决:检索增强型大语言模型中的监控控制差距

Zhe Yu, Wenpeng Xing, Chen Ye, Xuyang Teng, Bo Yang, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Hangzhou Dianzi University(杭州电子科技大学) National Fintech Evaluation Center(国家金融科技评估中心)

AI总结 本文通过多轮文档累积协议发现检索增强型大语言模型存在监控控制差距,即模型能识别矛盾证据但无法安全约束最终建议,并揭示其机制在于行动选择缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26977 2026-05-27 cs.LG math.OC

Convergence of Spectral Descent for Non-smooth Optimization

非光滑优化的谱下降收敛性

Yixuan Yang, Yuqing He, Song Li

机构 * School of Mathematical Sciences, Zhejiang University, Hangzhou, China(浙江大学数学科学学院,杭州,中国)

AI总结 研究Muon优化器的简化变体谱下降(SD)及其截断版本(TSD)在非光滑凸优化中的全局线性收敛性,并应用于鲁棒低秩矩阵恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-05-27 cs.CL cs.AI

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26879 2026-05-27 cs.CV

Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos

通过对齐单目视频中的高阶时间动态恢复自然人体运动

Dingkun Wei, Zehong Shen, Yan Xia, Georgios Pavlakos, Yujun Shen, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出HTD-Refine框架,利用PVA-Net估计的高阶时间动态(速度和加速度)优化全局轨迹,恢复自然人体运动。

Comments 13 pages, 6 figures. Accepted as an Oral presentation and Best Paper Candidate at CVPR 2026. Project page: https://zju3dv.github.io/htd-refine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26789 2026-05-27 cs.AI

Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning

组合崩溃:稳定的事实知识并不意味着组合推理

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Jie Chen, Hongzhi Wang, Xuyang Teng, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Hong Kong Baptist University(香港 Baptist大学) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 本文提出组合崩溃现象,即模型在稳定掌握原子事实的情况下仍无法将其组合成链式推理,并通过双门控协议分解后训练增益,揭示聚合指标掩盖的组合能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26781 2026-05-27 cs.AI cs.MM

LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?

LiveK12Bench: 大型多模态模型真的征服了高中水平的考试吗?

Xiaohan Wang, Mingze Yin, Yilin Zhao, Gang Liu, Dian Li

机构 * Tencent PCG(腾讯PCG) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出动态多学科基准LiveK12Bench,通过自动化流水线和新颖的模拟考试评估方案,揭示大型多模态模型在真实考试场景下性能显著下降,尤其对复杂视觉布局敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26778 2026-05-27 cs.AI

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

归因盲点:检测语言模型何时依赖记忆而非检索到的上下文

Zhe Yu, Wenpeng Xing, Yunzhao Wei, Bo Yang, Chen Ye, Gaolei Li, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) National Fintech Evaluation Center(国家金融科技评估中心) Hangzhou Dianzi University(杭州电子科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出计算现实监控(CRM)方法,通过比较有无上下文时的内部表征差异,检测语言模型是否依赖预训练记忆而非检索到的上下文进行生成,解决了输出级监控无法识别的归因盲点问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26754 2026-05-27 cs.CR cs.AI

Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control

Cordon-MAS:通过信息流控制防御 RAG 的知识投毒

Zhe Yu, Wenpeng Xing, Gaolei Li, Shuguang Xiong, Hongzhi Wang, Xuyang Teng, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang Lab(浙江实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Dianzi University(杭州电子科技大学)

AI总结 针对检索增强生成(RAG)中的 Confundo 式投毒攻击,提出 Cordon-MAS 框架,通过分离证据提取、跨源审计和答案合成到具有非对称内存权限的智能体中,将攻击成功率相对降低 92.4%,将投毒问题从检测重新定义为信息流控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26616 2026-05-27 cs.CV

Gaussian-Voxel Duet: A Dual-Scaffolding Hybrid Representation for Fast and Accurate Monocular Surface Reconstruction

高斯-体素二重奏:用于快速准确单目表面重建的双支架混合表示

Zhenhua Du, Zhen Tan, Haoyu Zhang, Dewen Hu, Shuaifeng Zhi, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) National University of Defense Technology(国防科技大学)

AI总结 提出一种混合高斯-体素表示,通过将锚定高斯约束在体素化SDF定义的表面窄带内,并引入隐式表面约束损失,在保持快速训练和实时渲染的同时,实现了高质量表面重建和新视图合成。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26525 2026-05-27 cs.CV cs.AI

ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation

ReCA: 通过递归上下文分配实现多镜头长视频外推

Akide Liu, Jinbo Xing, Chaojie Mao, Ye Li, Zeyu Zhang, Yefei He, Weijie Wang, Zihan Wang, Yu Liu, Gholamreza Haffari, Bohan Zhuang

机构 * Monash University(墨尔本大学) Tongyi Lab, Alibaba Group(通义实验室,阿里集团) Zhejiang University(浙江大学) University of Queensland(昆士兰大学)

AI总结 针对多镜头视频外推任务中上下文分配瓶颈,提出递归上下文分配框架,通过层次化分解和结构化状态传播提升长视频生成的一致性和质量。

Comments Project Page: https://reca.vmv.re , Code: https://github.com/ali-vilab/ReCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26503 2026-05-27 cs.CV

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

面向视觉-语言导航的不确定性感知高斯地图

Jianzhe Gao, Rui Liu, Yuxuan Xu, Tongtong Cao, Yingxue Zhang, Zhanguang Zhang, Sida Peng, Yi Yang, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Department of Foundation model, 2012 Labs, Huawei(基础模型部门,2012实验室,华为) Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为) School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 提出不确定性感知高斯地图,通过显式建模几何、语义和外观三种感知不确定性并融入观测空间,提升视觉-语言导航中智能体的决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26429 2026-05-27 stat.ME cs.AI cs.LG stat.ML

Structure-Adaptive Conformal Inference for Large-Scale Out-of-Distribution Testing

面向大规模分布外检测的结构自适应共形推断

Rongyi Sun, Wenguang Sun, Zinan Zhao

机构 * Center for Data Science and School of Mathematical Sciences, Zhejiang University(数据科学中心和数学科学学院,浙江大学)

AI总结 提出结构自适应共形q值(SCQ)和伪分数引导的直推式自动模型选择(P-TAMS),在成对可交换性下实现结构化分布外检测的有限样本错误率控制、功效提升和可解释性增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26380 2026-05-27 cs.CV cs.AI

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

VisualNeedle: 信息密集场景中的主动视觉搜索基准

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型在细粒度感知基准中依赖捷径而非真实视觉证据的问题,提出VisualNeedle基准,通过反事实裁剪-黑化设置评估模型在信息密集场景中的主动视觉搜索能力,实验表明最佳模型准确率仅56.01%,落后人类63.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26178 2026-05-27 cs.MA cs.LG

ATOM: Instantiating Budget-Controllable Multi-Agent Collaboration via Nucleus-Electron Hierarchy

ATOM: 通过核-电子层次结构实例化预算可控的多智能体协作

Xinkui Zhao, Sai Liu, Yifan Zhang, Qingyu Ma, Zewen Lin, Naibo Wang, Guanjie Cheng, Chang Liu, Yueshen Xu

机构 * Zhejiang University(浙江大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室) Xidian University(西安电子科技大学)

AI总结 提出ATOM框架,采用核-电子层次结构和任务驱动强化学习,生成预算可控的协作图,在保持性能的同时将token效率提升高达30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26175 2026-05-27 cs.LG cs.AI

InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

InfoQuant:为低比特LLM量化塑造激活分布

Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Ant Group(蚂蚁集团) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) Alibaba Cloud Computing(阿里云计算) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

AI总结 针对低比特激活量化中分布与量化器不匹配的问题,提出基于信息论的分析和无需训练的峰值抑制正交变换(PSOT)方法,显著提升量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26161 2026-05-27 cs.LG cs.AI

TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models

TSFMAudit: 时间序列基础模型中的数据污染审计

Hongkai Li, Shifeng Xie, Lefei Shen, Zhuo Li, Mouxiang Chen, Xiaobin Zhang, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) Télécom Paris(巴黎高等电信学院) State Street Technology (Zhejiang) Ltd.(State Street Technology(浙江)有限公司) Datadog

AI总结 针对时间序列基础模型(TSFMs)预训练数据污染问题,提出基于探针适应动力学的审计方法TSFMAudit,通过检测微调后损失下降更快且骨干网络移动更小的异常现象来识别污染数据集。

Comments 22 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26149 2026-05-27 cs.GR cs.CV

AnySurf: Any Surface Generation with Directed Edge

AnySurf: 基于有向边的任意表面生成

Wenda Shi, Chenyuan Pan, Dengming Zhang, Yiren Song, Biao Zhang, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Xi'an Jiaotong University(西安交通大学)

AI总结 提出AnySurf统一框架,通过有向边增强的柔性双网格表示,实现开放、封闭和混合3D表面的高质量生成,并引入ROS-FT后训练和轻量级DE-Adapter以保持生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25569 2026-05-27 cs.CV

ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement

ControlLight: 迈向可控、一致且泛化的低光照增强

Yufeng Yang, Jianzhuang Liu, Jisheng Chu, Yuqi Peng, Xianfang Zeng, Jiancheng Huang, Shifeng Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Zhejiang University(浙江大学)

AI总结 提出ControlLight框架,通过构建连续光照强度监督的大规模数据集和引入错位感知加权流匹配损失,实现了低光照增强的可控性、一致性和泛化性。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15572 2026-05-27 cs.CV

From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers

从逐图像低秩到编码不匹配:重新思考视觉Transformer中的特征蒸馏

Huiyuan Tian, Bonan Xu, Shijian Li

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文通过发现编码不匹配现象,提出Lift或WideLast两种简单修复方法,显著提升视觉Transformer特征蒸馏在压缩场景下的性能。

Comments 22 pages, 22 figures. Accepted at the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24764 2026-05-27 cs.CV

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19667 2026-05-27 cs.CL cs.AI cs.CV cs.LG cs.MA

Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language

Chat2Workflow: 用自然语言生成可执行可视化工作流的基准

Yi Zhong, Buqiang Xu, Yijun Wang, Zifei Shan, Shuofei Qiao, Guozhou Zheng, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 提出Chat2Workflow基准,用于评估大语言模型从自然语言生成可执行可视化工作流的能力,并设计了一个智能体基线以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14684 2026-05-27 cs.CV

DETR-ViP: Detection Transformer with Robust Discriminative Visual Prompts

DETR-ViP:具有鲁棒判别性视觉提示的检测Transformer

Bo Qian, Dahu Shi, Xing Wei

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室) CCAI, Zhejiang University(浙江大学计算机辅助设计与智能交互研究院) Hikrobot Co., Ltd.(海康威视有限公司)

AI总结 提出DETR-ViP框架,通过全局提示集成和视觉-文本提示关系蒸馏学习可区分视觉提示,并采用选择性融合策略实现鲁棒检测,在多个数据集上显著提升视觉提示检测性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08999 2026-05-27 cs.CL cs.AI cs.LG

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering

ASTRA: 面向复杂表格问答的自适应语义树推理架构

Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-05-27 cs.CV cs.AI

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏