arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2597 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 196 篇

2608.06688 2026-08-10 cs.RO 新提交 50%

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracer:基于VLA模型推理与轨迹残差自适应的跨 embodiments 导航

Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

机构 * Peng Cheng Laboratory(鹏城实验室) Southern University of Science and Technology(南方科技大学) Innovation Investment Research Institute(创新投资研究院) Soochow University(苏州大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本研究提出跨 embodiment 导航框架 CrossTracer,通过 VL-Tracer 和 CE-Adapter 优化轨迹,在 NaviTrace 基准得分 45.68,优于 Gemini-2.5-Pro,实际部署于轮式、腿式机器人效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05999 2026-08-07 cs.RO 新提交 50%

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

超越扁平策略:面向机器人操作具身智能体的分层后训练

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02497 2026-08-04 cs.RO 新提交 50%

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

面向视觉-语言-动作模型的鲁棒指令泛化的基础语义重绑定

Zhaokai Yin, Zhipeng Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 针对视觉-语言-动作模型因指令释义导致性能骤降的架构问题,提出GSR方法,在LIBERO-Para基准提升成功率44.6%,推出ParaVLA模型,规避低效数据扩展,实现鲁棒指令泛化。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01221 2026-08-04 cs.RO 新提交 50%

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型

Jinsong Lin, Zikang Pan, Wanhao Liu, Chi Kit Ng, Liangjing Shao, Zihang Yu, Ziyu Wang, Yin Wang, Jiaxi Wang, Jeremy Yuen-Chun Teoh, Zhiyong Xiong, Huxin Gao, Hongliang Ren

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00725 2026-08-04 cs.RO 新提交 50%

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26770 2026-07-30 cs.RO 新提交 50%

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成

Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16267 2026-07-21 cs.RO 新提交 50%

HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes

HyperDCM:用于跨场景连续机器人导航的双曲空间动态集群记忆回放

Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei

机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) School of Geospatial Information, Information Engineering University(信息工程大学地理空间信息学院) University of Shanghai for Science and Technology(上海理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 针对视觉导航持续学习难题,提出HyperDCM,通过场景图建模和记忆回放增强导航。利用视觉语言模型提取三元组,经R-GCN编码投影到双曲空间,采用动态聚类等策略。实验证明其在保留导航能力和泛化性上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15714 2026-07-20 cs.RO 新提交 50%

AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning

AC-VLA:通过组合学习实现稳健的分布外动作执行

Xiaojiang Peng, Kai Peng, Jie Lu, Zheng Lian, Zitong YU, Xiaobo Wang

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tongji University(同济大学) Great Bay University(大湾区大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究VLA模型在分布外泛化的问题,提出AC-VLA框架,含组合学习模块和状态条件不对称掩码策略,无需修改架构可集成到VLA主干,在LIBERO和LIBERO-OOD基准测试中,该框架在组合OOD任务上有显著改进,分布内性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15004 2026-07-17 cs.RO 新提交 50%

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12185 2026-07-15 cs.CL 新提交 50%

Entropy in Semantic Memory Navigation in Blind and Sighted Individuals: The Effect of Visual Experience

盲人与视力正常者语义记忆导航中的熵:视觉经验的影响

Felipe D. Toro-Hernández, Rodrigo Lagos, Sergio E. Chaigneau

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究通过属性列举任务及语义熵指标,对比盲人与视力正常者语义记忆导航差异,发现视力正常者抽象概念熵高于具体概念,盲人在视觉突出具体概念上熵更高,强调视觉经验对语义记忆组织和导航的作用。

Comments Cogsci paper 2026

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11427 2026-07-14 cs.RO 新提交 50%

EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation

EDAR:学习用于机器人操作的环境相关动作表示

Yuecheng Xu, Tong Yang, Jingkai Jia, Chi Zhang, Xuelong Li, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) TeleAI, China Telecom(中国电信天翼人工智能公司)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究针对机器人操作中动作表示难的问题,提出EDAR方法,将动作令牌与可执行控制结构和预期视觉后果关联,通过实验证明该方法能改善下游策略学习,突出环境相关动作表示的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09962 2026-07-14 cs.RO 新提交 50%

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 50%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 50%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27144 2026-06-26 cs.RO 新提交 50%

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23420 2026-06-23 cs.RO 新提交 50%

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

有目的的流动:潜在动作引导的流匹配策略用于机器人操作

Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工学院) LIRIS, UMR5205(LIRIS实验室,UMR5205)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出潜在动作引导流匹配(LAFM)框架,通过自适应先验分布库替代固定高斯分布,利用潜在动作模型选择结构对齐的初始化,解决流匹配策略中向量场纠缠问题,在真实机器人部署中成功率提升23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19897 2026-06-19 cs.RO 新提交 50%

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms

一对二执行:一种面向单臂智能体动作扩展至双臂的新框架

Youbin Yao, Nieqin Cao, Mingyan Li, Yan Ding, Fuqiang Gu, Chao Chen

机构 * Chongqing University(重庆大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Lumos Robotics

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 提出ExS2D层次化动作扩展框架,利用单臂监督实现双臂操作,通过时间优先关系提取、子任务引导动作映射和碰撞避免协调规划,在仿真中减少54.4%执行步骤并保持成功率。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13883 2026-06-15 cs.RO 新提交 50%

Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation

基于蒸馏视觉语言可靠性的引导扩散用于空中导航

Ivan Valuev, Iana Zhura, Valerii Serpiva, Didar Seyidov, Dzmitry Tsetserukou

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 提出一种可靠性感知的扩散规划器,通过蒸馏视觉语言模型生成场景级可靠性热图,引导去噪过程处理不可靠区域,显著降低无人机导航中的障碍物违反率并提高区域可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交 50%

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 50%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 50%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 246 篇

2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 92%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 92%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(title,abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16690 2026-08-18 cs.CV 新提交 91%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 91%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08126 2026-06-09 cs.CV 新提交 91%

One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

一石三鸟:面向多VLM选择、自适应与集成的自适应最优传输

Qiyu Xu, Zhanxuan Hu, Yu Duan, Yonghang Tai, Huafeng Li, Quanxue Gao, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Yunnan Normal University(云南师范大学) Xidian University(西安电子科技大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出无训练框架OSTB,通过自适应最优传输估计共识样本-类别结构,同时解决多VLM的模型选择、目标域自适应和预测集成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 90%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11024 2026-08-12 cs.CV 新提交 90%

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究

Yufei Zhang, Chenlu Zhan, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);InternVL(abstract,abstract_cn);VLM(abstract)

AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。

详情

展开后加载摘要…

URL PDF HTML 收藏