arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-24 至 2026-07-24 共收录 41 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2607.21155 2026-07-24 cs.CV cs.AI 新提交 87%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21300 2026-07-24 cs.CV cs.AI 新提交 79%

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

不平衡下的遗忘:多模态大语言模型遗忘中的公平性基准测试

Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini, Davide Talon, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型遗忘中的公平性问题,提出FAIRGET基准和FAUN算法,通过模拟现实场景下不平衡的遗忘请求,在考虑数据不平衡性质时遗忘身份,实验证明该方法在遗忘质量和公平性上具有优越性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2607.21061 2026-07-24 cs.CV 新提交 91%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 79%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21552 2026-07-24 cs.AI cs.LG 新提交 73%

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 62%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21185 2026-07-24 cs.AI cs.LO 新提交 57%

Differentiable Logic Programming to Mitigate Reasoning Shortcuts in Neurosymbolic Systems

用于减轻神经符号系统中推理捷径的可微逻辑编程

Akihiro Takemura, Katsumi Inoue

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 研究神经符号系统易出现的推理捷径问题,提出基于矩阵的可微逻辑编程方法,通过统一编码规则和约束、连接模糊逻辑t-范数等减轻两种捷径类型,实验表明该方法能显著减少捷径,架构选择对减轻捷径起关键作用。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 29-51

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20868 2026-07-24 cs.CV 新提交 57%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 57%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 18 篇

2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交 88%

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21065 2026-07-24 cs.CV 新提交 85%

Do Pathology Vision-Language Models Truly See Pathology?

病理学视觉语言模型真的能‘看到’病理学吗?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract,abstract_cn);分类 cs.CV

AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20533 2026-07-24 cs.LG cs.AI 新提交 76%

Grounding Investor Views: Neural Predicates in the Black-Litterman Model

在布莱克-利特曼模型中锚定投资者观点:神经谓词

Marcos Florencio

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 研究在布莱克-利特曼模型下投资组合构建问题,提出用神经谓词作为观点生成机制,将结构化金融分析数据经其处理后映射到模型相关矩阵,方法可解释且完全可微,实现端到端学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 74%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.LG

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21574 2026-07-24 cs.CL 新提交 71%

Surprisal Theory is Tautological (without Rational Grounding)

惊奇理论是同义反复的(缺乏理性基础)

Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。

Comments Under "Review" at ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20889 2026-07-24 cs.CV 新提交 70%

Engine-Native Editable 3D World Reconstruction with Objects and Lighting

使用对象和光照进行引擎原生可编辑3D世界重建

Junhao Chen, Xinghao Chen, Henghaofan Zhang, Zihao Qiao, Saining Zhang, Yongzhi Li, Ruqi Huang, Sisi Li, Yimin Sheng, Jianyi Zhu, Hao Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究旨在实现引擎原生可编辑3D世界重建。核心方法是引入Lumera管道,基于Lumera-2K数据,用Lumera-Box和Lumera-Light解析相关元素并组装。主要贡献是确立参数化灯光目标,揭示多方面剩余瓶颈,且在检测等方面取得一定分数。

Comments 18 pages, 7 figures, Project Page: https://haidilao0328.github.io/Lumera/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20814 2026-07-24 cs.AI 新提交 70%

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

用指南引导的多模态语言模型增强可解释的心脏诊断

Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong

机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) FPT University(FPT大学) Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。

Comments 12 pages, 3 figures, accepted at CITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20691 2026-07-24 cs.CV cs.AI 新提交 62%

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

用于可靠乳腺超声诊断的空间基础概念瓶颈模型

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究乳腺超声诊断中概念瓶颈模型可信度受监督限制问题,提出空间基础概念瓶颈模型(SG-CBM),利用病变轮廓弱监督,通过导出特定区域训练概念图,经交叉验证等提升诊断指标与概念证据空间对齐,强调数据质量监督设计及可信度验证的必要。

Comments Accepted to the Workshop on Data Quality Aware, High-Performance, and Trustworthy AI Systems for Healthcare at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 62%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21327 2026-07-24 cs.DL cs.AI 新提交 57%

From Static Bibliometrics to Dynamic Knowledge Graphs: An LLM-Powered Framework for Modernizing Science, Technology, and Innovation (STI) Analytics

从静态文献计量学到动态知识图谱:一个由大语言模型驱动的框架,用于实现科学、技术与创新(STI)分析的现代化

Muhsen Hammoud

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对文献计量指标的问题,提出由大语言模型驱动、整合多种传统的混合框架,经五层架构实现,将LLMs作为候选生成器,通过多阶段验证,支持多种分析,贡献了验证中介原则并讨论治理考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21199 2026-07-24 cs.LO cs.AI 新提交 57%

Towards a Certifying Grounder

迈向一个可验证的基础器

Daimy Van Caudenberg, Alexander Ek, Carlos Cantero, Bart Bogaerts

机构 * KU Leuven, Leuven, Belgium ARC Training Centre OPTIMA, Melbourne, Australia(比利时列日大学 澳大利亚OPTIMA培训中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究为一阶逻辑模型扩展引入可验证基础化框架CertiFOX,含证明格式、基础器GroundFOX和证明检查器CheckFOX,弥合用户规范与求解器输入的信任差距,保证输出与输入等价,实验表明该方法可行。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 309-324

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21007 2026-07-24 cs.CV 新提交 57%

Explainable Deepfake Detection Challenge

可解释的深度伪造检测挑战

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Usman Tariq, Jianfei Cai, Abhinav Dhall

机构 * Monash University(莫纳什大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Queensland(昆士兰大学) American University of Sharjah(沙迦美国大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ACM多媒体2026年可解释深度伪造检测挑战基于XPlainVerse基准测试,评估图像分类及解释生成方法。参与者为图像提交真假标签与两种解释,评估结合多种指标,其成果将助力下一代可解释深度伪造检测器发展。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20780 2026-07-24 cs.CV 新提交 57%

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness

重新思考开放世界视频异常检测:诊断定义盲目性

Inpyo Song, Jangwon Lee

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 研究开放世界视频异常检测中定义盲目性问题,分解动态定义评估,引入三个定义条件评估指标及DeCoS,指出OWVAD应按定义条件异常评分评估,改进了多个基线模型的定义跟随能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20675 2026-07-24 cs.LG cs.NI 新提交 57%

Explanation-Based Runtime Verification for Trustworthy ML-driven Optical Networks

基于解释的运行时验证用于可信的机器学习驱动的光网络

Omran Ayoub, Carlos Natalino, Ali Al Housseini, Felix Foschum, Philipp Morger, Tiziano Leidi, David Hock, Paolo Monti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。

Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-07-24 cs.AI cs.CL 新提交 57%

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 57%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交 50%

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 4 篇

2607.21400 2026-07-24 cs.RO cs.AI 新提交 81%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 62%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20926 2026-07-24 cs.AI 新提交 57%

SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration

SciExplore:评估从科学导航到信息整合的自主智能体

Yinhao Tang, Youqing Fang, Yanan Sun, Wenran Liu, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型和智能体科学信息检索与推理能力的基准SciExplore,包含四类任务,在其上评估多个先进模型和智能体,发现随着任务复杂度增加性能差距大,凸显当前模型在实际科学信息检索场景中的局限。

Comments 25 pages, 13 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏