arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23997 2026-06-24 cs.IR 新提交 50%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22337 2026-06-24 econ.TH cs.GT econ.GN q-fin.EC 新提交 50%

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

理论家工具箱:基于智能体的LLM辅助经济理论研究工具

Moran Koren

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05161 2026-06-23 cs.CV 版本更新 50%

Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging

基于VLM的医学图像分布外检测的Wasserstein对齐定位

Bernhard Kainz, Johanna P Mueller, Matthew Baugh, Cosmin Bercea

机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算机系) Technical University Munich, DE(慕尼黑技术大学) Munich Center for Machine Learning (MCML), DE(慕尼黑机器学习中心(MCML))

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出WALDO框架,利用最优传输理论通过熵加权切片Wasserstein距离、Goldilocks区域采样和自一致性聚合实现零样本异常定位,在NOVA脑MRI基准上mAP@30达43.5%,相对提升19%。

Comments submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05613 2026-06-23 cond-mat.mtrl-sci 版本更新 50%

New Crystal Structures Hide in Plain Sight: A Stress Test for AI-Guided Materials Discovery

新晶体结构隐藏于眼前:AI引导材料发现的压力测试

Xin Zhang, Scott B. Lee, Sudipta Chatterjee, Hanqi Pi, Yi Jiang, Fatmagül Katmer, Emily G. Ward, Daniel E. Widdowson, Charles C. Tam, Sarah Schwarz, Connor J. Pollak, Jaime M. Moya, Grigorii Skorupskii, Vitaliy A. Kurlin, Stephen D. Wilson, B. Andrei Bernevig, Leslie M. Schoop

专题命中 测试时计算 :reasoning(abstract)

AI总结 通过实验合成发现GdNiSn4和LuNiSn4具有前所未有的结构类型,并以此测试两种生成式AI模型,发现它们无法在容忍度内重现该结构,表明编码化学推理(如已知基元堆叠)是AI发现结构新颖材料的具体路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19684 2026-06-19 cs.CV 新提交 50%

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

探索多模态大语言模型与两阶段微调在时尚图像检索中的应用

Nguyen Cao Hoang, Hoang Bui Le, Nam Vo Hoang, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) Vietnam National University, Ho Chi Minh(胡志明市国家大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 50%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 测试时计算 :verifier(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17669 2026-06-17 cs.SD 新提交 50%

DeSRPA: Decoupled Speech Role-Playing Agent via Inference-Time Intervention

DeSRPA: 通过推理时干预的解耦语音角色扮演智能体

Wenqiu Tang, Zhen Wan, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学) National Institute of Informatics(国立情报学研究所)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18121 2026-06-17 cs.MA cs.IT math.IT 新提交 50%

On the Reliability of Networks of AI Agents: Density Evolution, Stopping Sets, and Architecture Optimization

AI代理网络的可靠性:密度演化、停止集与架构优化

Ehsan Aghazadeh, Hossein Pishro-Nik

专题命中 测试时计算 :verifier(abstract)

AI总结 将多代理AI系统建模为稀疏图上的消息传递,扩展LDPC编码的密度演化理论,分析三种擦除失效模式,并证明密度演化定理以预测未解决子声明的渐近比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25886 2026-06-17 cs.MM 版本更新 50%

MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding

MarkIt: 免训练视觉标记用于精确视频时间定位

Pengcheng Fang, Yuxia Chen, Xiaohao Cai

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14723 2026-06-16 cs.CV 新提交 50%

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering

基于分歧的跨模型路由用于隐式视频问答

Durga Sandeep Saluru

机构 * Independent Researcher(独立研究员)

专题命中 测试时计算 :reasoning(abstract)

AI总结 针对隐式视频问答中单模型精度瓶颈和自一致性策略失效问题,提出无标签无训练的分歧驱动跨模型路由方法,将分歧样本路由至第二模型,在ImplicitQA基准上提升平均准确率1.43%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14700 2026-06-15 cs.CV 新提交 50%

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

RepFusion:利用多模态先验在表示空间中进行去噪

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

机构 * Meta AI New York University(纽约大学)

专题命中 测试时计算 :test-time compute(abstract)

AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。

Comments Project Page: https://xichenpan.com/repfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13438 2026-06-12 cs.IR 新提交 50%

CQC-RAG: Robust Retrieval-Augmented Generation via Cross-Query Consistency

CQC-RAG: 通过跨查询一致性实现鲁棒的检索增强生成

Yanjia Sun, Sifan Liu, Jie Shao

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出CQC-RAG框架,通过生成语义等价但句法多样的查询,并基于跨查询一致性评估答案置信度稳定性,有效过滤噪声诱导的幻觉,在开放域问答任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25787 2026-06-12 cs.CV 版本更新 50%

Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking

自进化视觉语言模型用于图像质量评估:基于投票与排序

Wen Wen, Tianwu Zhi, Kanglong Fan, Yang Li, Xinge Peng, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出EvoQuality框架,通过自一致性生成伪标签,利用群体相对策略优化迭代提升VLM的图像质量感知能力,无监督下在多个IQA基准上超越监督方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21561 2026-06-12 cs.CV 版本更新 50%

Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning

通过逐步偏好调优的多模态智能体迭代工具使用探索

Pengxiang Li, Zhi Gao, Bofei Zhang, Yapeng Mi, Xiaojian Ma, Chenrui Shi, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出SPORT方法,通过任务合成、步骤采样、步骤验证和偏好调优的迭代循环,使多模态智能体无需预收集数据即可自主探索和优化工具使用策略,在GTA和GAIA基准上分别提升6.41%和3.64%。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10724 2026-06-10 cs.CR 新提交 50%

Fingerprinting All AI Cluster I/O Without Mutually Trusted Processors

无需互信处理器的所有AI集群I/O指纹识别

Naci Cankaya, Jakub Kryś, Jonathan Ng, Luke Marks, Felix Krückel

专题命中 测试时计算 :verifier(abstract)

AI总结 提出一种通过网络分流器计算哈希来加密承诺进出数据中心所有信息的方法,并设计“安全网关设备”消除隐蔽信道,以实现对AI集群I/O的可验证审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24583 2026-06-09 cs.CV 50%

Improving Vision-language Models with Perception-centric Process Reward Models

通过以感知为中心的过程奖励模型改进视觉-语言模型

Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Bytedance(字节跳动) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出Perceval模型,通过token级错误定位提升视觉-语言模型的推理能力,通过感知驱动的监督策略实现细粒度训练与推理优化,实验显示在多个领域基准上显著提升性能。

Comments 8 pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 33099-33109

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 50%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM 50%

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19893 2026-05-21 cs.OS 50%

SSV: Sparse Speculative Verification for Efficient LLM Inference

SSV:用于高效LLM推理的稀疏推测验证

Zhibin Wang, Ziyu Zhong, Nuo Shen, Yuhang Zhou, Rong Gu, Sheng Zhong

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出SSV框架,通过结合重叠感知的分组查询执行、基于刷新/重用的NSA内核融合和基于性能配置文件的提示自适应调度,提升跨查询重用率,减少所选索引和分支融合开销,并在用户指定的精度类别下选择有效的草稿验证策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20312 2026-05-21 cs.CR cs.LO cs.MA 50%

Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks

Pramana:自主代理网络中声明验证的协议层处理

Ravi Kiran Kadaboina

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出Pramana协议层,通过定义缺失的线缆格式,为自主代理网络中的声明验证提供结构化方法,结合经典印度认识论中的四种知识类型,确保验证过程的确定性和可追溯性。

Comments 23 pages, 4 figures, 5 tables, 42 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18311 2026-05-19 cs.HC 50%

Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?

LLM模拟偏好中的扭曲视角:AI是否能误导设计?

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 测试时计算 :reasoning(abstract)

AI总结 本研究探讨了LLM驱动的模拟方法所表达的设计偏好与真实用户偏好的一致性,发现LLM模拟在多个操纵下均存在系统性差异,其合成解释缺乏真实深度和细微差别,主要通过关注通用属性、特定元素、详述和过度赞扬等模式来替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21698 2026-05-18 cs.CV 50%

Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging

通过查询驱动专家桥梁适应基础视觉-语言模型用于医学诊断

Yitong Li, Morteza Ghahremani, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Technical University of Munich (TUM)(医学影像人工智能实验室,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MedBridge框架,通过结合领域对齐、分辨率保持和多标签推理的互补VLM专家,解决医学影像诊断中的领域差距问题,实现跨领域泛化和领域内特化,提升多标签胸腔疾病诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV 50%

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11664 2026-05-13 cs.CR 50%

Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis

安全上下文注入:通过静态过滤和代理分析实现推理时的安全对齐

Zhenhao Xu, Wenhan Chang, Yichuan Chen, Yuxin Fang, Junhao Liu, Tianqing Zhu

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出Safety Context Injection框架,通过静态过滤和代理分析在推理阶段提升模型安全性,减少攻击成功率和毒性。

Comments 17pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 50%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09203 2026-05-12 cs.CR 50%

Removing the Watermark Is Not Enough: Forensic Stealth in Generative-AI Watermark Removal

去除水印并不足够:生成式AI水印去除的取证隐秘性

Yevin Nikhel Goonatilake, Giuseppe Ateniese

专题命中 测试时计算 :verifier(abstract)

AI总结 研究指出当前水印去除方法无法同时满足水印逃避、图像实用性保持和取证隐秘性,需重新设计评估标准。

Comments 17 pages, 12 pages main text plus 5 pages appendix, includes figures and tables; under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 测试时计算 :verifier(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00663 2026-05-11 cs.RO cs.CV 50%

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06847 2026-05-08 cs.SE 50%

Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes

代理AI中的故障特征化:故障类型、症状和根本原因的分类

Mehil B Shah, Mohammad Mehdi Morovati, Mohammad Masudur Rahman, Foutse Khomh

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文通过实证研究,提出代理AI系统故障的分类体系,涵盖34种故障类型,揭示其在结构化输出解释、工具调用、运行时执行和异常处理中的表现,以及数据模式不匹配、依赖漂移等根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏