arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 35 篇

2406.13724 2026-05-11 cs.AI 57%

Heterogeneous Graph Neural Networks with Post-hoc Explanations for Multi-modal and Explainable Land Use Inference

异构图神经网络与事后解释方法用于多模态和可解释的土地利用推断

Xuehao Zhai, Junqi Jiang, Adam Dejl, Antonio Rago, Fangce Guo, Francesca Toni, Aruna Sivakumar

机构 * Imperial College London, Department of Civil and Environmental Engineering(帝国理工学院伦敦校区土木与环境工程系) Imperial College London, Department of Computing(帝国理工学院伦敦校区计算机系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种结合异构图神经网络与可解释AI的方法,用于多模态土地利用推断,提升了准确性和可解释性,尤其在办公和生活用地方面表现突出。

Journal ref Information Fusion, Volume 120, 103057. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07301 2026-05-11 cs.AI 57%

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

基于结构因果模型的对手建模:通过结构因果模型实现基于大语言模型的智能体

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Beijing China National Key Laboratory of Cognition Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences Beijing China Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences Institute of Automation, Chinese Academy of Sciences

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SOM框架,通过结构因果模型明确分离对手建模与预测,提升多智能体环境中的预测准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL 57%

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07110 2026-05-11 cs.CL cs.SE 57%

Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

保障计算机使用代理:一种面向部署的架构-生命周期框架用于可靠性

Zejian Chen, Zhanyuan Liu, Chaozhuo Li, Mengxiang Han, Songyang Liu, Litian Zhang, Feng Gao, Yiming Hei, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology, Artificial Intelligence Institute(信息与通信技术研究院,人工智能研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出一种面向部署的架构-生命周期框架,用于提升计算机使用代理的可靠性,通过分析感知、决策和执行层,以及创建、部署、操作和维护阶段,解决能力形成、授权暴露、故障表现和控制放置之间的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 57%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08256 2026-05-11 cs.CL 57%

NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Rating

NCL-UoR在SemEval-2026任务5中的表现:基于嵌入的方法、微调与大语言模型用于词义可plausibility评分

Tong Wu, Thanet Markchom, Huizhi Liang

机构 * Independent Researcher(独立研究者) Department of Computer Science, University of Reading(阅读大学计算机科学系) School of Computing, Newcastle University(新castle大学计算学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较了三种方法:基于嵌入的方法、Transformer微调和大语言模型提示,发现结构化提示优于微调和嵌入方法,提示设计比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12852 2026-05-11 cs.AI 57%

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning

WebClipper: 基于图的轨迹修剪高效进化网络代理

Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WebClipper框架,通过图基修剪压缩网络代理轨迹,减少20%的工具调用次数并提升准确性,引入F-AE Score指标平衡精度与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 57%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 57%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07957 2026-05-11 cs.SE 50%

Similar Pattern Annotation via Retrieval Knowledge for LLM-Based Test Code Fault Localization

通过检索知识实现相似模式注释的LLM基于测试代码故障定位

Golnaz Gharachorlu, Mahsa Panahandeh, Lionel C. Briand, Ruifeng Gao, Ruiyuan Wan

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出SPARK框架,通过整合CI环境积累的调试知识,提升LLM在测试代码故障定位中的效率,实验表明其在复杂测试用例中能更准确识别故障位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07789 2026-05-11 cs.HC 50%

Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design

分析日常决策对话中的人类启发式与策略以指导对话AI设计

Sora Kang, Soyun Jeon, Jinsu Eun, Kwangwon Lee, Chaerin Song, Minyoung Joo, Joonhwan Lee

专题命中 规划推理 :reasoning(abstract)

AI总结 本文通过分析955个真实韩国对话,揭示人们在决策中优先满足而非优化,发现启发式策略在探索阶段维持对话流畅,而规则策略在利用阶段有效推动解决,为对话AI设计提供认知理论支持。

Comments CogSci 2026 (Annual Meeting of the Cognitive Science Society 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07320 2026-05-11 cs.HC 50%

Splitting User Stories Into Tasks with AI -- A Foe or an Ally?

用AI拆分用户故事——敌人还是盟友?

Luka Pavlič, Reinhard Bernsteiner, Stephan Schlögl, Christian Ploder

专题命中 规划推理 :planning(abstract)

AI总结 本文研究了生成式AI在任务拆分中的作用,发现其能生成更细致的任务列表但需人类监督以确保准确性。

Comments 12 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06988 2026-05-11 cs.MA cs.IT cs.RO math.IT 50%

The Cost of Consensus: Malignant Epistemic Herding and Adaptive Gating in Distributed Multi-Agent Search

共识的成本:恶意认知从众与自适应门控在分布式多智能体搜索中的问题

David Farr, Iain Cruickshank, Kate Starbird, Jevin West

机构 * Information School, University of Washington(华盛顿大学信息学院) Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Human Centered Design Engineering, University of Washington(华盛顿大学人本设计工程系)

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨了在分布式多智能体搜索中,通信频率和内容如何共同影响集体信念状态,提出认知对齐的概念,分析了通信设计对集体推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23658 2026-05-11 eess.SY cs.SY 50%

A Review of Community-Centric Power System Resilience: Strategies, Data-Driven Methods, and Techno-Legal Perspectives

面向社区的电力系统韧性综述:策略、数据驱动方法与技术法律视角

Masoud H. Nazari, Hamid Varmazyari, Antar Kumar Biswas, Umit Cali, Hollis Belnap, Masood Parvania

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了面向社区的电力系统韧性,探讨了技术法律框架与工程方法的结合,以及数据驱动方法在应对极端事件中的作用,强调了社区韧性与电力系统韧性的相互依存关系。

Comments This paper has been accepted for publication in the Electric Power Systems Research (EPSR) journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 12 篇

2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 81%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL 79%

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07106 2026-05-11 cs.CL 79%

Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

检索、整合与综合:空间-语义 grounded 的潜在视觉推理

Jin Cui, Xinyue Long, Xunyong Zhang, Yadong Zhang, Chuanchang Su, Jingye Gan, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出RIS框架,通过空间-语义 grounded 方法改进多模态大语言模型的视觉推理,通过构建逐步 grounded 数据集并引入短语言过渡token,提升潜在状态与词汇对齐的解码能力,实验显示在多个基准上优于现有基线。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 78%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 62%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 视觉空间推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 50%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07642 2026-05-11 cs.CV 50%

EggHand: A Multimodal Foundation Model for Egocentric Hand Pose Forecasting

EggHand:一种用于第一人称手姿态预测的多模态基础模型

Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park

机构 * DGIST, Republic of Korea(韩国忠南科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EggHand模型,通过结合视觉-语言-动作模型的动作解码器和第一人称视频-文本编码器,实现对第一人称视频中手姿态序列的预测,提升了在剧烈视角变化下的鲁棒性和可控性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02991 2026-05-11 cs.CV 50%

GraphFusion3D: Dynamic Graph Attention Convolution with Adaptive Cross-Modal Transformer for 3D Object Detection

GraphFusion3D: 动态图注意力卷积与自适应跨模态Transformer用于3D目标检测

Md Sohag Mia, Md Nahid Hasan, Muhammad Abdullah Adnan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GraphFusion3D框架,结合多模态融合与先进特征学习,通过自适应跨模态Transformer增强几何与语义信息,并引入图推理模块捕捉局部结构与全局语义,实验在SUN RGB-D和ScanNetV2上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07264 2026-05-11 cs.CV 50%

Sat3R: Satellite DSM Reconstruction via RPC-Aware Depth Fine-tuning

Sat3R: 通过RPC-aware深度微调实现卫星DSM重建

Qiaoyi Yang, Chaoyi Zhou, Xi Liu, Run Wang, Minghui Xu, Mert D. Pesé, Feng Luo, Yuhao Xu, Zhi-Qi Cheng, Qiushi Chen, Hairong Qi, Siyu Huang

机构 * Clemson University(克莱姆森大学) University of Washington(华盛顿大学) University of Tennessee(田纳西大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 Sat3R通过RPC-aware深度微调Depth Anything V2,利用SiLog损失构建物理一致的伪深度监督,实现无需每场景优化的卫星DSM重建,实验显示其在精度和速度上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07148 2026-05-11 cs.CV 50%

Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models

揭示和塑造视觉-语言模型中3D场景拓扑的潜在表示

Haoming Wang, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了视觉-语言模型是否能构建3D环境的拓扑表示,通过隔离空间子空间并数学塑造潜在表示,证明其与场景3D高斯核图的拉普拉斯特征映射一致,并在空间任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 50%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 11 篇

2605.07442 2026-05-11 cs.LG 90%

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

专题命中 测试时计算 :verifier(title,title_cn);分类 cs.LG

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07654 2026-05-11 stat.ML cs.CL cs.LG 88%

Reliable Chain-of-Thought via Prefix Consistency

通过前缀一致性提升可靠性的链式思维

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

机构 * Nagoya University(名古屋大学) Nara Institute of Science and Technology(奈良科学技術大學) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP(理化学研究所(AIP))

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过前缀一致性来提升链式思维的可靠性,利用再生过程中答案的重复频率作为权重,无需访问token对数概率或自我评价提示,在多个模型和基准测试中表现出色,减少至21倍的token使用量。

Comments See our project page at https://naoto-iwase.github.io/prefix-consistency-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 87%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23032 2026-05-11 cs.CL cs.AI cs.LG 87%

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

链式推理真的不可解释性吗?链式推理可以在不提示 verbalization 的情况下保持忠实

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :chain-of-thought(title);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文挑战了链式推理的忠实性定义,指出基于提示注入的偏差特征指标过于狭隘,通过新指标显示推理预算影响提示 verbalization,并通过因果中介分析证明非 verbalized 提示可通过链式推理影响预测,呼吁更广泛的可解释性工具。

Comments Accepted to ACL 2026. 23 pages, 29 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏