arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 18 篇

2603.13374 2026-03-17 cs.CV cs.AI 79%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14117 2026-03-17 cs.CV 78%

Improving Visual Reasoning with Iterative Evidence Refinement

通过迭代证据细化提升视觉推理

Zeru Shi, Kai Mei, Yihao Quan, Dimitris N. Metaxas, Ruixiang Tang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20501 2026-03-17 cs.CV 71%

Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models

探索并弥合几何-交互线索以实现视觉基础模型中的可及性推理

Qing Zhang, Xuesong Li, Jing Zhang

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文探讨了视觉基础模型中几何感知与交互感知对可及性推理的互补作用,通过融合DINO的几何原型与Flux的交互地图,实现了与弱监督方法相当的可及性估计。

Comments 11 pages, 12 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 70%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09205 2026-03-17 cs.CL cs.AI cs.LG 67%

Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing

情感不只是一个标签:大型语言模型处理中的潜在情绪因素

Benjamin Reichman, Adar Avsian, Samuel Webster, Larry Heck

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究情绪作为潜在因素对LLM处理的影响,分析情绪如何改变transformer模型的注意力几何结构,并提出AURA-QA数据集和情绪正则化框架以提升阅读理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 57%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13950 2026-03-17 cs.CL 57%

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

ToolFlood: 超越选择 -- 通过语义覆盖隐藏有效工具于LLM代理

Hussein Jawad, Nicolas J-B Brunel

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对LLM代理的检索层攻击,通过语义覆盖注入恶意工具,使有效工具被排除在外,实验显示攻击成功率高达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15374 2026-03-17 cs.CV 50%

Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation

光谱校正用于结肠镜深度估计中基础模型的参数高效适应

Xiaoxian Zhang, Minghai Shi, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系) Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpecDepth框架,通过光谱校正模块提升结肠镜图像处理性能,实现参数高效适应,取得最佳性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 50%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 50%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 视觉空间推理 :planning(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 50%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV 50%

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 10 篇

2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 90%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13274 2026-03-17 cs.LG cs.AI 88%

Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation

通过截断推理自蒸馏学习部分推理链

Gianluigi Silvestri, Edoardo Cetin

机构 * Radboud University(拉德堡德大学) Sakana AI(萨卡纳人工智能)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TRSD方法,通过自蒸馏提升模型在截断推理下的鲁棒性,减少计算开销并提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG 86%

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20072 2026-03-17 cs.CL cs.AI 86%

Incentivizing Strong Reasoning from Weak Supervision

通过弱监督激励强推理

Yige Yuan, Teng Xiao, Shuchang Tao, Xue Wang, Jinyang Gao, Bolin Ding, Bingbing Xu

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究如何在无需高成本示范和强化学习的情况下,通过弱监督模型激励大语言模型的推理能力,发现弱监督能有效提升推理性能,接近强化学习的效果,且成本更低。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 82%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 79%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 67%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 57%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG 57%

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14633 2026-03-17 cs.CR cs.PF 50%

When Scanners Lie: Evaluator Instability in LLM Red-Teaming

当扫描器撒谎:在LLM红队测试中的评估者不稳定性

Lidor Erez, Omer Hofman, Tamir Nizri, Roman Vainshtein

专题命中 测试时计算 :verifier(abstract)

AI总结 本文研究了LLM安全评估中评估者不稳定性问题,提出了一种可靠性意识的评估框架,通过量化评估者分歧和验证方法提升评估准确性,发现22个攻击类别存在评估不稳定现象,使评估准确率从72%提升至89%。

Comments Submitted to the EvalEval Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 20 篇

2510.01116 2026-03-17 cs.LG 89%

Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning

通过强化学习激发时间序列分析的链式推理

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出COUNTS框架,通过强化学习训练LLM进行时间序列任务的链式推理,提升复杂时间数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20054 2026-03-17 cs.CV 88%

Marmot: Object-Level Self-Correction via Multi-Agent Reasoning

Marmot:通过多智能体推理实现对象级自校正

Jiayang Sun, Hongbo Wang, Jie Cao, Huaibo Huang, Ran He

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract)

AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14251 2026-03-17 cs.CL cs.AI 86%

Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring

通过推理路径偏差监控缓解大型推理语言模型中的过度思考

Weixin Guan, Liang Li, Jiapeng Liu, Bing Li, Peng Fu, Chengyang Fang, Xiaoshuai Hao, Can Ma, Weiping Wang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种与原生推理过程紧密耦合的早退方法,利用路径偏差指数监测高熵转移标记,动态检测并终止过度思考轨迹,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15509 2026-03-17 cs.AI cs.CV 85%

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

Chart-R1: 链式推理监督与强化学习用于高级图表推理器

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出Chart-R1,通过链式推理监督和强化学习提升图表推理能力,通过程序化数据合成和两阶段训练策略,在图表领域取得显著性能提升。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15371 2026-03-17 cs.AI cs.NI 83%

Brain-Inspired Graph Multi-Agent Systems for LLM Reasoning

受脑启发的图多智能体系统用于LLM推理

Guangfu Hao, Yuming Dai, Xianzhe Qin, Shan Yu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出受人类认知全局工作理论启发的BIGMAS系统,通过动态图结构和共享工作区提升多步推理能力,实验表明其在多个LLM上均优于现有多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏