arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 18 篇

2603.09957 2026-03-17 cs.AI cs.CL cs.LG 82%

Think Before You Lie: How Reasoning Leads to Honesty

在谎言之前思考:推理如何导致诚实

Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann, Daphne Ippolito, Martin Wattenberg, Lucas Dixon, Katja Filippova

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过道德权衡数据集探讨推理对诚实的影响,发现推理能提升诚实度,而非单纯依赖推理内容,且代表空间的几何特性是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 82%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 79%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 视觉空间推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 79%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14117 2026-03-17 cs.CV 78%

Improving Visual Reasoning with Iterative Evidence Refinement

通过迭代证据细化提升视觉推理

Zeru Shi, Kai Mei, Yihao Quan, Dimitris N. Metaxas, Ruixiang Tang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20501 2026-03-17 cs.CV 71%

Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models

探索并弥合几何-交互线索以实现视觉基础模型中的可及性推理

Qing Zhang, Xuesong Li, Jing Zhang

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文探讨了视觉基础模型中几何感知与交互感知对可及性推理的互补作用,通过融合DINO的几何原型与Flux的交互地图,实现了与弱监督方法相当的可及性估计。

Comments 11 pages, 12 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 70%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09205 2026-03-17 cs.CL cs.AI cs.LG 67%

Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing

情感不只是一个标签:大型语言模型处理中的潜在情绪因素

Benjamin Reichman, Adar Avsian, Samuel Webster, Larry Heck

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究情绪作为潜在因素对LLM处理的影响,分析情绪如何改变transformer模型的注意力几何结构,并提出AURA-QA数据集和情绪正则化框架以提升阅读理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 57%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 57%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13950 2026-03-17 cs.CL 57%

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

ToolFlood: 超越选择 -- 通过语义覆盖隐藏有效工具于LLM代理

Hussein Jawad, Nicolas J-B Brunel

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对LLM代理的检索层攻击,通过语义覆盖注入恶意工具,使有效工具被排除在外,实验显示攻击成功率高达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15374 2026-03-17 cs.CV 50%

Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation

光谱校正用于结肠镜深度估计中基础模型的参数高效适应

Xiaoxian Zhang, Minghai Shi, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系) Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpecDepth框架,通过光谱校正模块提升结肠镜图像处理性能,实现参数高效适应,取得最佳性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 50%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 50%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 视觉空间推理 :planning(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 50%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13399 2026-03-17 cs.CV 50%

FlowAD: Ego-Scene Interactive Modeling for Autonomous Driving

FlowAD: 无人驾驶中的自体场景交互建模

Mingzhe Guo, Yixiang Yang, Chuanrong Han, Rufeng Zhang, Shirui Li, Ji Wan, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Baidu Inc(百度公司)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏