arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2604.12896 2026-04-15 cs.CV cs.LG 79%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL 79%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00710 2026-04-15 cs.AI 79%

Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models

RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展

Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu

机构 * University College London(伦敦大学学院) Samsung R&D Institute UK(三星英国研发院) University of California, Los Angeles(加州大学洛杉矶分校) Texas A&M University(德克萨斯农工大学) Imperial College London(伦敦帝国学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过Ariadne框架研究RLVR对视觉-语言模型空间推理能力的影响,证明其能扩展推理边界,并在真实导航任务中取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 78%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 77%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07267 2026-04-15 cs.RO 67%

Bio-Inspired Topological Autonomous Navigation with Active Inference in Robotics

生物启发的拓扑自主导航与主动推断在机器人中的应用

Daria de Tinguy, Tim Verbelen, Emilio Gamba, Bart Dhoedt

机构 * Ghent University(根特大学) Verses Flanders Make(佛兰德斯制造)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种基于主动推断框架的生物启发代理,实现环境拓扑地图的实时生成与更新,通过概率推理框架实现可解释的导航,并在动态和未知环境中表现出鲁棒适应性。

Comments Conference ICCAS 2025 - accepted (in processing)

Journal ref Communications in Computer and Information Science, vol 2857, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 57%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 57%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20330 2026-04-15 cs.CV cs.AI cs.GR 57%

OmniHands: Towards Robust 4D Hand Mesh Recovery via A Versatile Transformer

OmniHands: 一种通过通用变压器实现鲁棒四维手形重建的方法

Dixuan Lin, Yuxiang Zhang, Mengcheng Li, Wei Jing, Qi Yan, Qianying Wang, Yebin Liu, Hongwen Zhang

机构 * Beijing Normal University(北京师范大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniHands,通过通用变压器架构解决单目或多视角输入下手形及相对运动重建问题,引入关系感知双手分词和四维交互推理模块,提升真实场景中手部交互重建性能。

Comments An extended journal version of 4DHands, featured with versatile module that can adapt to temporal task and multi-view task. Additional detailed comparison experiments and results presentation have been added. More demo videos can be seen at our project page: https://OmniHand.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 50%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10992 2026-04-15 cs.CV 50%

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

ArtiCAD: 通过多智能体代码生成实现可动CAD装配设计

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ArtiCAD通过多智能体系统从文本或图像生成可编辑的可动CAD装配,利用连接器定义连接点和关节参数,提升空间推理能力,通过验证步骤和回滚机制确保输出质量,验证了其在概念设计、物理原型和AI训练资产生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12486 2026-04-15 cs.RO 50%

DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation

DeCoNav:基于对话的长时程协作视觉语言导航

Sunyao Zhou, Yunzi Wu, Tianhang Wang, Xinhai Li, Guang Chen, Lizheng Liu, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom Fudan University(中国电信复旦大学) Tongji University(同济大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeCoNav通过事件触发对话与动态任务分配实现多机器人协作,提升了多机器人系统的长时程协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏