arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 223 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 29 篇

2606.28593 2026-06-30 cs.CV cs.AI cs.CL 81%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29915 2026-06-30 cs.CV 78%

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

H-GRPO: 用于基础视觉推理的置换不变强化学习

Eric Peh, Debaditya Roy, Basura Fernando

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出H-GRPO框架,通过分解式证据基础将全局查询分解为原子子问题,每个子问题需显式子答案和局部证据边界框,构建结构化推理路径以提升VLM性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21190 2026-06-30 cs.CV 78%

SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning

SpatiO: 用于空间推理的视觉-语言代理自适应测试时编排

Chan Yeong Hwang, Miso Choi, Sunghyun On, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility Corp.(Kakao Mobility公司) Handong Global University(Handong全球大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatiO通过自适应测试时编排机制协调多种视觉-语言代理,提升空间推理能力,在多个基准测试中优于现有方法。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28691 2026-06-30 cs.RO 78%

DRIVE-Nav: Directional Reasoning, Inspection, and Verification for Efficient Open-Vocabulary Navigation

DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航

Maoguo Gao, Zejun Zhu, Zhiming Sun, Zhengwei Ma, Longze Yuan, Zhongjing Ma, Zhigang Gao, Jinhui Zhang, Suli Zou

机构 * Beijing Institute of Technology(北京理工大学) DeepBlue College(深蓝学院) The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。

Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 78%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV 67%

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17969 2026-06-30 cs.CV 67%

E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

E3VS-Bench:一个用于3D高斯散射场景中视角依赖主动感知的基准

Koya Sakamoto, Taiki Miyanishi, Daichi Azuma, Shuhei Kurita, Shu Morikuni, Naoya Chiba, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) National Institute of Informatics, Japan(日本信息处理学会) The University of Osaka, Japan(大阪大学) Advanced Telecommunications Research Institute International, Japan(国际先进电信研究机构)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 E3VS-Bench通过5自由度视角控制,评估在真实3D环境中视角依赖现象的主动感知能力,测试模型在多视角探索中的表现。

Comments Project page: https://k0uya.github.io/e3vs-proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09781 2026-06-30 cs.CV 67%

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

基于闭环VLM代理的文本引导的6D物体姿态重排

Sangwon Baik, Gunhee Kim, Mingi Choi, Hanbyul Joo

机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13675 2026-06-30 cs.RO 67%

OLiVia-Nav: An Online Lifelong Vision Language Approach for Mobile Robot Social Navigation

OLiVia-Nav: 一种面向移动机器人社交导航的在线终身视觉语言方法

Siddarth Narasimhan, Aaron Hao Tan, Daniel Choi, Goldie Nejat

机构 * University of Toronto(多伦多大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 OLiVia-Nav通过融合视觉语言模型与在线终身学习框架,实现机器人社交导航中的社会规范适应与动态轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30632 2026-06-30 cs.RO cs.AI cs.CV 57%

GROW$^2$: Grounding Which and Where for Robot Tool Use

GROW$^2$:为机器人工具使用确定哪个物体和哪个部位

Yuhong Deng, Yuyao Liu, David Hsu

机构 * National University of Singapore(新加坡国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GROW$^2$方法,通过分层语义和几何接地实现开放世界工具选择与部位定位,在零样本泛化中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29340 2026-06-30 cs.AI 57%

PHF: Privileged Hidden Flow for On-Policy Self-Distillation

PHF: 用于在线自蒸馏的特权隐藏流

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六十三研究所,南京)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出特权隐藏流(PHF),通过对齐教师和学生的隐藏状态轨迹(而非逐点匹配),在在线自蒸馏中提升推理性能,在Qwen3模型上获得约+1.5至+2.2点的提升。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28524 2026-06-30 cs.CL 57%

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

Transformer语言模型中情境建模与心理推理的发展轨迹

Pamela D. Rivière, Cameron Jones, Sean Trott

机构 * Rutgers University - Newark(新泽西州立大学罗格斯大学-新ark分校) Stony Brook University(史泰文斯布鲁克大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文从发展视角研究大型语言模型在虚假信念任务中的表现,发现其依赖于模型大小和训练量,且后期训练提升显著,但情境建模能力先于并优于心理推理,且两者均存在脆弱性。

Comments Non-archival submission to the First Workshop on Computational Developmental Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05689 2026-06-30 cs.CV cs.AI 57%

CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

CRFT:用于跨模态图像配准的一致-递归特征流变换器

Xuecong Liu, Mengzhu Ding, Zixuan Sun, Zhang Li, Xichao Teng

机构 * Northeastern University, China(东北大学(中国)) National University of Defense Technology, China(国防科技大学(中国))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CRFT提出了一种基于特征流学习的统一粗到细框架,通过特征对齐和流估计实现鲁棒的跨模态图像配准,通过多尺度特征相关性和层次特征融合提升精度和鲁棒性。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 34784-34794

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30638 2026-06-30 cs.CV 50%

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

开放词汇与指代分割:利用2D检测器实现3D高斯

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30404 2026-06-30 cs.RO 50%

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation

HUMEMBR:学习人类日常行为以进行预测性具身导航

Samira Huber, Klaas Pelzer, Duc M. Nguyen, Xuesu Xiao, Sören Pirk

机构 * Kiel University, Germany(德国基尔大学) George Mason University, USA(美国乔治·马歇尔大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30014 2026-06-30 cs.CV 50%

Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction

壳监督高斯溅射用于城市真实到仿真重建

Yuan Yang, Peijun Lu, Fangzhou Lu, Sai Fan, Siqi Yan, Chenyuan Zhang, Haobo Liang, Yichen Wang

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出壳监督高斯溅射框架,利用外部立面结构壳作为几何监督,通过掩码门控损失优化高斯重建,提升城市立面几何一致性。

Comments 10 pages main paper, 2 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-06-30 cs.CV cs.RO 50%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29774 2026-06-30 cs.RO 50%

Analytic Concept-Centric Memory for Agentic Embodied Manipulation

分析性概念中心记忆用于具身操作代理

Mingyang Sun, Xiujian Liang, Jiude Wei, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出分析性概念中心记忆框架,通过结构化概念(语义部件、参数模板等)组织经验,支持粗到细检索,提升长时程具身操作中的物体重识别、状态推理和技能复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29013 2026-06-30 cs.CV 50%

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Mural: 通过混合Transformer将LLM知识迁移到图像生成

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28338 2026-06-30 cs.IR 50%

Memory Shot for Long-Term Dialogue

长期对话的记忆快照

Chunyi Peng, Haidong Xin, Xuanshuo Sheng, Xin Dai, Zhenghao Liu, Shuo Wang, Yukun Yan, Zulong Chen, Yu Gu, Ge Yu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MemShot方法,通过将对话片段渲染为结构化视觉记忆单元,利用模型内部视觉推理能力关联关键情节,实现高效长期对话建模,在LoCoMo和LongMemEval上取得稳定性能并实现70倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19624 2026-06-30 cs.CV 50%

GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction

GRAFT:用于人体场景重建的几何细化和拟合变换

Pradyumna YM, Yuxuan Xue, Yue Chen, Nikita Kister, István Sárándi, Gerard Pons-Moll

机构 * Westlake University(西湖大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GRAFT通过几何细化和拟合变换,提升单图像中人体与场景交互的重建质量,实现快速且精确的交互推理。

Comments ECCV 2026. Project Page: https://pradyumnaym.github.io/graft

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 50%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21078 2026-06-30 cs.CV 50%

UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer

UniPR-3D:迈向基于视觉几何基础的通用视觉位置识别

Tianchen Deng, Xun Chen, Ziming Li, Hongming Shen, Shuhao Zhai, Danwei Wang, Javier Civera, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Zaragoza(萨拉戈萨大学) University of Macau(澳门大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出UniPR-3D,首个融合多视角信息的视觉位置识别架构,通过3D tokens与2D tokens联合描述,提升跨视角推理与泛化能力,实验表明其优于单多视角基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 50%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 视觉空间推理 :self-correction(abstract)

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 11 篇

2606.29225 2026-06-30 cs.AI cs.CL 84%

PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09278 2026-06-30 cs.CL cs.AI 81%

CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts

CLARity:仅通过推理一致性即可教授强化专家

Jiuheng Lin, Cong Jiang, Zirui Wu, Jiarui Sun, Yansong Feng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CLARity通过一致性感知奖励机制和两阶段精炼-监控训练流程,提升推理一致性,利用小规模通用LLM有效指导专家模型,实验显示在一致性与准确性上均有显著提升。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08831 2026-06-30 cs.AI 新提交 79%

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

面向大语言模型的推理时保形推理与有效事实性控制

Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

机构 * Machine Learning, ICML(机器学习,国际机器学习大会)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 77%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG 67%

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28661 2026-06-30 cs.LG cs.AI cs.CL stat.ML 67%

When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling

当更多采样有害时:测试时扩展的模态上限与相关性上限

Yong Yi Bay, Kathleen A. Yearick

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示测试时扩展中采样过多会导致选择性能停滞甚至下降,提出模态上限和相关性上限,并给出有效采样数作为停止准则。

Comments 24 pages, 10 figures, 3 tables. Code and data: https://github.com/bay-yearick-lab/sampling-ceilings

详情

展开后加载摘要…

URL PDF HTML 收藏