arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-05 至 2026-06-05 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2605.15454 2026-06-05 cs.CL cs.LG stat.ML 84%

Reasoning Models Don't Just Think Longer, They Move Differently

推理模型不只思考更久,它们的移动方式不同

Anders Gjølbye, Lars Kai Hansen, Sanmi Koyejo

机构 * Technical University of Denmark(丹麦技术大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了推理训练模型在生成链式思维时的轨迹差异,发现通过长度校正后,不同领域中难度与轨迹几何的耦合关系存在显著差异,尤其是在代码领域中,推理训练模型表现出更直接的轨迹和更一致的局部曲率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06476 2026-06-05 cs.CV 82%

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

思考与想象:基于世界模拟器的智能视觉空间推理

Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Beihang University(北航大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出Astra框架,通过强化学习训练VLM策略与Bagel世界模拟器交互,在推理中生成想象视觉证据,解决空间推理中的未观察布局、跨视角一致性和替代视角推理问题。

Comments Project page: https://zcmax.github.io/projects/Thinking-With-Imagination

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02907 2026-06-05 cs.CL cs.AI 81%

Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States

线性探针检测语言模型隐藏状态中的任务格式,而非推理模式

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

机构 * Horizon Research(远景研究) Meta Apple(苹果公司) Northeastern University(东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过线性探针实验发现,大语言模型隐藏状态中看似分离的推理模式实际上由任务格式(如来源、选项数、响应长度)混淆导致,而非真正的推理计算结构。

Comments Accepted in the 6th Workshop on Trustworthy NLP, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05769 2026-06-05 cs.CV 78%

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

在预测之前想象:用于视频事件预测的交错潜在视觉推理

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Future-L1框架,通过交错潜在视觉推理在自回归解码中交替语言token和连续潜在视觉跨度,结合LA-DAPO强化学习优化,在视频事件预测任务上取得最先进结果。

Comments https://github.com/OpenGVLab/Future-L1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05635 2026-06-05 cs.CV cs.MM 67%

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions

ShotCrop$^3$:将人物中心图像裁剪为电影级三镜头构图

Dehong Kong, Lina Lei, Lingtao Zheng, Chenyang Wu, Ailing Zhang, Xinran Qin, Teng Ma, Jiaqi Xu, Zhixin Wang, Zhikai Chen, Xuecheng Qi, Renjing Pei, Fan Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出三镜头构图任务,通过三阶段训练流程(思维链微调、半监督微调和组相对策略优化)从单张人物中心图像生成远景、中景和特写三张裁剪图,并附带简短描述,以支持视觉叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05275 2026-06-05 cs.CV cs.AI 57%

Personal AI Agent for Camera Roll VQA

个人AI代理用于相机胶卷VQA

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) Adobe Research(Adobe研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出camroll数据集和camroll-agent代理,通过层次化记忆和工具集解决个人相机胶卷中的长程、高度个性化的视觉问答问题。

Comments Project page, code, and demo: https://thaoshibe.github.io/camroll

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05268 2026-06-05 cs.GR cs.LG 57%

Aggregating LLM-Based Weak Verifiers for Spatial Layout Generation

基于LLM的弱验证器聚合用于空间布局生成

Sharon Zhang, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学) Roblox

专题命中 视觉空间推理 :verifier(abstract);分类 cs.LG

AI总结 提出一种通过聚合LLM生成的弱验证器来构建强验证器的流水线,用于空间布局领域,在3D房间布局和2D海报设计任务中F1分数提升高达7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03100 2026-06-05 cs.CV cs.LG 57%

Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

零样本3D问答通过层级视图到令牌传输

Dongsheng Wang, Dawei Su, Hui Huang

机构 * Dongsheng Wang(王东生) Dawei Su(苏大卫) Hui Huang(黄慧)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出KeyVT方法,通过层级视图和令牌级输入上下文收集,结合像素特征与相机参数评估视图重要性,并利用最优传输识别代表性令牌,实现零样本3D问答性能提升。

Comments Accepted at ICML 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI 57%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06155 2026-06-05 cs.RO cs.CV cs.MM 50%

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Qize Yu, Jiadi You, Yuran Wang, Jiaqi Liang, Bowen Ping, Yang Tian, Yue Chen, Minghong Cai, Zeying Gong, Ruihai Wu, Yinchuan Li, Junwei Liang, Yingcong Chen

机构 * Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Knowin AI

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。

Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05753 2026-06-05 cs.CV 50%

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

余弦误导:辅助损失重塑视觉语言模型,而非其潜变量

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30819 2026-06-05 cs.CV cs.GR 50%

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

Function2Scene: 基于功能规范的3D室内场景布局

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。

Comments project page: https://function2scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03890 2026-06-05 cs.CV 50%

4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping

4DPC$^2$hat: 面向动态点云理解的失败感知自举学习

Xindan Zhang, Weilong Yan, Yufei Shi, Xuerui Qiu, Tao He, Ying Li, Ming Li, Hehe Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09989 2026-06-05 cs.RO cs.CV 50%

StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception

StereoPolicy:通过立体视觉改进机器人操作策略

Evans Han, Yunfan Jiang, Yingke Wang, Haoyue Xiao, Huang Huang, Jianwen Xie, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学) Lambda, Inc(Lambda公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出StereoPolicy,一种利用立体视觉提升机器人操作策略的框架,通过同步立体图像对增强几何推理,无需构建显式3D表示,在多个仿真和真实机器人任务中优于RGB、RGB-D、点云等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏