arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-15 至 2026-05-15 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2605.14908 2026-05-15 cs.CV 89%

SteerSeg: Attention Steering for Reasoning Video Segmentation

SteerSeg: 基于注意力引导的视频分割

Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis, Morteza Saberi, Aijun An, Lars Petersson

机构 * Macquarie University(麦考瑞大学) York University(约克大学) CSIRO Data61(CSIRO数据61) UTS(UTS大学)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 SteerSeg通过输入级条件引导解决注意力对齐问题,结合可学习软提示和推理引导的CoT提示,提升视频分割的时空定位能力。

Comments Project page: https://steerseg.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19713 2026-05-15 cs.GR 88%

CAD-Coder: Text-to-CAD Generation with Chain-of-Thought and Geometric Reward

CAD-Coder:基于链式思维和几何奖励的文本到CAD生成

Yandong Guan, Xilin Wang, Ximing Xing, Jing Zhang, Dong Xu, Qian Yu

专题命中 视觉空间推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);planning(abstract)

AI总结 CAD-Coder将文本到CAD生成转化为CadQuery脚本生成,通过监督微调和强化学习提升代码有效性与几何精度,实现LLM直接生成复杂CAD模型。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025), pp. 59765-59789

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14358 2026-05-15 cs.AI cs.LG 84%

Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces

揭示过度完备推理轨迹中最小核心的表示几何

Sanjoy Chowdhury, Dinesh Manocha

机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了过度完备推理轨迹中最小核心的表示几何,通过定义最小核心并提出压缩比、冗余质量等指标,发现平均46%的步骤可被移除且保留原答案,同时最小核心提升了正确-错误轨迹分离度,降低了内在维度,且在不同模型间具有高转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14696 2026-05-15 cs.CV 82%

EponaV2: Driving World Model with Comprehensive Future Reasoning

EponaV2:通过全面的未来推理驱动世界模型

Jiawei Xu, Zhizhou Zhong, Zhijian Shu, Mingkai Jia, Mingxiao Li, Jia-Wang Bian, Qian Zhang, Kaicheng Zhang, Jin Xie, Jian Yang, Wei Yin

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(PCA实验室、VCIP、计算机科学学院、南开大学) Horizon Robotics HKUST(香港科技大学) NJUPT(南京工程大学) NTU(国立台湾大学) Anyverse School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院、南京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出EponaV2,一种新的驾驶世界模型范式,通过全面的未来推理实现高质量规划。模型通过预测更全面的未来表示,结合3D和语义模态,提升环境理解与现实推理能力,从而改进轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV 79%

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14845 2026-05-15 cs.CV 75%

Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study

探索用于在线签名验证的视觉-语言模型:零样本能力研究

Marta Robledo-Moreno, Ruben Vera-Rodriguez, Ruben Tolosana, Javier Ortega-Garcia

机构 * BiometricsAI, School of Engineering, Universidad Autonoma de Madrid, Spain(生物识别AI,工程学院,马德里自治大学,西班牙)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文研究了最新视觉-语言模型在在线签名验证任务中的零样本性能,发现信号质量和伪造类型对性能有显著影响,尤其在高难度伪造场景中,基于链式推理的模型表现下降。

Comments Accepted at the 14th International Workshop on Biometrics and Forensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10038 2026-05-15 cs.CL cs.AI cs.LG 67%

On the Diagram of Thought

思维图式图示

Yifan Zhang, Yang Yuan, Andrew Chi-Chih Yao

机构 * IIIS Tsinghua University(清华大学人工智能研究院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思维图式(DoT)框架,使LLM能构建动态推理图谱,通过类型推理记录和范畴论数学框架,实现可审计的分步推理,区分类型子轨迹与自然语言文本的语义保障。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15054 2026-05-15 cs.CV 50%

LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection

LATERN:测试时上下文感知的可解释视频异常检测

Mitchell Piehl, Muchao Ye

机构 * The University of Iowa(爱荷华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出LATERN框架,通过上下文感知模块和递归证据聚合模块提升视频异常检测的准确性和解释一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14923 2026-05-15 cs.CV 50%

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

SceneParser: 用于视觉语义理解的分层场景解析

Pengxin Xu, Xincheng Lin, Luping Xiao, Qing Jiang, Meishan Zhang, Hao Fei, Shanghang Zhang, Xingyu Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) University of Oxford(牛津大学) Peking University(北京大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SceneParser,通过分层解析任务构建场景-对象-部件-功能的层次结构,利用结构完成伪标签和课程学习提升结构感知能力,实验表明其在复杂场景理解中表现更优。

Comments Preprint. Code, models, and dataset are provided in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14801 2026-05-15 cs.RO 50%

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14393 2026-05-15 cs.CV 50%

Analogical Trajectory Transfer

类比轨迹迁移

Junho Kim, Eun Sun Lee, Gwangtak Bae, Seunggu Kang, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence and INMC, Seoul National University(人工智能交叉计划和INMC,首尔国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过分解空间子问题实现类比轨迹迁移,利用3D基础模型特征进行跨场景映射,快速生成空间一致的轨迹迁移方案,适用于AR/VR和机器人领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14310 2026-05-15 cs.CV 50%

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

CoRDS:基于核心集的代表性与多样性选择用于流视频理解

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CoRDS方法,通过核心集选择优化流视频理解中的缓存压缩,提升代表性与多样性,优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18943 2026-05-15 cs.CV 50%

VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation

VGGT-360:几何一致的零样本全景深度估计

Jiayi Yuan, Haobo Jiang, De Wen Soh, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VGGT-360通过利用VGGT基础模型的内在3D一致性,提出一种无需训练的零样本全景深度估计框架,整合三个模块实现全景到3D到深度的统一流程,提升估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13862 2026-05-15 cs.GR cs.CV eess.IV 50%

Seed3D 2.0: Advancing High-Fidelity Simulation-Ready 3D Content Generation

Seed3D 2.0: 推动高保真仿真准备的3D内容生成

Diandian Gu, Jing Lin, Gaohong Liu, Jiahang Liu, Su Ma, Guang Shi, Jun Wang, Qinlong Wang, Qianyi Wu, Zhongcong Xu, Xuanyu Yi, Zihao Yu, Jianfeng Zhang, Zhuolin Zheng, Yifan Zhu, Rui Chen, Hengkai Guo, Xiaoyang Guo, Mingcong Han, Xu Han, Xiu Li, Yixun Liang, Weiqiang Lou, Junzhe Lu, Guan Luo, Minghan Qin, Shuguang Wang, Yuang Wang

机构 * ByteDance(字节跳动)

专题命中 视觉空间推理 :planning(abstract)

AI总结 Seed3D 2.0通过改进生成保真度、仿真能力及应用范围,引入统一PBR模型和仿真准备模型套件,提升3D内容生成精度与视觉效果。

Comments Seed3D 2.0 Technical Report; Official Page on https://seed.bytedance.com/seed3d_2_0

详情

展开后加载摘要…

URL PDF HTML 收藏