arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2606.03564 2026-06-04 cs.CV cs.AI 92%

CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

CR-Seg:注意力引导与CoT增强的由粗到精推理分割

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI 81%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04226 2026-06-04 cs.RO cs.AI 79%

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

PerceptTwin:面向迭代LLM规划与验证的语义场景重建

Charlie Gauthier, Sacha Morin, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.AI

AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。

Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 67%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04389 2026-06-04 cs.CL 57%

When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

当来访者不再跟随:基于认知概念化图的策略性咨询框架

Yihao Qin, Junyi Zhao, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Chang Liu, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有评估协议中来访者过度顺从导致评分虚高的问题,提出基于认知行为疗法的抵抗感知框架,通过认知概念化图模拟动态抵抗,并利用强化学习优化策略推理与响应生成,以提升在困难咨询交互中的策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04172 2026-06-04 cs.RO 50%

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation

Affordance2Action: 任务条件下的场景级功能区域定位用于实时操作

Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu

机构 * Department of Computer Science, Rutgers University-New Brunswick(罗格斯大学新布朗斯维尔回声分校计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(GZ)) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Affordance2Action框架,通过构建A2A-Bench基准和A2A-AffordGen标注流程,解决场景级任务条件功能区域定位中的多区域对应问题,并支持实时操作。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏