arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-24 至 2026-04-24 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2604.21249 2026-04-24 cs.RO 88%

Reasoning About Traversability: Language-Guided Off-Road 3D Trajectory Planning

轨迹可 traversability 的推理:语言引导的越野3D轨迹规划

Byounggun Park, Soonmin Hwang

机构 * Department of Automotive Engineering, Hanyang University, Seoul, Republic of Korea(韩雅大学汽车工程系,首尔,大韩民国)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本文提出语言精修框架与偏好优化策略,通过动作对齐监督和地形感知优化,提升越野3D轨迹规划的合规性与地形一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21409 2026-04-24 cs.CV 82%

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

S1-VL:具有图像思维的科学多模态推理模型

Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, Nan Xu

机构 * ScienceOne AI

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 S1-VL是一种支持科学推理和图像思维的多模态模型,通过Python代码执行图像处理,提升科学图表、显微图像和几何推理等复杂场景的性能。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 80%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 67%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);verifier(abstract)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 57%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20981 2026-04-24 q-bio.QM cs.CV cs.LG 57%

PanGuide3D: Cohort-Robust Pancreas Tumor Segmentation via Probabilistic Pancreas Conditioning and a Transformer Bottleneck

PanGuide3D:通过概率胰腺条件和一个Transformer瓶颈实现队列鲁棒的胰腺肿瘤分割

Sunny Joy Ma, Xiang Ma

机构 * Trailridge School(Trailridge学校) Department of Biochemistry, Grand View University(生物化学系,Grand View大学) Department of Computer Science, Iowa State University(计算机科学系,Iowa State大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出PanGuide3D,通过概率胰腺条件和Transformer瓶颈提升跨队列鲁棒性,实现高效且实用的3D CT肿瘤分割,尤其在小肿瘤和复杂解剖位置表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏