arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-14 至 2026-08-14 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 13 篇

2608.13344 2026-08-14 cs.AI 新提交 83%

LongEarth-R1: Benchmarking and Aligning Vision-Language Models for Long-Horizon Earth Observation Reasoning

LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐

Yupan Ding, Jing Xiao, Zhenyuan Zhang, Chaofeng Chen, Liang Liao, Gui-Song Xia, Mi Wang

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 82%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13095 2026-08-14 cs.RO cs.CV 新提交 79%

Semantic Radiance Fields as Simulators for Spatial Reasoning in Real-World Scenes

语义辐射场作为真实场景空间推理的模拟器

Nico Heider, Michał Jan Włodarczyk, Katarzyna Wasielewska-Michniewska, Przemysław Hołda, Martin Schieck, Marcin Paprzycki, Maria Ganzha, Bogdan Franczyk

机构 * Leipzig University(莱比锡大学) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Wrocław University of Economics(弗罗茨瓦夫经济大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出用语义辐射场(SRF)构建兼具几何真实性与语义可查询性的真实场景模拟器,用于训练评估具身智能体的空间推理能力,还将其应用于果园苹果采摘任务。

Comments Accepted at the IJCAI 2026 Workshop on Spatio-Temporal Reasoning and Learning (STRL), oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21186 2026-08-14 cs.CV 版本更新 78%

Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning

Spa3R:用于3D视觉推理的预测空间场建模

Haoyi Jiang, Liu Liu, Xinjie Wang, Yonghao He, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics D-Robotics Intern at D-Robotics(D-Robotics 实习生)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 Spa3R通过自监督学习从多视角图像中提取统一的空间表示,提升3D视觉推理能力,实现与VLMs的结合,达到3D VQA任务的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12743 2026-08-14 cs.AI 新提交 77%

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆智能体:用于空间智能的基于经验的过程记忆

Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 67%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 57%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 57%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12689 2026-08-14 cs.CV cs.AI 新提交 57%

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12737 2026-08-14 cs.CV 新提交 50%

Dual-Manifold Geometry Guided Representation Learning: Adaptive Coupling between Kernel and Data Spaces

双流形几何引导的表示学习:核空间与数据空间的自适应耦合

Wencong Zhang, Yue Zhang, Meiyan Huang, Wei Yang, Qianjin Feng

机构 * School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University(南方医科大学广东省医学图像重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出双流形视角,构建KGFT轻量级模块,结合利用与探索模式及深度感知策略,在ResNet等架构的图像分类等任务上取得一致性能提升,验证了方法的通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 50%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29395 2026-08-14 cs.CV 版本更新 50%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08199 2026-08-14 cs.CV 版本更新 50%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏