arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-13 至 2026-08-13 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 15 篇

2608.12220 2026-08-13 cs.CV cs.AI 新提交 90%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 86%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19824 2026-08-13 cs.AI cs.CL cs.CV cs.RO 84%

From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning

从提示到路面通过时间:代理场景到计划推理中的时间定位

Ahmed Y. Gado, Omar Y. Goba, Alaa Hassanein, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11150 2026-08-13 cs.CV 版本更新 78%

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

CausalSplat:面向3D高斯溅射的综合层级推理

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) Hunan University(湖南大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对3D高斯溅射推理局限,本文提出CausalSplat框架,结合视觉语言模型与3D场景图,构建两个推理基准,在相关任务上实现最优性能与强泛化性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 78%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11838 2026-08-13 cs.CV 新提交 67%

GeoBridge: Decoupled Semantic Conditioning for Generative Image Geolocalization

GeoBridge:用于生成式图像地理定位的解耦语义条件机制

Zhiyang Dou, Xumeng Han, Fengde Peng, Zipeng Wang, Moxuan Zhao, Zhipei Huang, Zhenjun Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12274 2026-08-13 cs.CV cs.AI 新提交 57%

A Neighborhood Attention Transformer Network for Enhanced 3D Segmentation of the Left Anterior Descending Artery

用于增强左前降动脉三维分割的邻域注意力Transformer网络

Rafi Ibn Sultan, Chengyin Li, Yiannos Demetriou, Ahmed I. Ghanem, Joshua P. Kim, Justine Cunningham, Hassan Bagher-Ebadian, Dongxiao Zhu, Kundan S. Thind

机构 * Wayne State University(韦恩州立大学) Henry Ford Health(亨利福特医疗集团) Alexandria University(亚历山大大学) Michigan State University(密歇根州立大学) Oakland University(奥克兰大学) Institute for AI and Data Science, Wayne State University(韦恩州立大学人工智能与数据科学学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 该研究提出NA-UNETR模型,结合邻域注意力等模块,经预训练和LoRA微调,在低对比度CT中提升左前降动脉分割精度,为放疗规划提供高效心脏亚结构分割框架。

Comments Acceteed by Medical Physics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12187 2026-08-13 cs.CV cs.AI 新提交 57%

HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation

HSTGFormer:用于3D人体姿态估计的超时空图变换器

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HSTGFormer框架,通过超时空图与自适应双尺度时间图实现时空耦合推理,在Human3.6M等数据集上以高准确率与计算效率完成3D人体姿态估计。

Comments Accepted to BMVC 2026, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11534 2026-08-13 cs.CL cs.CV 新提交 57%

CT-$Δ$Bench: A Benchmark for Longitudinal 3D Medical Imaging Difference Reporting with Vision-Language Models

CT-ΔBench:基于视觉语言模型的纵向3D医学影像差异报告基准

Kegeng Tang, Jingbo Wang, Shaogang Ren, Zihao Wang

机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文针对现有医学基础模型缺乏纵向影像差异处理能力的问题,构建了专用基准CT-ΔBench,开发感知变化指标与医师验证流程,对比不同推理方式并提出基线模型DeltaMed,为时间感知医学基础模型奠定基础。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03236 2026-08-13 cs.HC cs.CL 版本更新 57%

BLADE: Better Language Answers through Dialogue and Explanations

BLADE:通过对话和解释提升语言答案

Chathuri Jayaweera, Phoebe Huang, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。

Comments Contains 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12059 2026-08-13 cs.CY 新提交 50%

Reconfiguring Geovisualization in the Age of Generative AI: Insights from Domain Experts

生成式AI时代的地理可视化重构:领域专家的见解

Mengyi Wei, Chenyu Zuo, Jiaying Xue, Nianhua Liu, Dongsheng Chen, Shengkai Wang, Yu Feng, Liqiu Meng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究通过访谈20位地理可视化专家,探究生成式AI对地理可视化实践的影响,发现其拓展了相关能力但转移了瓶颈,提出需领域特定方法实现负责任应用,为相关实践、教育等提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11458 2026-08-13 cs.CV 新提交 50%

Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026

多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告

Jungyoon Lee, Gyuil Lim, Doeon Kim, Seong-heum Kim

机构 * Soongsil University(崇实大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08131 2026-08-13 cs.RO cs.CV 版本更新 50%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏