arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4066 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 880 篇

2606.11050 2026-06-10 cs.MA cs.GT cs.SY eess.SY 新提交 50%

LLM-Mediated Demand Response Coordination in Smart Microgrids

LLM介导的智能微电网需求响应协调

J. de Curtò, I. de Zarzà

专题命中 规划推理 :reasoning(abstract)

AI总结 针对智能微电网中产消者自愿合作的需求响应协调问题,提出一种结合博弈论与LLM叙事评估的混合决策架构,通过结构化指令实现33.3%的需求削减合作率,优于非结构化消息和基线。

Comments Accepted for publication in 18th International Conference on Sustainability in Energy and Buildings (SEB-26), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09845 2026-06-10 cs.HC cs.ET 新提交 50%

Tutor, Not Solver: Designing a Guardrailed AI Assistant for Learning in Higher Education: A Design Case of PeteChat

导师,而非解题者:设计高等教育中带护栏的AI学习助手——PeteChat的设计案例

Belle Li, Lily Tan, Wei Zakharov, Qiang Qiu, Colby Ben Acton

专题命中 规划推理 :reasoning(abstract)

AI总结 本文通过设计案例PeteChat,提出八项可迁移的评估感知AI导师设计原则,包括作业护栏、调试支架等,基于本地Llama-3模型和RAG技术,旨在平衡学习支持与学术诚信。

Comments Preprint. Includes supplementary appendices, interface figures, and baseline-analysis tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10192 2026-06-10 math.OC cs.SY eess.SY 新提交 50%

Submodular Optimization with Applications to Decision and Control

子模优化及其在决策与控制中的应用

Shamak Dutta, Bahman Gharesifard, Stephen L. Smith

专题命中 规划推理 :planning(abstract)

AI总结 本文综述子模集函数的理论、算法及其在决策与控制中的应用,重点介绍基于贪心算法的近似保证和曲率、子模比等结构性质,并涵盖传感器调度、多智能体协调等应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10215 2026-06-10 physics.space-ph physics.plasm-ph 新提交 50%

LEAP: A Rapid Neural Surrogate of Multi-Fluid MHD at Europa

LEAP: 欧罗巴多流体磁流体动力学的快速神经替代模型

Sachin Alexander Reddy, Abigail R. Azari, Corey J. Cochrane, Xianzhe Jia, Tom A. Nordheim, Lukas Mandrake, Steven D. Vance, Camilla Harris, Ioana Ciucǎ

专题命中 规划推理 :planning(abstract)

AI总结 针对欧罗巴地下海洋探测中MHD模型计算成本高的问题,提出基于Transformer的替代模型LEAP,实现毫秒级预测磁场扰动,速度提升约40000倍,精度与MHD相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09641 2026-06-09 cs.CV 新提交 50%

MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding

MAVIS: 通过结构化视频理解实现多智能体视频检索

Jie Zhang, Qilang Ye, Hao Zhou, Haochen Liang, Fei Luo

机构 * School of Computing and Information Technology, Great Bay University(大湾区大学计算机与信息技术学院) College of Computer Science, Nankai University(南开大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出多智能体框架MAVIS,通过结构化语义库解析视频,利用逻辑感知辩论机制协作推理,无需全库扫描和微调即可实现高效视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08828 2026-06-09 cs.RO 新提交 50%

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Pennsylvania(宾夕法尼亚大学) Toyota Research Institute(丰田研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。

Comments Website: https://video2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07940 2026-06-09 cs.CR 新提交 50%

SGTO-MAS: Secure Gorilla Troops Optimization for Multi-Agent LLM Systems

SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化

Saeid Jamshidi

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07393 2026-06-08 cs.SE 新提交 50%

Is US Defense Acquisition Ready to Acquire AI-Enabled Capabilities? Assessing the DoD Software Acquisition Pathway Through a Scenario-Based Policy Analysis

美国国防采办是否准备好采办人工智能赋能能力?通过基于场景的政策分析评估国防部软件采办路径

Daniel Lugo, James C. Davis

专题命中 规划推理 :planning(abstract)

AI总结 通过基于场景的政策分析,评估美国国防部软件采办路径是否足以应对AI采办的独特需求,发现核心指南中存在可操作性不足,建议增设AI支持子路径并完善工件。

Comments Submitted to ACM Digital Government: Research and Practice Journal on April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06569 2026-06-08 cs.RO 新提交 50%

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation

PhyRoGen:使用程序化内容生成物理机器人操作谜题的合成生成

Lennart Julian Droß, Andreas Orthey, Marc Toussaint

机构 * Technical University of Berlin(柏林技术大学) Robotics Institute Germany(德国机器人研究所)

专题命中 规划推理 :planning(abstract)

AI总结 提出PhyRoGen框架,利用程序化内容生成自动创建机器人操作谜题的合成数据集,生成的24个谜题可在1-300秒内求解,并在物理仿真中验证可操作性。

Comments 8 pages, accepted at CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 372 篇

2606.21933 2026-06-23 cs.SD 新提交 94%

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

机构 * The Hong Kong University of Science and Technology(香港科技大学) China Mobile(中国移动) Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Nanjing University(南京大学)

专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

Comments 11 pages, ISCSLP 2026 challenge proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 92%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(title,abstract)

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16783 2026-06-16 cs.CV cs.AI cs.LG 新提交 91%

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理

Zhiqiang Zhou, Junliang Dai, Xu ling

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12220 2026-08-13 cs.CV cs.AI 新提交 90%

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

SCOUT:通过结构化思维链与多目标过程奖励解锁增强型空间推理能力

Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 SCOUT是结合结构化思维链与多目标过程奖励的视觉-语言模型,通过定制数据集训练,在空间推理任务上超越基线模型与GPT-4o,且具备跨图像、视频的泛化能力。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 90%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);verifier(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01709 2026-08-04 cs.CV 新提交 89%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 89%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22732 2026-07-28 cs.AI 新提交 88%

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

大语言模型游戏智能体中的空间推理:因果上下文和多步规划的影响

Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 研究基于大语言模型的游戏智能体在复杂任务中表现不佳的问题,通过实验验证因果提示增强和多步规划可提升胜率并控制延迟,引入新基准评估,发现较大模型定位更准,融入因果上下文和多步规划能优化性能与速度。

Comments To be published at COG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04575 2026-08-06 cs.CV cs.AI 新提交 87%

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

PhysMind:从视频到可执行世界的无训练物理推理框架

Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。

Comments 27 pages, 18 figures. Project page: https://physmind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 87%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08992 2026-06-09 cs.RO cs.AI cs.CV 新提交 87%

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Central South University(中南大学) Jiangsu University(江苏大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07987 2026-08-11 cs.CV 新提交 87%

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

优势引导门:重塑基于视觉的空间智能的开放式推理

Ling Lin, Yang Bai, Congcong Zhu, Jiangming Shi, Meng Wang, Yang Long, Jingrun Chen, Ling Shao, Huazhu Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学) Durham University(杜伦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(title,summary_cn)

AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10612 2026-06-10 cs.CV 新提交 87%

GaussTrace: Provenance Analysis of 3D Gaussian Splatting Models with Evidence-based LLM Reasoning

GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析

Haoliang Han, Ziyuan Luo, Renjie Wan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 87%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11691 2026-08-13 cs.LG cs.CL 新提交 86%

LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对原生RL训练多模态模型的隐私泄漏问题,提出基于熵动态的无训练推理时遗忘框架LEMUR,可更有效地抑制敏感信息在推理轨迹和答案中的泄漏,同时保留模型非敏感效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25000 2026-06-25 cs.LG cs.AI physics.geo-ph 新提交 86%

Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks

Geo-Strat-RL:从可验证任务中学习地质事件推理

Lukas Mosser

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交 86%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-06 cs.CV cs.CL 新提交 85%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 85%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 85%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 85%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏