arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-31 至 2026-03-31 共收录 158 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 32 篇

2603.27813 2026-03-31 cs.CV 78%

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21418 2026-03-31 cs.MA 78%

FUAS-Agents: Autonomous Multi-Modal LLM Agents for Treatment Planning in Focused Ultrasound Ablation Surgery

FUAS-代理:自主多模态大语言模型代理用于聚焦超声消融手术的治疗计划

Lina Zhao, Zihao Bian, Qingyue Chen, Yafang Li, Zhiyi Luo, Jiaxing Bai, Guangbo Li, Min He, Kezhi Li, Huaiyuan Yao, Zongjiu Zhang

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出FUAS-代理,利用大语言模型的多模态理解和工具使用能力,通过整合患者资料和MRI数据,生成个性化治疗计划,提升临床决策效率和可靠性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27751 2026-03-31 cs.AI 74%

SkyNet: Belief-Aware Planning for Partially-Observable Stochastic Games

SkyNet:基于信念的规划用于部分可观测随机博弈

Adam Haile

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 SkyNet通过引入自我条件辅助头,改进了MuZero在部分可观测随机博弈中的规划能力,其在Skyjo游戏中实现了显著的胜率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26953 2026-03-31 astro-ph.EP astro-ph.IM cs.AI cs.ET cs.LG 73%

ASTER -- Agentic Science Toolkit for Exoplanet Research

ASTER -- 用于系外行星研究的代理科学工具包

Emilie Panek, Alexander Roman, Gaurav Shukla, Leonardo Pagliaro, Katia Matcheva, Konstantin Matchev

机构 * University of Alabama(阿拉巴马大学) University of Padova(帕多瓦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ASTER通过整合AI代理与领域专用工具,为系外行星大气分析提供统一平台,支持多步骤数据处理和检索任务。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV 71%

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

专题命中 规划推理 :planning(title)

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15109 2026-03-31 cs.SI cs.AI cs.CY cs.HC cs.MA 70%

An Agentic Operationalization of DISARM for FIMI Investigation on Social Media

针对FIMI调查的社会媒体的代理操作化DISARM

Kevin Tseng, Juan Carlos Toledano, Bart De Clerck, Yuliia Dukach, Phil Tinn

机构 * Center of Research Acquisition National Institute of Cyber Security Taipei City, Taiwan Department of Mathematics Royal Military Academy Brussels, Belgium Research Division OpenMinds Ltd. Kyiv, Ukraine Department of Sustainable Communication Technologies SINTEF Oslo, Norway (Corresponding Author)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的DISARM操作化框架,用于社会媒体上的FIMI调查。通过整合通用代理AI组件,实现对社交媒体数据中操纵性行为的识别和映射,提升分析效率和可解释性。

Comments This paper was originally presented at the International Conference on Military Communication and Information Systems (ICMCIS), organized by the Information Systems Technology (IST) Scientific and Technical Committee, IST-224-RSY---the ICMCIS, held in Bath, United Kingdom, 12-13 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27410 2026-03-31 q-bio.NC cs.AI cs.CV 70%

Grounding Social Perception in Intuitive Physics

将社会感知 grounded 在直观物理学中

Lance Ying, Aydan Y. Huang, Aviv Netanyahu, Andrei Barbu, Boris Katz, Joshua B. Tenenbaum, Tianmin Shu

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出通过结合直观心理学与直观物理学的推理过程来解释社会感知,通过PHASE数据集和SIMPLE模型验证了物理基础的社会推理能力。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26997 2026-03-31 cs.RO cs.HC 67%

ROSClaw: An OpenClaw ROS 2 Framework for Agentic Robot Control and Interaction

ROSClaw: 一种用于代理机器人控制与交互的OpenClaw ROS 2框架

Irvin Steve Cardenas, Marcus Anthony Arnett, Natalie Catherine Yeo, Lucky Sah, Jong-Hoon Kim

机构 * Advanced Telerobotics Research Lab, Kent State University(肯特州立大学先进远程机器人研究实验室) OpenDive Technologies

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 ROSClaw通过整合OpenClaw代理运行时与ROS 2,实现任意基础模型与ROS-enabled机器人之间的交互,支持动态能力发现、多模态观察归一化、预执行动作验证和结构化审计日志,验证了执行层设计对任务完成与安全行为的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10465 2026-03-31 cs.CL cs.AI 62%

Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks

超越启发:基于供应的提示优化用于知识密集型任务

Yunzhe Xu, Zhuosheng Zhang, Zhe Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KPPO框架,通过系统整合知识而非潜在启发来优化提示,解决知识密集型任务中静态知识容量的局限,提升性能并降低token消耗。

Comments Accepted by IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27991 2026-03-31 cs.HC cs.AI 57%

ViviDoc: Generating Interactive Documents through Human-Agent Collaboration

ViviDoc:通过人机协作生成交互式文档

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Yue Cheng, Wei Chen

机构 * National University of Singapore(新加坡国立大学) University of Virginia(弗吉尼亚大学) Cornell University(康奈尔大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ViviDoc通过多智能体流程和三级人类控制,系统性解决交互式文档生成问题,构建了ViviBench基准并实现高内容丰富度和交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11524 2026-03-31 cs.AI 57%

Inspire or Predict? Exploring New Paradigms in Assisting Classical Planners with Large Language Models

激励还是预测?探索利用大语言模型辅助经典规划器的新范式

Wenkai Yu, Jianhang Tang, Yang Zhang, Yixiong Feng, Celimuge Wu, Kebing Jin, Hankz Hankui Zhuo

机构 * State Key Laboratory of Public Big Data, Guizhou University(贵州大学公共大数据国家重点实验室) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) School of Mechanical Engineering, Guizhou University(贵州大学机械工程学院) Meta-Networking Research Center, The University of Electro-Communications(电气通信大学元网络研究中心) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种集成问题分解的新型LLM辅助规划器,通过LLM4Inspire和LLM4Predict两种范式,结合通用知识和领域知识,有效解决大规模规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27738 2026-03-31 cs.AI 57%

TianJi:An autonomous AI meteorologist for discovering physical mechanisms in atmospheric science

TianJi:一种自主AI气象学家,用于发现大气科学中的物理机制

Kaikai Zhang, Xiang Wang, Haoluo Zhao, Nan Chen, Mengyang Yu Jing-Jia Luo, Tao Song, Fan Meng

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) State Key Laboratory of Climate System Prediction and Risk Management (CPRM), Nanjing University of Information Science and Technology(南京信息工程大学气候系统预测与风险管理国家重点实验室) College of Computer Science and Technology, China University of Petroleum(中国石油大学计算机科学与技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 TianJi通过自主驱动复杂数值模型验证物理机制,实现零人工干预的高效大气科学研究,压缩研究周期至数小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI 57%

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27563 2026-03-31 cs.HC cs.AI 57%

InnerPond: Fostering Inter-Self Dialogue with a Multi-Agent Approach for Introspection

InnerPond:通过多智能体方法促进跨自我对话的内省研究

Hayeon Jeon, Dakyeom Ahn, Sunyu Pang, Yunseo Choi, Suhwoo Yoon, Joonhwan Lee, Eun-mee Kim, Hajin Lim

机构 * hci+d lab.(hci+d 实验室) Seoul National University(首尔国立大学) Department of Communication(传播学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 InnerPond通过多智能体系统探索自我多重性,用户通过与AI共同创作内在声音和对话,揭示了支持内省的AI工具设计方法。

Comments 25 pages, 10 figures, Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27104 2026-03-31 q-bio.QM cs.AI cs.IR 57%

Autonomous Agent-Orchestrated Digital Twins (AADT): Leveraging the OpenClaw Framework for State Synchronization in Rare Genetic Disorders

自主代理协调数字孪生(AADT):利用OpenClaw框架实现罕见遗传病中的状态同步

Hongzhuo Chen, Zhanliang Wang, Quan M. Nguyen, Gongbo Zhang, Chunhua Weng, Kai Wang

机构 * Raymond G. Perelman Center for Cellular and Molecular Therapeutics, Children's Hospital of Philadelphia(费城儿童医院雷蒙德·G·佩雷尔曼细胞与分子治疗中心) Applied Mathematics and Computational Science Graduate Program, University of Pennsylvania(宾夕法尼亚大学应用数学与计算科学研究生项目) Bioengineering Graduate Program, University of Pennsylvania(宾夕法尼亚大学生物工程研究生项目) Department of Biomedical Informatics, Columbia University Irving Medical Center(哥伦比亚大学欧文医学中心生物医学信息学系) Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院病理学与实验医学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于OpenClaw框架的自主代理协调数字孪生框架,通过持续监控数据流和自动化工作流,实现医疗数字孪生状态与纵向表型更新和进化基因组知识的同步,提升罕见病诊断和疾病进展建模的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21045 2026-03-31 cs.AI cs.DB cs.IR 57%

From Questions to Queries: An AI-powered Multi-Agent Framework for Spatial Text-to-SQL

从问题到查询:一种基于AI的多智能体框架用于空间文本到SQL

Ali Khosravi Kazazi, Zhenlong Li, M. Naser Lessani, Guido Cervone

机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学地理系地理信息与大数据研究实验室) Institute for Computational and Data Sciences and Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学计算与数据科学研究所及地理系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的多智能体框架,解决空间文本到SQL中的复杂问题,通过分阶段解释、模式绑定、逻辑规划和执行审查提升空间查询的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19372 2026-03-31 stat.ML cs.LG 57%

On the Hardness of Reinforcement Learning with Transition Look-Ahead

强化学习中过渡前瞻的难度

Corentin Pla, Hugo Richard, Marc Abeille, Nadav Merlis, Vianney Perchet

机构 * CREST, ENSAE(CREST,ENSAE) Criteo AI Lab(Criteo AI实验室) FairPlay Joint Team(FairPlay联合团队) Technion(以色列理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究了强化学习中利用过渡前瞻的信息对性能的影响,证明了一步前瞻可在线性规划中解决,而两步及以上前瞻则为NP难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI 57%

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13242 2026-03-31 cs.CY 50%

AI Unplugged: Embodied Interactions for AI Literacy in Higher Education

AI 无插件:面向高等教育的具身互动以促进AI素养

Jennifer M. Reddig, Scott Moon, Kaitlyn Crutcher, Christopher J. MacLellan

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种将具身无插件活动融入大学AI入门课程的新教学方法,通过互动游戏帮助学生理解AI概念,促进概念与技术技能的结合。

Journal ref In Proceedings of the AAAI Conference on Artificial Intelligence (Vol. 40, No. 47, pp. 40679-40687). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28508 2026-03-31 cs.CV 50%

Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree

基于大模型和模糊决策树的AI生成图像通用检测

Fei Wu, Guanghao Ding, Zijian Niu, Zhenrui Wang, Lei Yang, Zhuosheng Zhang, Shilin Wang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28156 2026-03-31 cs.RO 50%

Reducing Mental Workload through On-Demand Human Assistance for Physical Action Failures in LLM-based Multi-Robot Coordination

通过按需人类协助减少LLM多机器人协调中的心理负荷

Shoichi Hasegawa, Akira Taniguchi, Lotfi El Hafi, Gustavo Alfonso Garcia Ricardez, Tadahiro Taniguchi

机构 * Ritsumeikan University(立命馆大学) Kyoto University(京都大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出REPAIR框架,通过在LLM多机器人规划中集成远程错误修复,提升任务进度并减少操作员心理负荷。

Comments Under review in IEEE RO-MAN 2026. Project page is https://emergentsystemlabstudent.github.io/REPAIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14790 2026-03-31 cs.CV 50%

Mind-of-Director: Multi-modal Agent-Driven Film Previsualization via Collaborative Decision-Making

导演之思:通过协作决策的多模态代理驱动电影预可视化

Shufeng Nan, Mengtian Li, Sixiao Zheng, Yuwei Lu, Han Zhang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai University(上海大学)

专题命中 规划推理 :planning(abstract)

AI总结 Mind-of-Director通过协作决策过程生成高质量的电影预可视化序列,结合多个专业代理在游戏引擎中协作生成预可视化内容,提升自动化原型制作和人机协同电影制作的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 50%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 规划推理 :reasoning(abstract)

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 14 篇

2603.26742 2026-03-31 cs.CL cs.LG 84%

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计

Swastik R

机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。

Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV 82%

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 78%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 78%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 78%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 67%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 62%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏