arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2604.18715 2026-04-22 cs.CL cs.AI 81%

Characterizing AlphaEarth Embedding Geometry for Agentic Environmental Reasoning

表征AlphaEarth嵌入几何用于代理环境推理

Mashrekur Rahman, Samuel J. Barrett, Christina Last

机构 * Dartmouth Libraries(达特茅斯图书馆) Dartmouth College(达特茅斯学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究AlphaEarth嵌入几何结构,开发代理系统用于环境推理,发现其非欧几里得特性及检索优于线性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16343 2026-04-22 cs.CV cs.AI cs.MA 79%

Visual Reasoning Agent: Robust Vision Systems in Remote Sensing via Inference-Time Scaling

视觉推理代理:通过推理时缩放实现遥感中的稳健视觉系统

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(西弗吉尼亚大学) United States Military Academy(美国军事学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出视觉推理代理(VRA),通过迭代的Think-Critique-Act循环,结合预训练的大规模视觉-语言模型和推理模型,提升遥感任务中的视觉推理能力,实现在挑战性问题上的40.67%提升。

Comments Accepted to MORS 2026 Artificial Intelligence Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 78%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19302 2026-04-22 cs.CV 78%

Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing

弥合语义与几何:一种解耦的LVLM-SAM框架用于光学遥感中的推理分割

Xu Zhang, Junyao Ge, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University, Xi'an, Shaanxi 710071, China(西安电子科技大学电子工程学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出解耦的LVLM-SAM框架,通过结构化几何提示优化,提升光学遥感中推理分割的性能,实现语义与几何的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18566 2026-04-22 cs.AI cs.HC cs.LG 62%

Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion

对系统动力学AI助手的基准测试:云与本地LLM在CLD提取与讨论中的比较

Terry Leitch

机构 * Ruxton AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了云和本地LLM在系统动力学AI助手中的表现,发现本地模型在CLD提取和讨论任务中表现不一,且后端选择对性能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG 62%

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG 57%

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19145 2026-04-22 cs.CV cs.AI 57%

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪

Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carizon Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19052 2026-04-22 cs.CL 57%

Cell-Based Representation of Relational Binding in Language Models

基于细胞的语言模型中关系绑定的表示

Qin Dai, Benjamin Heinzerling, Kentaro Inui

机构 * Tohoku University(东大大学) RIKEN(日本科学技術研究所) AIP(Advanced Institute for Prognostic Studies) MBZUAI(马克斯·普朗克研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示语言模型通过细胞绑定表示进行关系绑定,通过多句子数据验证了细胞子空间的可解码性及跨上下文迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS 57%

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20279 2026-04-22 cs.CV cs.CL 57%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19034 2026-04-22 cs.CV 50%

Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents

像人类一样探索:面向具身智能体的在线SG-Memo构建自主探索

Xu Chen, Shichao Xie, Zhining Gu, Lu Jia, Minghua Luo, Fei Liu, Zedong Chu, Yanfen Shen, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ABot-Explorer框架,通过在线RGB-only过程统一记忆构建与探索,利用VLMs提取语义导航 affordances,生成结构化SG-Memo以提升探索效率和环境覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18623 2026-04-22 cs.CV 50%

Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching

我们能否构建场景图,而不是分类它们?FlowSG:基于流匹配的渐进式图像条件场景图生成

Xin Hu, Ke Qin, Wen Yin, Yuan-Fang Li, Ming Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Tianfu Jiangxi Laboratory(天斧江西实验室) Monash University(墨尔本大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FlowSG,将场景图生成视为连续时间传输任务,通过约束感知细化生成图像条件场景图,结合几何与语义,提升场景图生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20530 2026-04-22 cs.RO cs.CV 50%

Memory Over Maps: 3D Object Localization Without Reconstruction

记忆超越映射:无需重建的3D物体定位

Rui Zhou, Xander Yap, Jianwen Cao, Allison Lau, Boyang Sun, Marc Pollefeys

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无需重建的3D物体定位方法,通过轻量级视觉记忆实现快速场景索引,显著降低预处理成本,验证了基于图像的场景记忆可替代密集3D重建。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏