arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2605.18419 2026-07-08 cs.CV cs.AI 版本更新 57%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04344 2026-07-07 cs.CV cs.AI 新提交 57%

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04222 2026-07-07 cs.AI 新提交 57%

Unsupervised Features Mining via Activation Geometry

通过激活几何进行无监督特征挖掘

Amit LeVi, Elad David, Max Fomin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍通过激活几何挖掘(MAG)的无监督框架,在输入前加指令Q,用m(Q∣p)-m(p)衡量其对模型内部表征的影响,探索多种MAG,所提取特征可预测模型理解与判断,还用于选择最佳训练数据集。

Journal ref ICML 2026, workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16559 2026-07-07 cs.AI 57%

BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction

BuildArena: 一个对齐物理的LLM交互基准,用于工程建造

Tian Xia, Tianrun Gao, Wenhao Deng, Long Wei, Xiaowei Qian, Chenglei Yu, Tailin Wu

机构 * Tian Xia(夏天) Tianrun Gao(高天run) Wenhao Deng(邓文浩) Long Wei(韦龙) Xiaowei Qian(钱小伟) Chenglei Yu(于成磊) Tailin Wu(吴太林)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出BuildArena,一个首个对齐物理的LLM交互基准,用于语言驱动的工程建造,通过可扩展的任务设计策略和3D空间几何计算库,评估九个前沿LLM在语言驱动和物理基础的自动化建造中的能力。

Comments ICML 2026, 36 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 57%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01754 2026-07-03 cs.AI 新提交 57%

Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation

路径级事后指令用于视觉语言导航中的语义探索

Sung June Kim, Sangpil Kim, Honglak Lee

机构 * Korea University(高丽大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Phi-Nav框架,通过事后推理将指令与智能体实际探索轨迹对齐,利用三阶段双监督循环将语义未标记的运动转化为密集训练信号,在R2R-CE和RxR-CE基准上以少量专家演示取得竞争性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01654 2026-07-02 cs.CV cs.AI cs.MM 版本更新 57%

Moiré Video Authentication: A Physical Signature Against AI Video Generation

摩尔视频认证:一种对抗AI视频生成的物理签名

Yuan Qing, Kunyu Zheng, Lingxiao Li, Boqing Gong, Chang Xiao

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30632 2026-06-30 cs.RO cs.AI cs.CV 57%

GROW$^2$: Grounding Which and Where for Robot Tool Use

GROW$^2$:为机器人工具使用确定哪个物体和哪个部位

Yuhong Deng, Yuyao Liu, David Hsu

机构 * National University of Singapore(新加坡国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GROW$^2$方法,通过分层语义和几何接地实现开放世界工具选择与部位定位,在零样本泛化中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29340 2026-06-30 cs.AI 57%

PHF: Privileged Hidden Flow for On-Policy Self-Distillation

PHF: 用于在线自蒸馏的特权隐藏流

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六十三研究所,南京)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出特权隐藏流(PHF),通过对齐教师和学生的隐藏状态轨迹(而非逐点匹配),在在线自蒸馏中提升推理性能,在Qwen3模型上获得约+1.5至+2.2点的提升。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28524 2026-06-30 cs.CL 57%

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

Transformer语言模型中情境建模与心理推理的发展轨迹

Pamela D. Rivière, Cameron Jones, Sean Trott

机构 * Rutgers University - Newark(新泽西州立大学罗格斯大学-新ark分校) Stony Brook University(史泰文斯布鲁克大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文从发展视角研究大型语言模型在虚假信念任务中的表现,发现其依赖于模型大小和训练量,且后期训练提升显著,但情境建模能力先于并优于心理推理,且两者均存在脆弱性。

Comments Non-archival submission to the First Workshop on Computational Developmental Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05689 2026-06-30 cs.CV cs.AI 57%

CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration

CRFT:用于跨模态图像配准的一致-递归特征流变换器

Xuecong Liu, Mengzhu Ding, Zixuan Sun, Zhang Li, Xichao Teng

机构 * Northeastern University, China(东北大学(中国)) National University of Defense Technology, China(国防科技大学(中国))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CRFT提出了一种基于特征流学习的统一粗到细框架,通过特征对齐和流估计实现鲁棒的跨模态图像配准,通过多尺度特征相关性和层次特征融合提升精度和鲁棒性。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 34784-34794

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28083 2026-06-29 cs.CV cs.AI cs.GR cs.HC cs.MM 新提交 57%

STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition

STAG:面向微表情识别的动作单元时空演化结构表示

Nandani Sharma, Varun Sharma, Dinesh Singh

机构 * Vision Intelligence and Machine Learning (VIML) Group, School of Computing and Electrical Engineering, Indian Institute of Technology Mandi(印度理工学院曼迪分校计算与电气工程学院视觉智能与机器学习(VIML)实验室) Indian Institute of Information Technology Bhagalpur(印度信息技术学院巴加尔普尔分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出STAG网络,通过光流选择、双分支架构(图注意力+Transformer)和AU引导动态连接,联合建模空间与时间信息,提升微表情识别的鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26964 2026-06-29 cs.AI cs.CV 新提交 57%

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds

Look-Before-Move:动态3D故事世界中的叙事驱动世界视觉注意力

Jiaming Bian, Bingliang Li, Yuehao Wu, Pichao Wang, Zhi Wang, Hailan Ma, Huadong Mo, Zhenhong Sun

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 提出Look-Before-Move框架,通过语义观察合约、蒙特卡洛视点搜索和语义轨迹接地,在动态3D故事世界中实现叙事驱动的视觉注意力规划,提升主体感知、意图一致性和轨迹质量。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 57%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14397 2026-06-26 cs.LG 新提交 57%

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

Running the Gauntlet: 重新评估智能体在陌生环境中的能力

Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi

机构 * University of Oxford(牛津大学) SoftServe Massachusetts Institute of Technology(麻省理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) UK AI Security Institute(英国人工智能安全研究所) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GauntletBench基准,通过20个视觉密集型任务评估智能体在时间感知、图形理解和3D推理等未被充分探索的能力,发现最先进智能体成功率仅19.1%,远低于人类80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25391 2026-06-25 cs.SD cs.AI cs.MM 新提交 57%

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CASU基准,通过构建半合成音频流和设计四项任务,评估大型音频语言模型整合语音、事件和背景环境进行上下文感知听觉场景理解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07904 2026-06-25 cs.LG cs.CV cs.NE 版本更新 57%

Kuramoto Oscillatory Phase Encoding: Neuro-inspired Synchronization for Improved Learning Efficiency

Kuramoto振荡相位编码:神经启发同步机制提升学习效率

Mingqing Xiao, Yansen Wang, Dongqi Han, Caihua Shan, Dongsheng Li

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Kuramoto振荡相位编码(KoPE),为视觉Transformer引入神经启发同步机制,通过增强结构学习提升训练、参数和数据效率,并在语义分割、少样本推理等任务中取得优势。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 57%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17046 2026-06-24 cs.RO cs.CV cs.LG 新提交 57%

Geometric Action Model for Robot Policy Learning

几何动作模型用于机器人策略学习

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

机构 * KAIST AI(韩国科学技术院人工智能学院) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出几何动作模型(GAM),通过重用预训练几何基础模型(GFM)作为共享骨干,实现语言条件下的操作策略,在仿真和真实机器人任务中优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/Geometric-Action-Model/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23345 2026-06-23 cs.AI 新提交 57%

Abstract representational geometry supports inference in large language models

抽象表征几何支持大型语言模型中的推理

Yunan Zeng, Yuwang Wang

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过文本版情境反转学习范式,比较人类与LLM的行为和表征,发现LLM内部状态在推理时形成类似海马体的抽象几何结构,且该结构分层组织,高层次表征与推理相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21939 2026-06-23 cs.CL 新提交 57%

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

超越价值基准:通过对称Q分类测量大型语言模型中的价值结构对齐

Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出基于Q方法的对称人机评估框架,通过140项道德陈述的强制分布排序,测量LLM价值结构对齐,发现跨家族异质性和局部错位。

Comments 32 pages, 8 figures, 16 tables; accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 57%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13236 2026-06-23 cs.CL 版本更新 57%

IfcLLM: Natural Language Querying of IFC Models through Complementary Relational and Graph Representations

一种融合关系和图表示的IFC模型自然语言查询混合框架

Rabindra Lamsal, Sisi Zlatanova, Haowen Xu, Yafei Sun, Johnson Xuesong Shen

机构 * GRID Lab, School of Built Environment, The University of New South Wales(建筑环境学院,新南威尔士大学GRID实验室) School of Civil and Environmental Engineering, The University of New South Wales(土木与环境工程学院,新南威尔士大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出IfcLLM混合框架,通过关系和图表示结合迭代推理,提升非专家用户对IFC模型的自然语言查询能力,并支持常规BIM分析任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05833 2026-06-19 cs.CV cs.AI 版本更新 57%

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

从视频中学习几何表示以实现空间智能多模态大语言模型

Haibo Wang, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GeoVR框架,通过从2D视频序列中蒸馏3D几何知识(包括相机姿态、深度图、尺度因子和多尺度3D特征),重塑多模态大语言模型的内部表示以赋予其空间智能,在空间推理基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15513 2026-06-18 cs.RO cs.AI 57%

HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering

HIMM:面向具身探索与问答的人类启发式长期记忆建模

Ji Li, Bo Wang, Jing Xia, Mingyi Li, Shiyan Hu

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HIMM模型,通过分离事件记忆与语义记忆,提升具身智能在长期观察和有限上下文下的探索与问答能力,实验显示在多个基准测试中表现优异。

Journal ref IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18231 2026-06-17 cs.CV cs.LG cs.RO 新提交 57%

Adaptive Volumetric Mechanical Property Fields Invariant to Resolution

自适应体积力学属性场:分辨率无关

Rishit Dagli, Donglai Xiang, Vismay Modi, Xuning Yang, Gavriel State, David I. W. Levin, Maria Shugrina

机构 * NVIDIA(英伟达)

专题命中 视觉空间推理 :test-time compute(abstract);分类 cs.LG

AI总结 提出AdaVoMP方法,利用稀疏自适应体素结构和自回归Transformer编解码器,为3D物体预测高分辨率空间变化的杨氏模量、泊松比和密度,相比现有技术分辨率提升16^3倍且更准确。

Comments Project Page and hi-res paper: https://research.nvidia.com/labs/sil/projects/adavomp/. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17871 2026-06-17 cs.AI 新提交 57%

StepGuard: Guarding Web Navigation via Single-Step Calibration

StepGuard: 通过单步校准保护网页导航

Zhihao Cui, Yuchen Zhang, Xiyang Sun, Yaxiong Wang, Li Zhu, Jinpeng Hu, Liu Liu, Mengjia Li, Yujiao Wu

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Xiamen University(厦门大学) Zhejiang Lab(之江实验室) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI

AI总结 针对网页导航中单步脆弱性问题,提出StepGuard框架,通过动态双策略优化(DDPO)解决奖励冲突,并利用置信度引导的自适应导航反射(CANR)校准单步误差,显著提升导航与答案准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03609 2026-06-17 cs.RO cs.LG 版本更新 57%

A 3D Isovist World Model -- Revealing a City's Unseen Geometry and Its Emergent Cross-City Signature

3D 等视域世界模型——揭示城市不可见几何及其涌现的跨城市特征

Xuhui Lin, Stephen Law, Nanjiang Chen, Kunyao Li, Tao Yang

机构 * The Bartlett School of Sustainable Construction University College London, UK(可持续建设学院伦敦大学学院,英国) Department of Geography University College London, UK(地理系伦敦大学学院,英国) School of Project Management, Faculty of Engineering The University of Sydney, AU(工程学院项目管理学院悉尼大学,澳大利亚) School of Engineering Cardiff University, UK(工程学院卡迪夫大学,英国) School of Architecture Tsinghua University, Beijing, CN(建筑学院清华大学,北京,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一种预测3D等视域(球形可见性深度图)的具身世界模型,通过深度残差和自滚动调度采样训练,发现跨城市空间特征可从时间潜变量中线性解码。

详情

展开后加载摘要…

URL PDF HTML 收藏