arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 341 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 68 篇

2604.16316 2026-04-21 cs.CY cs.IR 50%

CrossTraffic: An Open-Source Framework for Reproducible and Executable Transportation Analysis and Knowledge Management

CrossTraffic: 一个用于可重复和可执行交通分析与知识管理的开源框架

Rei Tamaru, Bin Ran

专题命中 规划推理 :planning(abstract)

AI总结 本文提出CrossTraffic开源框架,通过标准化接口实现交通方法的可部署和可验证软件基础设施,结合知识图谱和对话接口提升分析精度与协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10029 2026-04-21 cs.IR 50%

Self-Distilled Reinforcement Learning for Co-Evolving Agentic Recommender Systems

基于共演代理推荐系统的自我蒸馏强化学习

Zongwei Wang, Min Gao, Hongzhi Yin, Junliang Yu, Tong Chen, Quoc Viet Hung Nguyen, Shazia Sadiq, Tianrui Li

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出CoARS框架,通过交互奖励和自我蒸馏信用分配,解决传统ARs在交互性和轨迹监督方面的不足,提升推荐性能和用户对齐度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04816 2026-04-21 cs.IR 50%

Scaling Laws for Cross-Encoder Reranking

交叉编码器重排序的扩展定律

Rahul Seetharaman, Aman Bansal, Hamed Zamani, Kaustubh Dhole

专题命中 规划推理 :planning(abstract)

AI总结 本文研究了交叉编码器重排序在点wise、pairwise和listwise目标下的扩展定律,通过模型规模和训练暴露量的分析,揭示了排序质量的幂律关系,并通过预测大模型性能验证了数据密集型扩展策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 30 篇

2511.21064 2026-04-21 cs.AI cs.CV 90%

OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection

OVOD-Agent:一种用于主动视觉推理和自进化检测的马尔可夫-多臂框架

Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He

机构 * Wuhan University(武汉大学)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出OVOD-Agent框架,通过将文本优化扩展为可解释的视觉CoT,结合弱马尔可夫决策过程和多臂模块,实现主动视觉推理和自进化检测,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV 85%

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17385 2026-04-21 cs.CV 85%

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17407 2026-04-21 cs.RO 82%

Think before Go: Hierarchical Reasoning for Image-goal Navigation

先思后行:面向图像目标导航的层次推理

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所、西安交通大学) University of Macau(澳门大学) Xiaomi EV(小米电动车) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出HRNav框架,通过分层规划与执行解决图像目标导航问题,利用视觉语言模型生成短期计划并结合在线强化学习策略,引入Wandering Suppression Penalty降低漂移问题,实验验证其有效性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 80%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02972 2026-04-21 cs.CV cs.RO 78%

TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation

TagaVLM:面向视觉语言导航的拓扑感知全局动作推理

Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu, Baocai Yin

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) Imperial College London, U.K.(伦敦帝国理工学院,英国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 TagaVLM通过引入拓扑结构增强视觉语言模型,提升空间推理能力,在R2R基准中取得最佳性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16617 2026-04-21 cs.CV cs.MM cs.SD 78%

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

AVRT:通过单模态教师模型实现音频-视觉推理迁移

Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * University of Tübingen, Germany(图宾根大学) MIT, Cambridge MA, USA(麻省理工学院) IBM Research, USA(IBM研究院) MIT-IBM Watson AI Lab, USA(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center, Germany(图宾根人工智能中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AVRT框架,通过单模态教师模型生成高质量音频-视觉推理轨迹,并利用LLM合并模型整合轨迹,从而在多模态设置中实现推理迁移,取得音视频和音频任务的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 71%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-04-21 cs.AI cs.GR cs.MA 70%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17190 2026-04-21 cs.CV 67%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20879 2026-04-21 cs.CV 67%

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

DriveAgent-R1: 通过主动感知和混合思维推进基于视觉语言模型的自动驾驶

Weicheng Zheng, Xiaofei Mao, Nanfei Ye, Pengxiang Li, Kun Zhan, Xianpeng Lang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) LiAuto Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 DriveAgent-R1通过主动感知和混合思维框架,提升自动驾驶中的视觉推理能力,采用三阶段训练策略,在复杂场景中实现高效决策,展现与顶级模型相当的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00065 2026-04-21 cs.CL cs.AI 62%

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

使用视角词比词汇词对人类更困难,甚至对多模态语言模型更为困难

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和多模态语言模型在使用词汇、所有格和指示词时的认知负荷,发现视角词对两者都更难,且多模态模型在所有格和指示词上表现更差,揭示了其在常识和社交认知能力上的不足。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16421 2026-04-21 cs.CL cs.AI 62%

Measuring Representation Robustness in Large Language Models for Geometry

在大型语言模型中测量几何表示的鲁棒性

Vedant Jawandhia, Yash Sinha, Murari Mandal, Ankan Pal, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比特学院计算机科学与信息系统系) School of Computer Science, KIIT University(KIIT大学计算机科学学院) Department of Mathematics, BITS Pilani(比特学院数学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GeoRepEval框架,评估几何问题在不同表示形式下的正确性、不变性和一致性,发现表示选择对模型性能有显著影响,尤其在向量形式上表现脆弱,通过提示干预可提升高容量模型性能,但低容量模型无明显改进。

Comments 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11811 2026-04-21 cs.CL cs.AI cs.CV cs.CY 62%

Enhancing Geo-localization for Crowdsourced Flood Imagery via LLM-Guided Attention

通过LLM引导注意力增强 crowdsourced 洪水影像的地理定位

Fengyi Xu, Jun Ma, Waishan Qiu, Cui Guo, Jack C. P. Cheng

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系) Urban Systems Institute, The University of Hong Kong(香港大学都市系统研究所) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港理工大学土木与环境工程系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPR-AttLLM框架,通过整合大语言模型的语义推理与地理知识,提升 crowdsourced 洪水影像的地理定位精度,实验表明在真实洪水影像上召回率提升1-3%,最高达8%。

Comments Updated author list to include additional contributor. Revised title and improved methodology section based on collaborative feedback

Journal ref Computers, Environment and Urban Systems, 127, 102434 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17846 2026-04-21 cs.CV cs.AI 57%

AI Approach for MRI-only Full-Spine Vertebral Segmentation and 3D Reconstruction in Paediatric Scoliosis

基于AI的MRI-only全脊柱椎体分割及3D重建在儿童脊柱侧弯中的应用

Nathasha Naranpanawa, Maree T. Izatt, Robert D. Labrom, Geoffrey N. Askin, J. Paige Little

机构 * Biomechanics and Spine Research Group, School of Mechanical, Medical, and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物力学与脊柱研究组,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Centre for Biomedical Technologies, School of Mechanical, Medical and Process Engineering, Faculty of Engineering, Queensland University of Technology(生物医学技术中心,机械、医学与过程工程学院,工程学院,昆士兰理工大学) Orthopaedics Department, Queensland Children’s Hospital(骨科部门,昆士兰儿童医院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种AI框架,通过GAN将低剂量CT转换为MRI图像,结合已有MRI数据训练U-Net模型,实现全脊柱3D重建,提升分割精度并缩短处理时间,支持无辐射的脊柱侧弯评估。

Comments Presented at 2026 Spine Society of Australia 37th Annual Scientific Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL 57%

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17375 2026-04-21 cs.CV cs.AI 57%

When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉

Cui Yakun, Xingqun Qi, TianTian Geng, Yuyao Zhang, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Birmingham(伯明翰大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17054 2026-04-21 cs.CV cs.AI 57%

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16967 2026-04-21 cs.RO cs.AI 57%

NaviFormer: A Deep Reinforcement Learning Transformer-like Model to Holistically Solve the Navigation Problem

NaviFormer:一种深度强化学习变换器模型,以整体解决导航问题

Daniel Fuertes, Andrea Cavallaro, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

机构 * Grupo de Tratamiento de Imágenes, Information Processing and Telecommunications Center, ETSI Telecomunicación, Universidad Politécnica de Madrid(图像处理与电信中心,信息处理与电信中心,电信工程学院,马德里理工大学) Idiap Research Institute(Idiap研究机构)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 NaviFormer通过预测高层路线和底层轨迹,整体解决导航问题,实验表明其在准确性和计算速度上表现优异,适用于实时任务。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 57%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16576 2026-04-21 cs.IR cs.CL 57%

On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability

基于LLM的密集检索器的鲁棒性:通用性和稳定性系统分析

Yongkang Li, Panagiotis Eustratiadis, Yixing Fan, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Chinese Academy of Sciences(中国科学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文系统分析了基于LLM的密集检索器的通用性和稳定性,发现指令微调模型在复杂推理任务中存在'专业化税',而嵌入几何结构对鲁棒性有预测作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 50%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17888 2026-04-21 cs.RO 50%

SpaceDex: Generalizable Dexterous Grasping in Tiered Workspaces

SpaceDex:在分层工作空间中的通用灵巧抓取

Wensheng Wang, Chuanjun Guo, Wei Wei, Tong Wu, Ning Tan

机构 * Sun Yat-sen University(中山大学) Stellarobot Company(Stellarobot公司)

专题命中 视觉空间推理 :planning(abstract)

AI总结 SpaceDex提出了一种分层框架,通过视觉-语言模型规划和臂手特征分离网络,提升在受限3D环境中的灵巧抓取性能,实现在100次真实测试中达到63%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17887 2026-04-21 cs.RO 50%

StableIDM: Stabilizing Inverse Dynamics Model against Manipulator Truncation via Spatio-Temporal Refinement

StableIDM:通过时空细化稳定逆动力学模型以对抗机械臂截断

Kerui Li, Zhe Jing, Xiaofeng Wang, Zheng Zhu, Yukun Zhou, Guan Huang, Dongze Li, Qingkai Yang, Huaibo Huang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所GigaAI研究院) Beijing Institute of Technology(北京理工大学) GigaAI Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出StableIDM,通过时空细化框架提升逆动力学模型在机械臂截断场景下的稳定性,实验表明其在动作准确性和任务成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17422 2026-04-21 cs.CV cs.MM 50%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏