arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 105 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2603.15946 2026-03-18 cs.AI 57%

Argumentative Human-AI Decision-Making: Toward AI Agents That Reason With Us, Not For Us

论证型人机决策:迈向与我们共思而非为我们决策的AI代理

Stylianos Loukas Vasileiou, Antonio Rago, Francesca Toni, William Yeoh

机构 * New Mexico State University(新墨西哥州立大学) King's College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨论证型人机决策的新范式,结合论证框架挖掘、合成与推理,使AI代理能与人类进行辩证互动,提升高风险领域的人工智能可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC 57%

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15809 2026-03-18 cs.MA cs.AI 57%

Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks

不要信任固执的邻居:代理网络的安全框架

Samira Abedini, Sina Mavali, Lea Schönherr, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多代理系统中恶意代理传播虚假信息的风险,提出理论框架并通过实验验证了增加良性代理、提升固执度或降低对敌方信任可增强系统安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15707 2026-03-18 cs.SE cs.AI 57%

SEMAG: Self-Evolutionary Multi-Agent Code Generation

SEMAG:自演化多智能体代码生成

Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济发展实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SEMAG通过自演化多智能体框架提升代码生成适应性,实现更高准确率和更强的模型自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15623 2026-03-18 cs.IR cs.AI 57%

Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval

Finder:一种多模态AI驱动的制药数据检索框架

Suyash Mishra, Srikanth Patil, Satyanarayan Pati, Sagar Sahu, Baddu Narendra

机构 * Researcher, Global Product Strategy F. Hoffmann-La Roche Ltd. Basel, Switzerland(全球产品战略研究员 罗氏有限公司 巴塞尔,瑞士) Associate Vice President (Gen AI) Involead Services Pvt Ltd. Pune, India(高级副总裁(生成式人工智能) Involead服务私人有限公司 普纳,印度) Lead Data Scientist Involead Services Pvt Ltd. Delhi, India(首席数据科学家 Involead服务私人有限公司 德里,印度) Data Scientist Involead Services Pvt Ltd. Bhubaneswar, India(数据科学家 Involead服务私人有限公司 奇塔拉,印度)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Finder利用混合向量搜索统一文本、图像、音频和视频的检索,通过稀疏词汇和密集语义模型提升多模态内容处理能力,支持自然语言推理搜索,已处理超过29万文档、3.1万视频和1192音频文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 规划推理 :reasoning(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16382 2026-03-18 cs.CR 50%

Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models

旋转鲁棒性:一种对抗大语言模型位翻转攻击的无训练防御方法

Deng Liu, Song Chen

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出旋转鲁棒性(RoR),通过正交Householder变换对激活空间进行旋转,有效消除激活异常值与敏感权重之间的对齐,提升大语言模型的可靠性。

Comments 13 pages, 8 figures. Preprint. Under review at IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16054 2026-03-18 cs.DC 50%

inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference

inference-fleet-sim: 一个基于排队论的LLM推理舰队容量规划器

Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出inference-fleet-sim,结合分析排队模型与离散事件模拟,解决LLM推理GPU舰队的容量规划问题,通过物理感知的GPU性能模型和多种拓扑结构,实现实验验证。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10349 2026-03-18 cs.CV 50%

EmoStory: Emotion-Aware Story Generation

EmoStory:情感感知的故事生成

Jingyuan Yang, Rucong Chen, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(安全科学与工程学院,深圳大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EmoStory,一种情感感知的故事生成方法,通过两阶段框架整合基于代理的故事规划与区域感知生成,提升情感准确性、提示对齐和主体一致性。

Comments accepted to ICME

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21676 2026-03-18 cs.RO cs.NI 50%

Real-World Deployment of Cloud-based Autonomous Mobility Systems for Outdoor and Indoor Environments

云原生自主移动系统在户外和室内环境中的实际部署

Yufeng Yang, Minghao Ning, Keqi Shu, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour

机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯加拿大有限公司技术伙伴关系与创新部) Mechanical Engineering Department, University of Alberta(阿尔伯塔大学机械工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出云原生自主移动框架,通过基础设施智能传感与云计算协调提升自主操作能力,实验证明在城市环岛和医院类室内环境中的感知鲁棒性和安全性提升。

Comments This paper has been submitted to IEEE Robotics and Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 8 篇

2601.13029 2026-03-18 cs.CV 82%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16264 2026-03-18 cs.AI 57%

Adaptive Theory of Mind for LLM-based Multi-Agent Coordination

自适应理论 of mind 用于基于大语言模型的多智能体协调

Chunjiang Mu, Ya Zeng, Qiaosheng Zhang, Kun Shao, Chen Chu, Hao Guo, Danyang Jia, Zhen Wang, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应理论 of mind 机制,通过估计伙伴的理论 of mind 深度以提升多智能体协作效率,实验验证了该机制在多个任务中的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 57%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12633 2026-03-18 cs.CV cs.AI 57%

DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model

DiG:通过差异 grounding 提升多模态大语言模型的细粒度感知

Zhou Tao, Shida Wang, Yongxiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DiG框架,通过学习相似图像对的差异识别提升多模态大语言模型的细粒度感知能力,实验表明其在多个视觉感知基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18546 2026-03-18 cs.RO cs.AI 57%

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

EfficientNav: 面向设备端目标物体导航的导航地图缓存与检索

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出EfficientNav,通过语义感知记忆检索和离散记忆缓存技术,在设备端实现零样本目标物体导航,提升成功率并降低规划延迟。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO 57%

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15011 2026-03-18 cs.CV 50%

Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing

分子标识视觉提示与可验证强化学习用于化学反应图解析

Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Peking University(北京大学) South China Normal University(华南师范大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出IdtVP和Re3-DAPO方法,通过视觉提示和强化学习提升化学反应图解析的准确性和泛化能力,同时发布ScannedRxn基准数据集以评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22896 2026-03-18 cs.RO 50%

DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation

DySL-VLA:通过动态-静态层跳过实现高效的视觉-语言-动作模型推理以用于机器人操作

Zebin Yang, Yijiahao Qi, Tong Xie, Bo Yu, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究所) School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出DySL-VLA框架,通过动态跳过视觉-语言-动作层来降低计算成本,提升机器人操作任务的实时性能,实验表明在Calvin数据集上成功长度提升2.1%,参数减少85.7倍,速度提升3.75倍。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 8 篇

2509.25140 2026-03-18 cs.AI cs.CL 82%

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15641 2026-03-18 cs.AI cs.LG cs.NE 73%

Form Follows Function: Recursive Stem Model

形式追随功能:递归茎模型

Navid Hakimi

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 递归茎模型通过改变训练方式,使网络学习稳定且深度无关的转移算子,从而提升训练效率和测试时的推理能力。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15724 2026-03-18 cs.LG cs.AI 62%

Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models

Meta-TTRL:一种用于统一多模态模型中自改进测试时间强化学习的元认知框架

Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang, Jianzhong Shi, Yan Li, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Meta-TTRL通过元认知信号实现测试时间参数优化,提升统一多模态模型的自改进能力,在文本到图像生成任务中取得显著成果。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22629 2026-03-18 cs.CL cs.AI 62%

Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models

时间退火扰动采样:扩散语言模型的多样化生成

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Yiqiao Huang, Ivor Tsang, Yang You

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) National University of Singapore(新加坡国立大学) CFAR, Agency for Science, Technology and Research(科技研究局CFAR) University of California, Santa Barbara(加州大学圣芭芭拉分校) Harvard University(哈佛大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间退火扰动采样方法,通过在扩散过程中早期鼓励语义分支并逐步减少扰动,提升生成多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16216 2026-03-18 cs.CE cs.AI cs.ET 57%

Generative AI for Quantum Circuits and Quantum Code: A Technical Review and Taxonomy

生成式AI用于量子电路和量子代码:技术综述与分类

Juhani Merilehto

机构 * University of Vaasa(瓦萨大学) University of Turku(图尔库大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 综述13个生成系统和5个支持数据集,探讨量子电路和代码生成的分类与训练方法,发现生成系统在语法和语义层面有所覆盖,但缺乏对量子硬件的端到端评估。

Comments 20 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16207 2026-03-18 cs.AI 57%

Proactive Rejection and Grounded Execution: A Dual-Stage Intent Analysis Paradigm for Safe and Efficient AIoT Smart Homes

主动拒绝与 grounded 执行:一种双阶段意图分析范式用于安全高效的 AIoT 智能家居

Xinxin Jin, Zhengwei Ni, Zhengguo Sheng, Victor C. M. Leung

机构 * School of Information and Electronic Engineering (Sussex Artificial Intelligence Institute), Zhejiang Gongshang University(信息与电子工程学院(Sussex人工智能研究院),浙江工商大学) Sussex Artificial Intelligent Institute, Zhejiang Gongshang University(Sussex人工智能研究院,浙江工商大学) Department of Engineering and Design, University of Sussex(工程与设计系, Sussex大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出双阶段意图感知框架,通过语义防火墙和确定性验证器,解决LLM在IoT中的可靠性与交互效率问题,提升家居任务执行精度与用户干扰最小化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI 57%

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 57%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 11 篇

2603.16256 2026-03-18 cs.CV 85%

When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition

当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘

Xiaokun Sun, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23359 2026-03-18 cs.CV 85%

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05551 2026-03-18 cs.IR cs.CV 82%

AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction

AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制

Jiashu Yang, Chi Zhang, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xu Jia, Xunliang Cai

机构 * Dalian University of Technology(大连理工大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract)

AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16415 2026-03-18 cs.CL cs.AI cs.IR 81%

IndexRAG: Bridging Facts for Cross-Document Reasoning at Index Time

IndexRAG:在索引时间进行跨文档推理的桥梁

Zhenghua Bao, Yi Shi

机构 * Continuum AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 IndexRAG通过在索引阶段进行跨文档推理,提升多跳问答的F1得分,无需额外训练,仅需单次检索和一次LLM调用。

详情

展开后加载摘要…

URL PDF HTML 收藏