arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5792 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5792 篇

2602.13193 2026-04-07 cs.RO 78%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09339 2026-04-06 cs.NI 78%

RAG-Enabled Intent Reasoning for Application-Network Interaction

支持应用-网络交互的意图推理(RAG)

Salwa Mostafa, Mohamed K. Abdel-Aziz, Mohammed S. Elbamby, Mehdi Bennis

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于RAG的意图推理框架,用于自动网络操作与管理。通过结合机器推理、检索增强生成和生成式AI技术,实现不同应用的意图翻译,提升网络交互的智能化和领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13874 2026-03-31 cs.CV 78%

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体

Jitesh Jain, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi

机构 * Allen AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。

Comments Project Page: https://praeclarumjj3.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV 78%

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05181 2026-03-27 cs.CV 78%

Mario: Multimodal Graph Reasoning with Large Language Models

Mario:基于大语言模型的多模态图推理

Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV 78%

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 78%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01205 2026-03-24 cs.HC 78%

When Machines Join the Moral Circle: The Persona Effect of Generative AI Agents in Collaborative Reasoning

当机器加入道德圈:生成式AI代理在协作推理中的人格效应

Yueqiao Jin, Roberto Martinez-Maldonado, Wanruo Shi, Songjie Huang, Mingmin Zheng, Xinbin Han, Dragan Gasevic, Lixiang Yan

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究探讨生成式AI代理在协作推理中对道德讨论的影响,发现支持性AI增强论证质量,而反对性AI扩大道德框架,表明AI队友能改变道德框架的分布与连接,而非单纯影响道德选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 78%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV 78%

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 78%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 78%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07179 2026-03-10 cs.IR 78%

Retrieving Minimal and Sufficient Reasoning Subgraphs with Graph Foundation Models for Path-aware GraphRAG

基于图基础模型的路径感知图RAG中最小和充分推理子图检索

Haonan Yuan, Qingyun Sun, Junhua Shi, Mingjun Liu, Jiaqi Yuan, Ziwei Zhang, Xingcheng Fu, Jianxin Li

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出GFM-Retriever,通过图基础模型实现路径感知的子图检索,提升多跳问答任务的检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13238 2026-03-09 cs.CV 78%

DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model

DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力

Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03857 2026-03-05 cs.CV 78%

DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models

DeepScan: 一种无需训练的框架,用于大视觉-语言模型中的视觉引导推理

Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu

机构 * East China Normal University(东华大学) Sichuan University(四川大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DeepScan是一种无需训练的框架,通过层次扫描、聚焦和证据增强推理提升大视觉-语言模型在视觉任务中的表现。

Comments 18 pages 17 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11369 2026-03-04 cs.CV 78%

Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment

推理作为表示:重新思考图像质量评估中的视觉强化学习

Shijie Zhao, Xuanyu Zhang, Weiqi Li, Junlin Li, Li Zhang, Tianfan Xue, Jian Zhang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出RALI算法,通过对比学习实现图像与通用文本表示的对齐,无需推理过程,显著降低参数和推理时间,提升图像质量评估的泛化性能。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19615 2026-02-24 cs.CV 78%

Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness

清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法

Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) Department of Computer Science, University of Memphis(密苏里大学计算机科学系)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17738 2026-02-23 cs.MA cs.IT math.IT 78%

Reasoning-Native Agentic Communication for 6G

面向6G的推理原生代理通信

Hyowoon Seo, Joonho Seon, Jin Young Kim, Mehdi Bennis, Wan Choi, Dong In Kim

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出推理原生代理通信,旨在通过协调平面解决6G网络中自主机器间的信念分歧问题,提升异构系统间的协同一致性。

Comments 8 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12064 2026-02-13 cs.DB 78%

DIVER: A Robust Text-to-SQL System with Dynamic Interactive Value Linking and Evidence Reasoning

DIVER: 一种具有动态交互值链接和证据推理的鲁棒文本到SQL系统

Yafeng Nan, Haifeng Sun, Zirui Zhuang, Qi Qi, Guojun Chu, Jianxin Liao, Dan Pei, Jingyu Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DIVER通过动态交互值链接和证据推理,提升文本到SQL系统的鲁棒性,实验显示其在执行准确率和验证效率分数上均有显著提升。

Comments Accepted by SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24187 2026-02-06 eess.AS 78%

Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition

超越多数投票的推理:一种可解释的语音语言模型框架用于语音情感识别

Bo-Hao Su, Hui-Ying Shih, Jinchuan Tian, Jiatong Shi, Chi-Chun Lee, Carlos Busso, Shinji Watanabe

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出了一种可解释的语音语言模型框架,通过生成推理任务提升语音情感识别的可解释性,同时保持预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04690 2026-02-05 cs.IR 78%

Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction

多源检索与推理用于法律判决预测

Junjie Chen, Haitao Li, Qilei Zhang, Zhenghua Li, Ya Zhang, Quan Zhou, Cheng Luo, Yiqun Liu, Dongsheng Guo, Qingyao Ai

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01563 2026-02-03 cs.SE 78%

AdNanny: One Reasoning LLM for All Offline Ads Recommendation Tasks

AdNanny:一个用于所有离线广告推荐任务的推理LLM

Nan Hu, Han Li, Jimeng Sun, Lu Wang, Fangkai Yang, Bo Qiao, Pu Zhao, David Dai, Mengyu Liu, Yuefeng Zhan, Jianjin Zhang, Weihao Han, Allen Sun, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Denvy Deng, Feng Sun, Qi Zhang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 AdNanny是一种统一的推理LLM,用于提升离线广告推荐任务的效率和准确性,通过整合多个任务模型,减少冗余并提升性能。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18386 2026-01-27 cs.CV 78%

ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks

ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理

Gabriel Lee Jun Rong, Christos Korgialas, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

专题命中 其他推理 :reasoning(title,abstract)

AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18044 2026-01-27 cs.SE 78%

RGFL: Reasoning Guided Fault Localization for Automated Program Repair Using Large Language Models

RGFL:基于大语言模型的自动化程序修复中的推理引导故障定位

Melika Sepidband, Hamed Taherkhani, Hung Viet Pham, Hadi Hemmati

专题命中 其他推理 :reasoning(title,abstract)

AI总结 RGFL通过引入分层推理模块和反事实分析,提升自动化程序修复中的文件和元素级故障定位精度,显著提高修复成功率。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15331 2026-01-27 cs.HC 78%

DesignerlyLoop: Forming Design Intent through Curated Reasoning for Human-LLM Alignment

DesignerlyLoop: 通过精选推理形成设计意图以实现人-大语言模型对齐

Anqi Wang, Zhengyi Li, Xin Tong, Pan Hui

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DesignerlyLoop通过精选推理提升人-大语言模型在设计任务中的对齐,改进设计质量和创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15304 2026-01-27 cs.IR 78%

MLLMRec: A Preference Reasoning Paradigm with Graph Refinement for Multimodal Recommendation

MLLMRec: 基于图细化的多模态推荐偏好推理范式

Yuzhuo Dang, Xin Zhang, Zhiqiang Pan, Yuxiao Duan, Wanyu Chen, Fei Cai, Honghui Chen

专题命中 其他推理 :reasoning(title,abstract)

AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16458 2026-01-26 cs.SE cs.CR 78%

Bridging Expert Reasoning and LLM Detection: A Knowledge-Driven Framework for Malicious Packages

弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架

Wenbo Guo, Shiwen Song, Jiaxun Guo, Zhengzi Xu, Chengwei Liu, Haoran Ou, Mengmeng Ge, Yang Liu

专题命中 其他推理 :reasoning(title,abstract)

AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10332 2026-01-16 cs.CV 78%

Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型

Siqi Kou, Jiachun Jin, Zetong Zhou, Ye Ma, Yugang Wang, Quan Chen, Peng Jiang, Xiao Yang, Jun Zhu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03073 2026-01-07 cs.CV 78%

Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA

通过大型语言模型理解多智能体推理用于漫画视觉问答

Tong Wu, Thanet Markchom

机构 * University of Reading(阅读大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 78%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 其他推理 :reasoning(title,abstract)

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏