arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-26 至 2026-03-26 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 25 篇

2603.24484 2026-03-26 cs.CV 50%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24376 2026-03-26 cs.CV 50%

GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization

GeoRouter:面向全球图像地理定位的动态路由范式

Pengyue Jia, Derong Xu, Yingyi Zhang, Xiaopeng Li, Wenlin Zhang, Yi Wen, Yuanshao Zhu, Xiangyu Zhao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GeoRouter动态路由框架,通过分析视觉内容并结合距离感知偏好目标,优化图像地理定位任务,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24198 2026-03-26 cs.CV 50%

RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution

RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模

Yushuai Song, Weize Quan, Weining Wang, Jiahui Sun, Jing Liu, Meng Li, Pengbin Yu, Zhentao Chen, Wei Shen, Lunxi Yuan, Dong-ming Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 50%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07659 2026-03-26 cs.CV 50%

Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework

通过自批评推理框架提升视觉-语言模型的测试时鲁棒性

Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang

机构 * Tongji University(同济大学) Computer Network Information Center, CAS(计算机网络信息中心,中国科学院) HIAS, University of Chinese Academy of Sciences(高等研究所,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出自批评推理框架,通过多轮反事实推理提升视觉-语言模型的鲁棒性,引入动态鲁棒性基准评估框架以应对语言偏差和敏感性问题,实验表明该方法在鲁棒性上优于基线方法。

Comments Accepted to CVPR 2026. Code: https://github.com/KaihuaTang/Self-Critical-Inference-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23067 2026-03-26 cs.CV 50%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 11 篇

2603.08566 2026-03-26 cs.CR cs.AI 80%

OSS-CRS: Liberating AIxCC Cyber Reasoning Systems for Real-World Open-Source Security

OSS-CRS:解放AIxCC网络推理系统以应对现实中的开源安全

Andrew Chin, Dongkwan Kim, Yu-Fu Fu, Fabian Fleischer, Youngjoon Kim, HyungSeok Han, Cen Zhang, Brian Junekyu Lee, Hanqing Zhao, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 OSS-CRS提出一个可本地部署的框架,用于运行和结合CRS技术,针对真实开源项目进行安全分析,并实现预算感知的资源管理。

Comments Version 1.1 (March 2026), OSS-CRS: an open-source framework for porting, deploying, and composing AIxCC cyber reasoning systems. Project page: https://github.com/ossf/oss-crs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24093 2026-03-26 cs.LG cs.AI 62%

Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization

迈向有效的经验学习:利用与内化双指导

Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) IQuest Research(IQuest研究) Beihang University(北京航空航天大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGO框架,通过外部和内部经验指导强化学习,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10402 2026-03-26 cs.AI 57%

Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering

迈向超长视界代理科学:认知积累用于机器学习工程

Xinyu Zhu, Yuzhu Cai, Zexi Liu, Bingyang Zheng, Cheng Wang, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Weinan E, Siheng Chen, Yanfeng Wang

机构 * School of Artificial Intelligence(人工智能学院) DP Technology(DP技术) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ML-Master 2.0,通过认知积累机制解决超长视界自主性问题,实现机器学习工程的高效探索。

Comments 25 pages. 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23914 2026-03-26 cs.CV cs.LG 57%

Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding

面向大视觉-语言模型的注意力感知推理优化

Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出AttentionPack框架,通过紧凑注意力机制和解压机制提升大视觉-语言模型解码效率,实验表明内存效率提升8倍,支持更大批次和更快推理,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23857 2026-03-26 cs.AI cs.CY cs.SI nlin.CD physics.soc-ph 57%

When AI output tips to bad but nobody notices: Legal implications of AI's mistakes

当AI输出变差但没人注意到:AI错误的法律影响

Dylan J. Restrepo, Nicholas J. Restrepo, Frank Y. Huo, Neil F. Johnson

机构 * Cornell Tech(康奈尔科技) Cornell University(康奈尔大学) d-AI-ta Consulting(d-AI-ta咨询公司) Dynamic Online Networks Laboratory(动态在线网络实验室) George Washington University(乔治华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在法律领域中的错误风险,指出AI可能伪造法律案例和判例,导致专业制裁和声誉损害,并提出通过验证协议来应对技术责任问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23554 2026-03-26 cs.IR cs.AI 57%

Mixture of Demonstrations for Textual Graph Understanding and Question Answering

演示混合用于文本图理解与问答

Yukun Wu, Lihui Liu

机构 * Independent Researcher, Wayne State University(韦恩州立大学独立研究者) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MixDemo框架,通过MoE机制选择信息丰富的演示,结合查询特定图编码器减少噪声,提升文本图问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24181 2026-03-26 cs.CV 50%

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

通过提示条件和头部选择解锁LVLMs的少样本能力

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学、国家科学研究中心、巴黎萨克雷高等师范学院、Borelli中心) École Polytechnique, AMIAD(巴黎高等理工学院、AMIAD) Institut Universitaire de France(法国高等科学研究院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出Head Ensemble Classifiers (HEC)通过提示条件和头部选择提升LVLMs在少样本和零样本分类中的性能,实现与CLIP基方法的性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-03-26 cs.CR cs.PL cs.SE 50%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 其他推理 :reasoning(abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23830 2026-03-26 cs.HC 50%

CodeExemplar: Example-Based Scaffolding for Introductory Programming in the GenAI Era

CodeExemplar:面向生成式人工智能时代的入门编程示例式支架

Boxuan Ma, Shinichi Konomi

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出基于示例的支架方法,通过生成与目标任务推理模式相符但情境不同的示例,支持类比迁移并减少抄袭,设计了二维分类体系和指导原则,并开发了CodeExemplar原型系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23828 2026-03-26 cs.SE cs.HC 50%

Bridging the Interpretation Gap in Accessibility Testing: Empathetic and Legal-Aware Bug Report Generation via Large Language Models

弥合可访问性测试中的解释鸿沟:通过大语言模型生成共情且法律意识的缺陷报告

Ryoya Koyama, Zhiyao Wang, Devi Karolita, Jialong Li, Kenji Tei

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出HEAR框架,通过语义切片和视觉定位重建UI上下文,注入残疾导向的人设并多层推理,生成共情且法律意识的缺陷报告,提升非专业人士对用户伤害和合规风险的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23802 2026-03-26 cs.CY 50%

How are AI agents used? Evidence from 177,000 MCP tools

AI代理是如何被使用的?来自177,436个MCP工具的证据

Merlin Stein

专题命中 其他推理 :reasoning(abstract)

AI总结 研究通过分析177,436个MCP工具,发现AI代理主要用于软件开发,其中67%为软件开发工具,90%的MCP服务器下载量来自此领域。行动工具占比从27%上升至65%,涵盖中等和高风险任务,如金融交易。

详情

展开后加载摘要…

URL PDF HTML 收藏