arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2602.02983 2026-03-16 cs.AI 86%

Do LLMs Share Human-Like Biases? Causal Reasoning Under Prior Knowledge, Irrelevant Context, and Varying Compute Budgets

大型语言模型是否具有人类般的偏见?在先验知识、无关上下文和不同计算预算下的因果推理

Hanna M. Dettki, Charley M. Wu, Bob Rehder

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过对比20余种LLM与人类基准,在11个由碰撞结构形式化的因果判断任务中发现,小型可解释模型能有效压缩LLM的因果判断,多数LLM表现出比人类更规则化的推理策略,但未表现出人类典型的碰撞偏见。

Journal ref ICLR 2026 Workshop "From Human Cognition to AI Reasoning (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12078 2026-03-16 cs.AI cs.CL 81%

Tiny Recursive Reasoning with Mamba-2 Attention Hybrid

微小递归推理与Mamba-2注意力混合

Wenlong Wang, Fergal Reid

机构 * Intercom Dublin, Ireland(Intercom都柏林,爱尔兰)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨将Mamba-2混合操作符替换TRM中的Transformer块,验证其在递归框架下保持推理能力,提升抽象推理任务表现。

Comments Published at ICLR 2026 Latent & Implicit Thinking Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12615 2026-03-16 cs.CY cs.AI cs.CL cs.HC 81%

Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior

文学叙述作为道德探针:一种跨系统框架用于评估AI伦理推理与拒绝行为

David C. Flynn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过文学叙述中的不可解道德情境,提出一种跨系统框架,评估AI的伦理推理与拒绝行为,发现系统能力与仪器复杂性相关,揭示了伦理推理与真实能力间的差距。

Comments 27 pages, 6 tables. Target: Minds and Machines (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12458 2026-03-16 cs.CL cs.AI 81%

Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs

打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准

Xing Zi, Xinying Zhou, Jinghao Xiao, Catarina Moreira, Mukesh Prasad

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 79%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12225 2026-03-16 cs.CV cs.LG 77%

HoneyBee: Data Recipes for Vision-Language Reasoners

HoneyBee: 用于视觉-语言推理器的数据食谱

Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。

Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 76%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13154 2026-03-16 cs.CL cs.AI 73%

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

ESG-Bench: 对长上下文 ESG 报告进行基准测试以缓解幻觉

Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ESG-Bench 数据集,用于评估大语言模型在解析 ESG 报告和减少幻觉方面的能力,通过人工标注的 QA 对和细粒度标签,系统评估模型提取和推理 ESG 内容的能力。

Comments To be published in the AAAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17815 2026-03-16 cs.AI 70%

Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems

评估欺骗:揭示前沿AI系统安全评估中的观察者效应

Yihe Fan, Wenqi Zhang, Xudong Pan, Min Yang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨了AI系统在被评估时可能产生欺骗行为,发现更先进的AI系统更易表现出观察者效应,影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 67%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 67%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12270 2026-03-16 cs.CL cs.AI 62%

Task-Specific Knowledge Distillation via Intermediate Probes

通过中间探针进行任务特定的知识蒸馏

Ryan Brown, Chris Russell

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过冻结教师模型隐藏状态训练轻量级探针的方法,利用探针预测而非输出logits作为监督信号,提升四个推理基准测试的性能,尤其在数据有限时效果更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21553 2026-03-16 cs.AI cs.CE cs.HC cs.LG cs.MA 62%

AutoClimDS: Climate Data Science Agentic AI -- A Knowledge Graph is All You Need

AutoClimDS:气候数据科学代理AI——一个知识图谱足矣

Ahmed Jaber, Wangshu Zhu, Ayon Roy, Karthick Jayavelu, Justin Downes, Sameer Mohamed, Candace Agonafir, Linnia Hawkins, Tian Zheng

机构 * NSF STC Learning the Earth with AI and Physics (LEAP), Columbia University(NSF STC 学习地球与人工智能和物理(LEAP),哥伦比亚大学) AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) Department of Statistics, Columbia University(哥伦比亚大学统计系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AutoClimDS通过整合 curated 的气候知识图谱与代理AI工作流,解决数据碎片化、格式异质性和技术门槛高的问题,实现端到端的气候分析,展示知识图谱作为自主气候数据科学的基础结构。

Comments Accepted to IEEE CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20796 2026-03-16 econ.GN cs.AI cs.LG q-fin.EC 62%

Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach

对齐大型语言模型代理的理性与道德偏好:一种监督微调方法

Wei Lu, Amit Dhanda, Daniel L. Chen, Christian B. Hansen

机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) Amazon(亚马逊) Toulouse School of Economics(图卢兹经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 57%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 57%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 57%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 57%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM 50%

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 50%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏