arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 21 篇

2508.05880 2026-03-16 cs.CL cs.AI 76%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13154 2026-03-16 cs.CL cs.AI 73%

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

ESG-Bench: 对长上下文 ESG 报告进行基准测试以缓解幻觉

Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ESG-Bench 数据集,用于评估大语言模型在解析 ESG 报告和减少幻觉方面的能力,通过人工标注的 QA 对和细粒度标签,系统评估模型提取和推理 ESG 内容的能力。

Comments To be published in the AAAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17815 2026-03-16 cs.AI 70%

Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems

评估欺骗:揭示前沿AI系统安全评估中的观察者效应

Yihe Fan, Wenqi Zhang, Xudong Pan, Min Yang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨了AI系统在被评估时可能产生欺骗行为,发现更先进的AI系统更易表现出观察者效应,影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 67%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 67%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12270 2026-03-16 cs.CL cs.AI 62%

Task-Specific Knowledge Distillation via Intermediate Probes

通过中间探针进行任务特定的知识蒸馏

Ryan Brown, Chris Russell

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过冻结教师模型隐藏状态训练轻量级探针的方法,利用探针预测而非输出logits作为监督信号,提升四个推理基准测试的性能,尤其在数据有限时效果更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21553 2026-03-16 cs.AI cs.CE cs.HC cs.LG cs.MA 62%

AutoClimDS: Climate Data Science Agentic AI -- A Knowledge Graph is All You Need

AutoClimDS:气候数据科学代理AI——一个知识图谱足矣

Ahmed Jaber, Wangshu Zhu, Ayon Roy, Karthick Jayavelu, Justin Downes, Sameer Mohamed, Candace Agonafir, Linnia Hawkins, Tian Zheng

机构 * NSF STC Learning the Earth with AI and Physics (LEAP), Columbia University(NSF STC 学习地球与人工智能和物理(LEAP),哥伦比亚大学) AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) Department of Statistics, Columbia University(哥伦比亚大学统计系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AutoClimDS通过整合 curated 的气候知识图谱与代理AI工作流,解决数据碎片化、格式异质性和技术门槛高的问题,实现端到端的气候分析,展示知识图谱作为自主气候数据科学的基础结构。

Comments Accepted to IEEE CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20796 2026-03-16 econ.GN cs.AI cs.LG q-fin.EC 62%

Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach

对齐大型语言模型代理的理性与道德偏好:一种监督微调方法

Wei Lu, Amit Dhanda, Daniel L. Chen, Christian B. Hansen

机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) Amazon(亚马逊) Toulouse School of Economics(图卢兹经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 57%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 57%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 57%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 57%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02108 2026-03-16 cs.CV cs.GR cs.MM 50%

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。

Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows

Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21662 2026-03-16 cs.CV 50%

Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following

多标准:在多元标准下评估多模态裁判

Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 8 篇

2603.12717 2026-03-16 cs.RO cs.AI cs.LG 86%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 62%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07490 2026-03-16 cs.CL cs.LG 62%

Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More

增强的自回归预测:少关注多学习

Xialie Zhuang, Zhikai Jia, Jianjin Li, Zhenyu Zhang, Li Shen, Zheng Cao, Shiwei Liu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MEAP方法,通过整合MLM与NTP提升上下文检索能力,实验显示其在关键信息检索和长上下文推理任务中表现优异,且在常识推理任务中不逊色。

Comments 17 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12826 2026-03-16 cs.CL 57%

Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design

重新思考用于RLVR的多项选择题:通过干扰项设计解锁潜力

Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了干扰项设计对RLVR的影响,发现选项数量不匹配和强干扰项能有效减少随机猜测,提出IDC框架提升干扰项质量,实验表明在多个基准上显著提升了RLVR训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12813 2026-03-16 cs.AI 57%

Context is all you need: Towards autonomous model-based process design using agentic AI in flowsheet simulations

上下文即一切:利用流表模拟中的代理AI实现自主的基于模型的过程设计

Pascal Schäfer, Lukas J. Krinke, Martin Wlotzka, Norbert Asprion

机构 * BASF SE(巴斯夫股份有限公司) RWTH Aachen University(亚琛工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种代理AI框架,利用先进LLM在工业流表模拟环境中辅助过程设计,通过分解任务实现工程知识与代码生成的协同,展示了在反应分离、压力 swing 蒸馏和异构azeotropic 蒸馏中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17288 2026-03-16 cs.CL eess.AS 57%

Triple X: A LLM-Based Multilingual Speech Recognition System for the INTERSPEECH2025 MLC-SLM Challenge

三X:一种基于LLM的多语言语音识别系统,用于INTERSPEECH2025 MLC-SLM挑战

Miaomiao Gao, Xiaoxiao Xiang, Yiwen Guo

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Triple X系统,通过创新的编码器-适配器-LLM架构优化多语言对话场景的语音识别准确率,采用多阶段训练策略提升多语言识别性能,实验结果显示在开发和测试集上取得竞争力的词错误率表现。

Comments Accepted By Interspeech 2025 MLC-SLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15509 2026-03-16 cs.HC cs.CL 57%

Representing data in words: A context engineering approach

用词语表示数据:一种上下文工程方法

Amandine M. Caut, Amy Rouillard, Beimnet Zenebe, Matthias Green, Ágúst Pálmason Morthens, David J. T. Sumpter

机构 * Information Technology Department Uppsala University(乌普萨拉大学信息技术系) Physics Department Stellenbosch University(斯坦福大学物理系) Computer Science Department Addis Ababa University(亚的斯亚贝巴大学计算机科学系) Insa Toulouse(图卢兹大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出wordalisations方法,通过上下文工程生成自然的描述性文本,用于足球球员评估、性格测试和国际调查数据,通过LLM和人类评估验证其准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12600 2026-03-16 cs.HC 50%

How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents

生成式人工智能导师配置如何塑造早期协作动态:个体与共享代理的课堂比较

Siyu Zha, Weijing Liu, Fei Qin, Jie Cao, Yanjin Wang, Yujia Liu, Kaiyi Zhang, Jiangtao Gong, Yingqing Xu

专题命中 其他推理 :reasoning(abstract)

AI总结 研究探讨了生成式人工智能配置对课堂协作调节的影响,发现共享AI促进收敛性协作,而个体AI则导致更分散的互动模式,需教师更多干预。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏