arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 52 篇

2509.23488 2026-03-10 cs.AI cs.CL 62%

Mapping Overlaps in Benchmarks through Perplexity in the Wild

通过在野 perplexity 映射重叠关系

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15237 2026-03-10 cs.AI cs.CV cs.LG 62%

MICA: Multi-Agent Industrial Coordination Assistant

MICA:多智能体工业协调助手

Di Wen, Kunyu Peng, Junwei Zheng, Yufan Chen, Yitian Shi, Jiale Wei, Ruiping Liu, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) INSAIT Hunan University(湖南大学) Carl Zeiss Stiftung(卡尔蔡司基金会) University of Excellence(卓越大学) Helmholtz Association(海德堡协会) State of Baden-Württemberg(巴登-符腾堡州) German Research Foundation(德国研究基金会) National Natural Science Foundation of China(国家自然科学基金委员会) Hunan Provincial Research and Development Project(湖南省研发项目) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MICA是一种基于感知和语音交互的多智能体系统,通过自适应步骤融合技术提升工业任务的执行效率和可靠性。

Comments Accepted to ICRA 2026. The source code will be made publicly available at https://github.com/Kratos-Wen/MICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08704 2026-03-10 cs.AI 57%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08358 2026-03-10 cs.CL 57%

Do Language Models Know Theo Has a Wife? Investigating the Proviso Problem

语言模型知道Theo有妻子吗?探究 proviso 问题

Tara Azin, Daniel Dumitrescu, Diana Inkpen, Raj Singh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过设计诊断数据集,探究语言模型在处理条件句预设问题时的推理能力,发现模型依赖浅层模式匹配而非深度语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07670 2026-03-10 cs.AI 57%

Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers

自主LLM代理的记忆:机制、评估与新兴前沿

Pengfei Du

机构 * Hong Kong Research Institute of Technology(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07607 2026-03-10 cs.DC cs.LG 57%

MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling

MAS-H2:一种用于整体云原生自动扩展的分层多智能体系统

Hamed Hamzeh, Parisa Vahdatian

机构 * University of Westminster(威斯敏斯特大学) University of York(约克大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 MAS-H2通过分层多智能体系统实现云原生自动扩展的前瞻性管理,减少资源浪费和性能下降,提升系统稳定性与资源利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 57%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 57%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01528 2026-03-10 cs.CV cs.AI cs.RO 57%

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen:自主驾驶中生成视频世界模型的综合性基准

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven L. Waslander

机构 * University of Toronto(多伦多大学) CUHK MMLab(香港中文大学MMLab)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。

Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20102 2026-03-10 cs.AI 57%

Human-Centered LLM-Agent System for Detecting Anomalous Digital Asset Transactions

面向人类的LLM-智能体系统用于检测异常数字资产交易

Gyuyeon Na, Minjung Park, Hyeonjeong Cha, Sangmi Chai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HCLA是一种面向人类的多智能体系统,用于通过自然语言交互提高数字资产交易异常检测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10285 2026-03-10 cs.AI 57%

Reallocating Attention Across Layers to Reduce Multimodal Hallucination

跨层分配注意力以减少多模态幻觉

Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) Nanyang Technological University, Singapore(南洋理工大学) Guangxi Transportation Science and Technology Group, China(广西交通科学和技术集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过跨层分配注意力减少多模态幻觉,提升推理一致性和视觉忠实性。

Comments Acceptted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08077 2026-03-10 cs.IR 50%

Why Large Language Models can Secretly Outperform Embedding Similarity in Information Retrieval

为何大语言模型可以秘密超越嵌入相似性在信息检索中的表现

Matei Benescu, Ivo Pascal de Jong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨了大语言模型在信息检索中通过推理超越传统嵌入相似性方法的潜力,并指出当前注释数据集难以准确评估其效果。

Comments 13 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 50%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07786 2026-03-10 cs.CV 50%

OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models

OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集

Yusuke Tozaki, Hisashi Miyamori

机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)

专题命中 推理评测 :reasoning(abstract)

AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。

Comments Accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV 50%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04989 2026-03-10 cs.CV 50%

TAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events

TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪

Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu

机构 * National University of Defense Technology(国防科技大学) Hunan University(湖南大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 50%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC 50%

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 推理评测 :CoT(abstract)

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06856 2026-03-10 cs.MA 50%

Evaluating Multi-Agent LLM Architectures for Rare Disease Diagnosis

评估多智能体LLM架构在罕见病诊断中的表现

Ahmed Almasoud

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究评估了多智能体LLM架构在罕见病诊断中的表现,发现分层结构略优于其他拓扑,而对抗模型性能显著下降,支持动态拓扑选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 50%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 25 篇

2511.14106 2026-03-10 cs.CL 85%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08230 2026-03-10 cs.SD cs.AI eess.AS 83%

Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction

解构大音频-语言模型中的推理能力以实现模糊情绪预测

Xiaofeng Yu, Jiaheng Dong, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang

机构 * University of Auckland, New Zealand(奥克兰大学) The University of Melbourne, Australia(墨尔本大学) University of Birmingham, United Kingdom(伯明翰大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。

Comments The paper was submitted to Interspeech for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06659 2026-03-10 cs.CY cs.AI 79%

Science Literacy: Generative AI as Enabler of Coherence in the Teaching, Learning, and Assessment of Scientific Knowledge and Reasoning

科学素养:生成式AI在科学知识与推理教学、学习和评估中的促进作用

Xiaoming Zhai, James W. Pellegrino, Matias Rojas, Jongchan Park, Matthew Nyaaba, Clayton Cohn, Gautam Biswas

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨生成式AI在提升科学素养中的作用,分析其在教学、学习和评估中的应用挑战与解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07179 2026-03-10 cs.IR 78%

Retrieving Minimal and Sufficient Reasoning Subgraphs with Graph Foundation Models for Path-aware GraphRAG

基于图基础模型的路径感知图RAG中最小和充分推理子图检索

Haonan Yuan, Qingyun Sun, Junhua Shi, Mingjun Liu, Jiaqi Yuan, Ziwei Zhang, Xingcheng Fu, Jianxin Li

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出GFM-Retriever,通过图基础模型实现路径感知的子图检索,提升多跳问答任务的检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20980 2026-03-10 cs.CV cs.AI 77%

CrystaL: Spontaneous Emergence of Visual Latents in MLLMs

CrystaL: MLLMs中视觉潜在特征的自发涌现

Yang Zhang, Danyang Li, Yuxuan Li, Xin Zhang, Tianyu Xie, Mingming Cheng, Xiang Li

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23184 2026-03-10 cs.CL 70%

PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space

PonderLM-2: 在连续空间中通过潜在思想预训练语言模型

Boyi Zeng, He Li, Shixiang Song, Yixuan Wang, Zitong Wang, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07111 2026-03-10 cs.CL cs.AI 62%

Enhancing Consistency of Werewolf AI through Dialogue Summarization and Persona Information

通过对话摘要和人物信息增强Werewolf AI的一致性

Yoshiki Tanaka, Takumasa Kaneko, Hiroki Onozeki, Natsumi Ezure, Ryuichi Uehara, Zhiyang Qi, Tomoya Higuchi, Ryutaro Asahara, Michimasa Inaba

机构 * The University of Electro-Communications(电通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过对话摘要和人物信息提升Werewolf AI代理发言的一致性。

Comments Accepted to the 2nd International AIWolfDial Workshop at INLG 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06816 2026-03-10 cs.CL cs.AI q-bio.NC 62%

"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior

黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为

Roshni Lulla, Fiona Collins, Sanaya Parekh, Thilo Hagendorff, Jonas Kaplan

机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) Department of Psychology, University of Southern California(心理学系,南加州大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08221 2026-03-10 cs.CR cs.AI 57%

SplitAgent: A Privacy-Preserving Distributed Architecture for Enterprise-Cloud Agent Collaboration

SplitAgent: 一种隐私保护的企业-云代理协作分布式架构

Jianshu She

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 SplitAgent通过语境感知的动态去敏化技术,实现企业与云代理间的隐私保护协作,提升任务准确率并减少隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏