arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-12 至 2026-03-12 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 30 篇

2511.03782 2026-03-12 cond-mat.supr-con cond-mat.str-el cs.AI 57%

Expert Evaluation of LLM World Models: A High-$T_c$ Superconductivity Case Study

专家评估LLM世界模型:一个高温超导体案例研究

Haoyu Guo, Maria Tikhanovskaya, Paul Raccuglia, Alexey Vlaskin, Chris Co, Daniel J. Liebling, Scott Ellsworth, Matthew Abraham, Elizabeth Dorfman, N. P. Armitage, Chunhan Feng, Antoine Georges, Olivier Gingras, Dominik Kiese, Steven A. Kivelson, Vadim Oganesyan, B. J. Ramshaw, Subir Sachdev, T. Senthil, J. M. Tranquada, Michael P. Brenner, Subhashini Venugopalan, Eun-Ah Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过专家评估LLM在高温超导领域的问题回答能力,发现基于RAG的系统在全面性和证据支持方面优于封闭模型。

Comments (v1) 9 pages, 4 figures, with 7-page supporting information. Accepted at the ICML 2025 workshop on Assessing World Models and the Explorations in AI Today workshop at ICML'25

Journal ref Proceedings of the National Academy of Sciences 123, e2533676123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10764 2026-03-12 cs.CL 57%

HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiology

HeartAgent:一种用于心血管疾病可解释性差分诊断的自主代理系统

Shuang Zhou, Kai Yu, Song Wang, Wenya Xie, Zaifu Zhan, Meng-Han Tsai, Yuen-Hei Chung, Shutong Hou, Huixue Zhou, Min Zeng, Bhavadharini Ramu, Lin Yee Chen, Feng Xie, Rui Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 HeartAgent通过整合定制工具和数据资源,提供可解释的差分诊断支持,显著提升心血管疾病诊断的准确性和解释质量。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10700 2026-03-12 cs.IR cs.AI 57%

Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrieval

结构化链接数据作为代理协调检索的记忆层

Andrea Volpini, Elie Raad, Beatrice Gamba, David Riccitelli

机构 * WordLift

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过结构化链接数据提升代理协调检索的准确性与回答质量,实验表明增强实体页面格式显著提高检索性能。

Comments 33 pages, 7 figures, reproducibility appendix, dataset/evaluation framework/enhanced entity page templates released with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10640 2026-03-12 cs.CL 57%

Making Bielik LLM Reason (Better): A Field Report

使Bielik LLM推理能力更优:一份领域报告

Adam Trybus, Bartosz Bartnicki, Remigiusz Kinas

机构 * Institute of Philosophy Jagiellonian University(杰洛尼亚大学哲学学院) Bielik.ai (Speakleash Foundation)(Bielik.ai(Speakleash基金会))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文旨在通过评估和提升Bielik的推理能力,使其在快速变化的AI领域保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10600 2026-03-12 cs.AI cs.DB cs.IR 57%

Trajectory-Informed Memory Generation for Self-Improving Agent Systems

基于轨迹的内存生成用于自改进代理系统

Gaodan Fang, Vatche Isahagian, K. R. Jayaram, Ritesh Kumar, Vinod Muthusamy, Punleuk Oum, Gegi Thomas

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的内存生成框架,通过提取执行轨迹中的有效信息,提升代理在复杂任务中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10233 2026-03-12 cs.CL 57%

S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings

S-GRADES -- 研究学生响应评估在多样化评估环境中的泛化能力

Tasfia Seuti, Sagnik Ray Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 S-GRADES通过统一的基准测试平台整合多种学生响应评分数据集,评估大语言模型在不同评分任务中的泛化能力,揭示评分任务中的可靠性与泛化差距。

Comments LREC 2026 Accepted, https://sgrades.eng.unt.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 57%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10034 2026-03-12 cs.CL 57%

A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment

基于原则的自适应策略用于认知障碍老年人群体认知刺激对话

Jiyue Jiang, Yanyu Chen, Pengan Chen, Kai Liu, Jingqi Zhou, Zheyong Zhu, He Hu, Fei Ma, Qi Tian, Chuan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于原则的自适应策略,通过GCSD系统解决认知障碍老年人群体对话中的认知刺激问题,提升交互个性化和治疗效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 57%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05271 2026-03-12 cs.CV cs.AI 57%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 50%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 推理评测 :reasoning(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 50%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 推理评测 :reasoning(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10342 2026-03-12 cs.DC 50%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 推理评测 :reasoning(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-03-12 cs.GT 50%

Quantal Response Equilibrium as a Measure of Strategic Sophistication: Theory and Validation for LLM Evaluation

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments 25 pages, 8 figures, submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 10 篇

2601.13879 2026-03-12 cs.MM cs.CL cs.CV 89%

Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring

链式推理压缩不应盲目:通过双路径锚定实现高效的多模态推理的V-Skip

Dongxu Zhang, Yiding Sun, Cheng Tan, Wenbiao Yan, Ning Yang, Jihua Zhu, Haijun Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 V-Skip通过双路径锚定机制解决多模态推理中令牌剪枝的盲目性问题,实现高效的推理速度提升与精度保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10048 2026-03-12 cs.LG cs.AI 86%

Long Chain-of-Thought Compression via Fine-Grained Group Policy Optimization

通过细粒度分组策略优化实现长链式思考压缩

Xinchen Han, Hossam Afifi, Michel Marot, Xilu Wang, Lu Yin

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出细粒度分组策略优化算法,通过优化分组响应的权重实现高效的链式思考压缩,同时解决GRPO的两个主要问题。

Comments IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09980 2026-03-12 cs.LG cs.AI cs.CL 82%

Explainable LLM Unlearning Through Reasoning

通过推理实现可解释的LLM反学习

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08719 2026-03-12 cs.AR cs.AI cs.SE 79%

SiliconMind-V1: Multi-Agent Distillation and Debug-Reasoning Workflows for Verilog Code Generation

SiliconMind-V1:用于Verilog代码生成的多智能体蒸馏与调试推理工作流

Mu-Chi Chen, Yu-Hung Kao, Po-Hsuan Huang, Shao-Chun Ho, Hsiang-Yu Tsou, I-Ting Wu, En-Ming Huang, Yu-Kai Hung, Wei-Po Hsin, Cheng Liang, Chia-Heng Tu, Shih-Hao Hung, H. T. Kung

机构 * SiliconMind-V1

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SiliconMind-V1通过多智能体框架和测试平台驱动的验证,实现了更高效且功能正确的Verilog代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10535 2026-03-12 cs.LG cs.CL 62%

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10504 2026-03-12 cs.CR cs.AI cs.CV 57%

Naïve Exposure of Generative AI Capabilities Undermines Deepfake Detection

生成AI能力的盲目暴露削弱了深度伪造检测

Sunpill Kim, Chanwoo Hwang, Minsu Kim, Jae Hong Seo

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10313 2026-03-12 cs.CL 57%

Large language models can disambiguate opioid slang on social media

大语言模型可以区分社交媒体上的阿片类药物俚语

Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Altman

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 大语言模型能有效区分社交媒体上的阿片类药物俚语,提升低发病率主题的数据分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10143 2026-03-12 cs.CL 57%

Reason and Verify: A Framework for Faithful Retrieval-Augmented Generation

推理与验证:一种忠实检索增强生成的框架

Eeham Khan, Luis Rodriguez, Marc Queudot

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种领域特定的RAG框架,通过显式推理和验证机制提升检索增强生成的准确性与透明性,在生物医学问答任务中取得显著性能提升。

Comments Accepted to Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01246 2026-03-12 cs.CR cs.AI 57%

Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders

防御性拒绝偏差:安全对齐如何失败于网络防御者

David Campbell, Neil Kale, Udari Madhushani Sehwag, Bert Herring, Nick Price, Dan Borges, Alex Levinson, Christina Q Knight

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏