arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-09 至 2026-03-09 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 3 篇

2603.05706 2026-03-09 cs.AI 87%

Reasoning Models Struggle to Control their Chains of Thought

推理模型难以控制其推理链

Chen Yueh-Han, Robert McCarthy, Bruce W. Lee, He He, Ian Kivlichan, Bowen Baker, Micah Carroll, Tomek Korbak

机构 * NYU(纽约大学) MATS(马歇尔应用科学与技术学院) UCL(伦敦大学学院) UPenn(宾夕法尼亚大学) OpenAI

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 研究发现推理模型的CoT可控性低于输出可控性,且受模型规模、训练和问题难度影响,建议未来跟踪CoT可控性以维持监控有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06317 2026-03-09 cs.LG cs.AI 62%

From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty

从熵到校准的不确定性:训练语言模型以推理不确定性

Azza Jenane, Nassim Walha, Lukas Kuhn, Florian Buettner

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Goethe University Frankfurt, Germany(法兰克福歌德大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种三阶段流程,通过训练语言模型以在测试时高效推断校准的不确定性,提升模型在高风险领域的可靠性与泛化能力。

Comments 4 pages, submitted to AISTATS Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11629 2026-03-09 cs.LG cs.AI 62%

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

理性安全对齐:通过答案后检查确保对抗攻击防御

Chentao Cao, Xiaojun Xu, Bo Han, Hang Li

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR小组,计算机科学系,香港 Baptist大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出答案后检查方法,通过推理增强模型对抗攻击防御能力,实验表明其在安全性和效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 10 篇

2603.05911 2026-03-09 cs.CV cs.AI 85%

CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning

CORE-Seg: 通过强化学习实现复杂病灶的推理驱动分割

Yuxin Xie, Yuming Chen, Yishan Yang, Yi Zhou, Tao Zhou, Zhen Zhao, Jiacheng Liu, Huazhu Fu

机构 * Yuxin Xie 1 Yuming Chen 1 Yishan Yang 1 Yi Zhou 1 Tao Zhou 2 Zhen Zhao 3 Jiacheng Liu 3 Huazhu Fu 4

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 CORE-Seg通过强化学习实现复杂病灶分割,提出语义引导的提示适配器和渐进训练策略,取得更高Dice系数和更低失败率

Comments Under Review with Computational Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15160 2026-03-09 cs.AI cs.CL 81%

Knowledge Graphs are Implicit Reward Models: Path-Derived Signals Enable Compositional Reasoning

知识图谱是隐式奖励模型:路径衍生信号促进组合推理

Yuval Kansal, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University, New Jersey, USA(电气与计算机工程系,普林斯顿大学,新泽西州,美国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用知识图谱作为隐式奖励模型,通过路径衍生信号提升模型在复杂推理任务中的组合推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06503 2026-03-09 cs.CL 79%

Beyond Rows to Reasoning: Agentic Retrieval for Multimodal Spreadsheet Understanding and Editing

超越行到推理:面向多模态电子表格理解与编辑的智能检索

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 BRTR通过迭代工具调用框架实现多模态电子表格的端到端理解与编辑,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16069 2026-03-09 cs.SE cs.LG 79%

The Limits of Long-Context Reasoning in Automated Bug Fixing

长上下文推理在自动化Bug修复中的局限性

Ravi Raju, Mengmeng Ji, Shubhangi Upasani, Bo Li, Urmish Thakker

机构 * SambaNova Systems(SambaNova系统)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究发现长上下文推理在自动化Bug修复中存在显著局限,现有模型在长上下文下的表现远低于预期。

Comments Accepted to ICLR 2026 ICBINB workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08105 2026-03-09 cs.CL 79%

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani

机构 * University of Toronto(多伦多大学) Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) OntarioTech University(安大略技术大学) Saarland University(萨尔兰州立大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。

Comments Accepted to EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV 78%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05518 2026-03-09 cs.HC cs.CV 78%

CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning

CoEditor++:基于指令的视觉编辑 via 认知推理

Minheng Ni, Yutao Fan, Zhengyuan Yang, Yeli Shen, Yuxiang Wei, Yaowen Zhang, Lijuan Wang, Lei Zhang, Wangmeng Zuo

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft(微软公司)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 CoEditor++通过认知推理实现基于指令的视觉编辑,无需训练即可在通用和负责任的编辑任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06088 2026-03-09 cs.CL cs.AI 62%

Experiences Build Characters: The Linguistic Origins and Functional Impact of LLM Personality

经验塑造性格:大语言模型人格的语言起源与功能影响

Xi Wang, Mengdie Zhuang, Jiqun Liu

机构 * University of Sheffield(谢菲尔德大学) University of Oklahoma(俄克拉荷马大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过持续预训练和大五人格框架,揭示了大语言模型人格的形成机制,发现模型能力在特定性格类型中表现最佳,并揭示了训练数据语言特征对推理性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02263 2026-03-09 q-bio.GN cs.AI 57%

LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization

LA-MARRVEL:一种基于知识、语言感知的LLM框架,用于临床稳健的罕见病基因优先级排序

Jaeyeon Lee, Lin Yao, Hyun-Hwan Jeong, Zhandong Liu

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(Jan和Dan Duncan神经研究 institutes) Texas Children’s Hospital(德克萨斯儿童医院) Quantitative and Computational Biosciences program(定量与计算生物科学项目)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 LA-MARRVEL通过基于知识和语言感知的LLM框架,提升罕见病基因优先级排序的准确性和临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 50%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 25 篇

2603.05618 2026-03-09 cs.CL 89%

Safer Reasoning Traces: Measuring and Mitigating Chain-of-Thought Leakage in LLMs

更安全的推理轨迹:衡量和减轻大语言模型中的推理链泄露

Patrick Ahrend, Tobias Eder, Xiyang Yang, Zhiyi Pan, Georg Groh

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文研究了大语言模型中推理链泄露问题,提出了一种模型无关的框架来衡量和减轻隐私风险,通过比较不同模型和预算下的泄露情况,提出了混合门卫策略以平衡效用与风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18077 2026-03-09 cs.CL 88%

Chain-of-Thought Reasoning Improves Context-Aware Translation with Large Language Models

基于链式推理的翻译改进:大型语言模型的上下文感知翻译

Shabnam Ataee, Hugo Huart, Andrei Popescu-Belis

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 本文通过链式推理提升大型语言模型在上下文感知翻译中的表现,发现推理能力显著提高翻译准确率。

Comments Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 85%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05900 2026-03-09 cs.LG cs.AI 81%

Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning

基于参考的策略优化用于分子优化 via LLM 推理

Xuan Li, Zhanke Zhou, Zongze Li, Jiangchao Yao, Yu Rong, Lu Zhang, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) CMIC, Shanghai Jiao Tong University(CMIC,上海交通大学) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Lab(虎盘实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RePO通过结合强化学习和参考引导策略优化,在分子优化中提升探索与利用的平衡,优于SFT和RLVR方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06570 2026-03-09 cs.CV cs.AI 79%

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

SUREON:一个手术推理的基准和视觉-语言模型

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri

机构 * Intuitive Surgical Inc.

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06416 2026-03-09 cs.CL 79%

Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task

对大型语言模型中规范条件推理能力的评估:瓦森选择任务案例

Hirohiko Abe, Kentaro Ozeki, Risako Ando, Takanobu Morishita, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) University of Tokyo(东京大学) abelard.flet.keio.ac.jp(Keio大学abelard.flet实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过瓦森选择任务评估大型语言模型在规范规则下的条件推理能力,发现其表现与人类相似,存在匹配偏误等认知偏差。

Comments To appear in the Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01288 2026-03-09 cs.LG 79%

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS: 通过熵动力学诊断LLM推理

Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 EDIS通过分析LLM推理过程中的熵动态变化,识别错误推理的特征模式,提供有效的诊断信号以提升推理准确性。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 78%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 78%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17598 2026-03-09 cs.CL cs.AI eess.AS 62%

The Cascade Equivalence Hypothesis: When Do Speech LLMs Behave Like ASR$\rightarrow$LLM Pipelines?

级联等价假设:当语音大语言模型表现得像ASR→LLM流水线时

Jayadev Billa

机构 * San Jose CA, USA(加州圣何塞)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究语音大语言模型是否等价于ASR→LLM流水线,通过匹配骨干测试和机理分析,揭示其行为特性及在噪声下的性能差异。

Comments 10 pages, 6 figures, 7 tables. submitted for review Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15849 2026-03-09 cs.CL cs.AI 62%

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

IntelliAsk: 通过RLVR学习生成高质量的研究问题

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 IntelliAsk通过RLVR技术提升生成问题的质量,生成更深入、基于证据的问题,优于现有基线模型。

Comments 24 Pages, v2, Abstract Modified

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06148 2026-03-09 cs.CV cs.AI 57%

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

VLM-RobustBench: 一种全面的视觉语言模型鲁棒性基准

Rohit Saxena, Alessandro Suglia, Pasquale Minervini

机构 * University of Edinburgh, UK(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 VLM-RobustBench评估了视觉语言模型在不同图像失真下的鲁棒性,发现低严重性空间扰动对性能影响更大,提示需改进鲁棒性评估和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 57%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05689 2026-03-09 cs.CR cs.AI 57%

SecureRAG-RTL: A Retrieval-Augmented, Multi-Agent, Zero-Shot LLM-Driven Framework for Hardware Vulnerability Detection

SecureRAG-RTL: 一种基于检索增强的多智能体零样本LLM驱动框架用于硬件漏洞检测

Touseef Hasan, Blessing Airehenbuwa, Nitin Pundir, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(计算机科学学院,威斯康星州立大学) Department of Electrical and Computer Engineering, Auburn University(电气与计算机工程系,阿伯茨兰大学) IBM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SecureRAG-RTL通过检索增强生成方法提升硬件漏洞检测准确率,实现30%的性能提升并公开基准数据集支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20230 2026-03-09 cs.AI cs.CV cs.MA 57%

A Multi-Agent System Enables Versatile Information Extraction from the Chemical Literature

多智能体系统实现从化学文献中灵活的信息提取

Yufan Chen, Ching Ting Leung, Bowen Yu, Jianwei Sun, Yong Huang, Linyan Li, Hao Chen, Hanyu Gao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种基于多模态大语言模型的多智能体系统,实现了从化学文献中高效提取化学信息,F1分数达76.27%,显著提升信息提取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏