arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 18 篇

2604.04325 2026-04-07 cs.CL 83%

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

多轮医学诊断基准测试:Hold、Lure 和 Self-Correction

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai, Ying Ding, Yuji Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03679 2026-04-07 cs.CL cs.AI cs.IR cs.LG cs.MM 82%

LightThinker++: From Reasoning Compression to Memory Management

LightThinker++:从推理压缩到内存管理

Yuqi Zhu, Jintian Zhang, Zhenjie Wan, Yujie Luo, Shuofei Qiao, Zhengke Gui, Da Zheng, Lei Liang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LightThinker++,通过引入显式自适应内存管理,有效压缩LLM推理过程中的中间思维,减少内存占用并提升推理效率,尤其在长周期智能任务中表现突出。

Comments Work in progress. This is an extended version of LightThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 82%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 79%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04208 2026-04-07 cs.LG 79%

Towards Agentic Defect Reasoning: A Graph-Assisted Retrieval Framework for Laser Powder Bed Fusion

迈向代理缺陷推理:一种用于激光粉末床融合的图辅助检索框架

Muhammad Rizwan Awan, Volker Pickert, Muhammad Waqar Ashraf, Saleh Ali, Farshid Mahmouditabar, Shafiq Odhano

机构 * Department of Electrical and Electronic Engineering, The Newcastle University(纽卡斯尔大学电气与电子工程系) The Sargent Centre for Process Systems Engineering, Department of Chemical Engineering, University College London(伦敦大学学院化学工程系萨金特过程系统工程中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种图辅助检索框架,用于激光粉末床融合中的缺陷推理,通过构建知识图谱实现参数与缺陷之间的可解释路径识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11572 2026-04-07 cs.CY cs.AI 79%

Implicit Bias-Like Patterns in Reasoning Models

推理模型中的隐性偏见模式

Messi H. J. Lee, Calvin K. Lai

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Rutgers University(罗格斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究推理模型在处理关联不兼容任务时消耗更多推理token,揭示其隐性偏见特征及模型内部推理内容的影响

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03671 2026-04-07 cs.IR 78%

User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation

基于用户模拟器的多轮偏好优化推理LLM对话推荐

Xingyuan Xiang, Xiangchen Pan, Wei Wei

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出SMTPO框架,通过多任务监督微调和强化学习优化多轮对话推荐,提升推荐准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04078 2026-04-07 eess.IV cs.AI cs.CV 74%

BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging

BAAI心脏代理:一种智能多模态代理,用于从心脏磁共振成像自动推理和诊断心血管疾病

Taiping Qu, Hongkai Zhang, Lantian Zhang, Can Zhao, Nan Zhang, Hui Wang, Zhen Zhou, Mingye Zou, Kairui Bo, Pengfei Zhao, Xingxing Jin, Zixian Su, Kun Jiang, Huan Liu, Yu Du, Maozhou Wang, Ruifang Yan, Zhongyuan Wang, Tiejun Huang, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Department of Radiology, Beijing Anzhen Hospital, Beijing Institute of Heart, Lung & Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院放射科,北京市心肺血管疾病研究所) Department of MR, the First Affiliated Hospital, Henan Medical University(河南医科大学第一附属医院磁共振科) Department of Cardiology, Clinical Center for Coronary Heart Disease, Beijing Institute of Heart, Lung and Blood Vessel Disease, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院心内科,冠心病临床中心,北京市心肺血管疾病研究所) Department of Cardiac Surgery, Beijing Anzhen Hospital, Institute of Heart, Lung and Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院心脏外科,心肺血管疾病研究所)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文提出BAAI心脏代理,通过多模态智能系统实现心脏磁共振成像的端到端解读,实现了自动分割、功能量化、组织特征分析和疾病诊断,并在多个心血管疾病数据集上验证了其高准确率和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 70%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03266 2026-04-07 cs.MA cs.LG 70%

Emergent Compositional Communication for Latent World Properties

涌现的组合通信用于潜在世界属性

Tomek Kaszyński

机构 * Independent Researcher, Amsterdam, Netherlands(独立研究者,阿姆斯特丹,荷兰)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文研究多智能体通信能否从冻结视频特征中提取离散组合性表示,展示通过Gumbel-Softmax瓶颈和迭代学习发展出无标签的组合协议,验证了感知先验对可通信信息的影响。

Comments 24 pages, 4 figures, 12 tables. Code: https://github.com/TomekKaszynski/emergent-physics-comm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 62%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14536 2026-04-07 cs.CL cs.AI 62%

Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

可解释的token级噪声过滤用于LLM微调数据集

Yuchen Yang, Wenze Lin, Enhao Huang, Zhixuan Chu, Hongbin Zhou, Lan Tao, Yiming Li, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XTF框架,通过分解token级数据对微调过程的贡献,提升LLM微调性能,实验表明在数学、代码和医学任务中性能提升达13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00077 2026-04-07 cs.CL cs.LG stat.ML 62%

Gaussian mixture models as a proxy for interacting language models

高斯混合模型作为交互语言模型的代理

Edward L. Wang, Mohammad Sharifi Kiasari, Tianyu Wang, Hayden Helm, Avanti Athreya, Carey Priebe, Vince Lyzinski

机构 * Helivan Research

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出交互高斯混合模型作为交互语言模型的代理,通过构建具有类RAG更新机制的模型,展示其在低计算成本下模拟交互语言模型的反馈过程,并提供理论分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12626 2026-04-07 cs.HC cs.AI cs.CY cs.ET 57%

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow

DoubleAgents:社会嵌入式工作流中的人机对齐

Tao Long, Xuanming Zhang, Sitong Wang, Zhou Yu, Lydia B Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DoubleAgents通过分布式认知框架实现人机对齐,整合协调代理、可视化仪表板和策略模块,提升复杂社会嵌入式任务的执行效率与用户信任。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03586 2026-04-07 cs.CL 57%

MultiPress: A Multi-Agent Framework for Interpretable Multimodal News Classification

MultiPress:一种用于可解释多模态新闻分类的多智能体框架

Tailong Luo, Hao Li, Rong Fu, Xinyue Jiang, Huaxuan Ding, Yiduo Zhang, Zilin Zhao, Simon Fong, Guangyin Jin, Jianyuan Ni

机构 * New York Institute of Technology(纽约理工学院) University of Arizona(亚利桑那大学) University of Macau(澳门大学) Peking University(北京大学) Juniata College(朱尼亚塔学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MultiPress多智能体框架,通过多模块协作和检索增强推理提升多模态新闻分类的准确性和可解释性。

Comments Accepted in International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08388 2026-04-07 cs.AI 57%

A Hierarchical Error-Corrective Graph Framework for Autonomous Agents with LLM-Based Action Generation

一种用于自主代理的分层错误校正图框架:基于大语言模型的动作生成

Cong Cao, Jingyao Zhang, Kun Tong

机构 * Independent Researcher(独立研究者) Beihang University(北京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HECG框架,通过多维可转移策略、误差矩阵分类和因果-上下文图检索三大创新,提升自主代理在动态任务中的策略选择、错误分析和情境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03855 2026-04-07 cs.DB 50%

VectraFlow: Long-Horizon Semantic Processing over Data and Event Streams with LLMs

VectraFlow:基于LLM的长时域语义处理数据与事件流

Shu Chen, Junhan Liu, Deepti Raghavan, Ugur Cetintemel

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 VectraFlow通过结合LLM与传统关系运算符,实现了对无结构数据流的长时域语义处理,提供连续语义运算符,支持自然语言意图到可执行运算图的转换,实现从原始文本到匹配事件群体的端到端模式检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03561 2026-04-07 cs.SE 50%

From UI to Code: Mobile Ads Detection via LLM-Unified Static-Dynamic Analysis

从UI到代码:通过LLM统一的静态-动态分析进行移动广告检测

Shang Ma, Wei Cheng, Yanfang Ye, Xusheng Xiao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ADWISE框架,通过结合静态分析和LLM引导的UI结构、应用语义及检索类比,有效检测移动广告。实验表明,ADWISE在广告widget检测上优于现有方法25.60%,并发现更多广告违规情况。

详情

展开后加载摘要…

URL PDF HTML 收藏