arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-31 至 2026-03-31 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 22 篇

2603.27376 2026-03-31 cs.HC cs.AI 79%

Where Does AI Leave a Footprint? Children's Reasoning About AI's Environmental Costs

AI留下什么足迹?儿童对AI环境成本的推理

Aayushi Dangol, Robert Wolfe, Nisha Devasia, Mitsuka Kiyohara, Jason Yip, Julie A. Kientz

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过Ecoprompt系统帮助儿童理解AI的环境影响,揭示其对AI使用的社会与环境权衡及责任感的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27335 2026-03-31 cs.CL 79%

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering

PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索

Yiqing Zhang, Xiaozhong Liu, Fabricio Murai

机构 * PayPal Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。

Comments 20 pages; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27226 2026-03-31 cs.CL 79%

Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning

重新思考易到难:在后训练中课程学习在演绎推理中的局限性

Maximilian Mordig, Andreas Opedal, Weiyang Liu, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zürich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究系统评估了课程学习在LLM后训练中的影响,发现基于难度的训练顺序在准确性及响应长度上无显著优势,挑战了课程学习在演绎推理中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25848 2026-03-31 cs.CV cs.AI 79%

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

更多思考,更少准确性?关于视觉-语言模型中推理的双重性质

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Fabian Waschkowski, Lukas Wesemann, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) University of Melbourne(墨尔本大学) GE Research(GE全球研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示了视觉-语言模型中推理的双重性质:虽然增强了逻辑推理能力,但可能导致感知基础能力下降,通过提出VAPO方法改进了模型对视觉信息的依赖。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27993 2026-03-31 cs.CV 78%

Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation

逐步引导的跨模态推理用于指代图像分割

Jiachen Li, Hongyun Wang, Jinyu Xu, Wenbo Jiang, Yanchun Ma, Yongjian Liu, Qing Xie, Bolong Zheng

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) University of Electronic Science and Technology of China(电子科技大学) Wuhan Vocational College of Software and Engineering(武汉软件工程职业学院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出PPCR框架,通过语义理解-空间定位-实例分割流程,改进指代图像分割中语言描述与视觉表示的连接,提升分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 78%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28376 2026-03-31 cs.CL cs.AI 73%

Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design

Marco DeepResearch:通过以验证为中心的设计解锁高效的深度研究代理

Bin Zhu, Qianghuai Jia, Tian Lan, Junyang Ren, Feng Gu, Feihu Jiang, Longyue Wang, Zhao Xu, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团)

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Marco DeepResearch,通过在问题生成、轨迹构建和测试阶段引入验证机制,提升深度研究代理在长周期任务中的性能,实验表明其在BrowseComp等基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27451 2026-03-31 cs.CL cs.AI 73%

Multi-Agent Dialectical Refinement for Enhanced Argument Classification

多智能体辩证细化用于增强论证分类

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MAD-ACC框架,通过多智能体辩论解决论证分类不确定性,实现85.7%的宏F1分数,无需领域特定训练,提供可解释的辩论记录。

Comments Accepted for publication in the proceedings of ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27318 2026-03-31 cs.HC 71%

Supporting Reflection and Forward-Looking Reasoning With Data-Driven Questions

通过数据驱动问题支持反思与前瞻性推理

Simon WS Fischer, Hanna Schraffenberger, Serge Thill, Pim Haselager

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文探讨通过数据驱动问题促进反思与前瞻性推理,提出问题分类法、医疗领域原型及临床反馈、基于大语言模型的问题生成方法及认知参与度测量量表,旨在推动思维工具的设计与评估。

Comments Accepted at CHI2026 Workshop on Tools for Thought, April 16, 2026, in Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 70%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28106 2026-03-31 cs.HC 67%

InconLens: Interactive Visual Diagnosis of Behavioral Inconsistencies in LLM-based Agentic Systems

InconLens:交互式可视化诊断LLM基于代理系统的行为主观不一致性

Shuo Yan, Xiaolin Wen, Shaolun Ruan, Yanjie Zhang, Jiaming Mi, Yushi Sun, Huamin Qu, Rui Sheng

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出InconLens系统,通过信息节点抽象实现跨运行行为分析,帮助开发者更高效识别分歧点并提升代理系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04618 2026-03-31 cs.LG cs.AI cs.CL 67%

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

代理情境工程:为自我改进语言模型演化情境

Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun

机构 * Stanford University(斯坦福大学) SambaNova Systems, Inc.(SambaNova Systems公司) UC Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ACE框架,通过生成、反思和整理的模块化过程,使情境持续进化,提升语言模型在代理和领域推理中的性能,减少适应延迟和成本。

Comments ICLR 2026; 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG 62%

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28569 2026-03-31 cs.LG cs.AI cs.IR cs.PF 62%

CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments

CirrusBench:在真实云服务环境中评估基于LLM的代理超越正确性的能力

Yi Yu, Guangquan Hu, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Junzhuo Ma, Weiting Liu, Jianfeng Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University(复旦大学数学科学学院) Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) Alibaba Group(阿里巴巴集团) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学应用数学中心暨上海市现代应用数学重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CirrusBench框架,基于真实云服务工单数据评估LLM代理的鲁棒性和解决效率,引入客户导向指标量化服务质量,揭示现有模型在复杂多轮任务中的不足。

Comments Submitted for SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05548 2026-03-31 cs.LG cs.AI 62%

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

揭示隐含的优势对称性:为什么GRPO在探索和适应难度上遇到困难

Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文指出GRPO在探索和适应难度上的瓶颈源于隐含的优势对称性,提出不对称GRAE方法提升探索效率和学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16216 2026-03-31 cs.AI cs.LG 62%

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 62%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27164 2026-03-31 cs.AI cs.CL 62%

daVinci-LLM:Towards the Science of Pretraining

daVinci-LLM:迈向预训练的科学

Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

机构 * SII SJTU(上海交通大学) GAIR

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出daVinci-LLM,通过结合工业级资源与科研自由,探索预训练的科学方法。采用开放范式,通过数据达尔文主义框架和两阶段适应课程,训练3B参数模型,验证处理深度对能力的影响及不同领域饱和动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI 57%

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18151 2026-03-31 cs.DC cs.AR cs.CV cs.LG cs.NI 57%

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(国民大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。

Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27127 2026-03-31 cs.CR 50%

Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction

Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互

Tran Vy Khang, Nguyen Dang Nguyen Khang, Nghi Hoang Khoa, Do Thi Thu Hien, Van-Hau Pham, Phan The Duy

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏