arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 23 篇

2508.02178 2026-06-30 cs.AI 89%

Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning

重新审视过度思考:在CoT推理中惩罚内部和外部冗余

Taihang Zhen, Jialiang Hong, Kai Chen, Guang Yang, Junlan Feng, Wenpeng Zhu, Jing Huo, Yang Gao, Depeng Wang, Haitao Wan, Xi Yang, Fanyu Meng, Yuyao Zhang, Ji Qi, Xiangyu Zhou

机构 * Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文从语义效率角度重新审视过度思考问题,将CoT冗余分为内部和外部两种类型,并提出双惩罚强化学习框架以优化推理过程和终止行为,实验表明该方法在不同模型规模上显著减少推理长度并保持高精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23559 2026-06-30 cs.CR cs.AI cs.CV 83%

CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training

针对原生GUI代理的CAPTCHA解决:自动化推理-行动数据生成与自我纠正训练

Yuxi Chen, Haoyu Zhai, Chenkai Wang, Rui Yang, Lingming Zhang, Gang Wang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ReCAP,一种能解决现代交互式CAPTCHA挑战的原生GUI代理,通过自动化数据生成和自我纠正训练提升CAPTCHA解决能力,同时保持通用GUI任务性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30378 2026-06-30 cs.CV 82%

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

OmniCoT: 全局与多步骤全景推理基准

Haocong He, Chenfei Liao, Zichen Wen, Zihao Dongfang, Xu Zheng, Bin Ren, Chang Su, Zixin Zhang, Harold Haodong Chen, Hongfei Zhang, Weijia Li, Kailun Yang, Conghui He, Xuming Hu, Nicu Sebe, Linfeng Zhang

机构 * MBZUAI Shanghai AI Lab(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出OmniCoT基准,通过链式思维标注和两阶段训练策略,增强多模态大模型在全景图像中的全局多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29164 2026-06-30 cs.LG cs.AI cs.CG 81%

Invariant Reasoning Directions in Latent Trajectories of Language Models

语言模型潜在轨迹中的不变推理方向

Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut, Yash Ravindra Charde, Vivek Gupta, Yanjie Fu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现潜在推理轨迹中存在稳定不变方向,提出TILR方法通过低秩子空间干预提升推理一致性与稳定性。

Comments 9 main text pages and 6 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30189 2026-06-30 cs.CL 79%

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI 79%

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13562 2026-06-30 cs.CR cs.AI cs.CL 73%

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡

Yanbo Wang, Minzheng Wang, Jian Liang, Lu Wang, Yongcan Yu, Ran He

机构 * Ritzz-AI

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28570 2026-06-30 cs.CV cs.AI cs.MA 70%

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG

数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架

Deep Ghosal, Ishani Sen, Wazib Ansar, Amlan Chakrabarti

机构 * A.K. Choudhury School of Information Technology University of Calcutta(A.K.楚德里信息科技学院印度加尔各答大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 提出基于LLM的混合智能体框架,结合计算机视觉与视觉语言模型,通过3×3智能网格分块策略降低计算开销,并引入LLM-as-a-Judge自校正循环和双持久化RAG管道,实现符合印度体育局标准的自动化整体运动员评估。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03555 2026-06-30 cs.AI 70%

SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

SCRIBE:结构化中层监督用于工具使用语言模型

Yuxuan Jiang, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SCRIBE通过引入中层抽象监督框架,减少多步推理中的信用分配难度,提升工具使用代理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI 62%

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29503 2026-06-30 cs.CL cs.AI 62%

The Verbose Context Problem in Medical Records

医疗记录中的冗长上下文问题

Shiva Kaul, Min-Gyu Kim, Anjum Khurshid, Sriram Vishwanath

机构 * Department of Population Medicine(人口医学部) Department of Biomedical Informatics(生物医学信息学部) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对群体健康分析中结构化概念导致的长文本瓶颈,提出PopMedQA基准,通过人工患者记录生成库neopatient构建任务,发现领域无关方法无法缓解该问题。

Comments SD4H ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14872 2026-06-30 cs.LG cs.AI math.OC stat.ML 62%

On the Emergence of Implicit Curriculum in RLVR Learning Dynamics

在RLVR学习动态中隐式课程的出现

Yu Huang, Zixin Wen, Yuejie Chi, Yuting Wei, Aarti Singh, Yingbin Liang, Yuxin Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了RLVR中隐式课程的形成机制,通过理论分析和实验验证,发现混合难度训练能自然诱导隐式课程,使简单问题先被学习并为更难问题奠定基础,其效果由难度谱的平滑性决定。

Comments This is the full version of a paper published at ICML 2026. V3 adds experiments and polishes writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11351 2026-06-30 cs.AI cs.LG 62%

Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization

推动主动代理的帕累托前沿:行为代理优化

Yihang Yao, Zhepeng Cen, Haohong Lin, Shiqi Liu, Zuxin Liu, Jiacheng Zhu, Zhang-Wei Hong, Laixi Shi, Ding Zhao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出行为代理优化框架,通过增强和规范回合间行为,提升信息获取能力并抑制低效交互,从而在任务性能与用户参与间取得平衡,优于现有主动代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 57%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 57%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28361 2026-06-30 cs.IR cs.AI cs.IT math.IT 57%

ConCise: Training-Free Conclusion-Chain State Compression for Cost-Efficient Multi-Step RAG Services

ConCise: 免训练结论链状态压缩用于经济高效的多步RAG服务

Kuan Yan, Zhiqing Tang, Tian Wang, Weijia Jia

机构 * National Natural Science Foundation of China(国家自然科学基金委员会) Guangdong Higher Education Association(广东省高等教育协会) Guangdong Provincial Higher Education Institutions(广东省高等教育机构) Beijing Normal University at Zhuhai Education Reform Project(珠海市北京师范大学教育改革项目)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多步RAG中累积输入令牌呈O(N²)增长导致成本高的问题,提出免训练状态层协议ConCise,通过结构化结论链将增长压缩至O(N),并引入融合生成机制减少API调用,平均节省64.63%令牌且保持可接受精度。

Comments to be published in IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15044 2026-06-30 cs.AI cs.NI 57%

Agentic AI for ISAC: Analysis, Framework, and Case Study

面向ISAC的代理AI:分析、框架与案例研究

Wenwen Xie, Geng Sun, Chuang Zhang, Xuejie Liu, Dong In Kim

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨代理AI在ISAC系统中的应用价值,提出新型框架并验证其优化性能,分析代理AI在动态环境中的感知-推理-行动循环优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 50%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30029 2026-06-30 astro-ph.IM 50%

ESOFinder: an LLM-powered tool to help users navigate ESO documentation

ESOFinder:一个基于LLM的工具,帮助用户浏览ESO文档

P. Sánchez-Sáez, C. Reinero, M. Vioque, M. Wittkowski, M. Rejkuba, M. Romaniello, A. Barnes, J. Pritchard, M. Marsset

专题命中 复杂问题求解 :planning(abstract)

AI总结 针对ESO文档量大且多样导致用户查找困难的问题,开发了基于大语言模型和检索增强生成的ESOFinder聊天机器人,集成多类文档提供精准答案,减少幻觉,提升可靠性。

Comments Submitted to SPIE Astronomical Telescopes and Instrumentation 2026, paper number 14155-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29905 2026-06-30 cs.CV 50%

StrucTab: A Structured Optimization Framework for Table Parsing

StrucTab: 一种用于表格解析的结构化优化框架

Gengluo Li, Shangpin Peng, Chengquan Zhang, Binghong Wu, Hao Feng, Weinong Wang, Pengyuan Lyu, Huawen Shen, Xingyu Wan, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出StrucTab框架,通过中间结构监督和奖励分解优化表格解析,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03207 2026-06-30 eess.SP 50%

Phy2-ExposNet: A Physics-Informed Neural Network for EMF Exposure Mapping in Complex Urban Environments

Phy2-ExposNet:一种用于复杂城市环境中EMF暴露映射的物理信息神经网络

Shuangning Li, Yarui Zhang, Shanshan Wang, Joe Wiart

专题命中 复杂问题求解 :planning(abstract)

AI总结 提出Phy2-ExposNet,将暴露映射分解为物理信息估计和Transformer残差细化阶段,在降低模型复杂度80%以上的同时实现约15%的相对误差降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28791 2026-06-30 cs.SE 50%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28348 2026-06-30 cs.NI 50%

Intent-Driven 6G Service Orchestration: Grounded Translation, Validation, and Decomposition

意图驱动的6G服务编排:基于目录的翻译、验证与分解

Jean Martins, Leonid Mokrushin, Marin Orlic, Amardeep Kumar A

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出一个三阶段智能体工作流,通过语义服务目录、SHACL验证和约束满足分解,实现6G意图驱动编排,在930次基准测试中成功率达97%,并减少26%的对抗性幻觉。

Comments AI4NextG @ ICML'26 Workshop on AI and ML for Next-Generation Wireless Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏