arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 348 篇

2606.14211 2026-06-15 cs.AI cs.LG 新提交 62%

Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL

缩小反思差距:面向智能体强化学习的免费校准奖励

Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体在环境反馈后自我评估不准确的问题,提出RefGRPO方法,通过对比反思与实际结果计算免费校准奖励并动态调整系数,同时提升反思校准和任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12479 2026-06-12 cs.LG cs.AI 新提交 62%

ReCal: Reward Calibration for RL-based LLM Routing

ReCal: 基于强化学习的LLM路由的奖励校准

Qihang Yu, Hanwen Tong, Zhengqi Zhang, Bo Zheng, Feng Wei, Shengyu Zhang, Zemin Liu, Fei Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ReCal框架,通过分层奖励分解和分布感知优化校准奖励信号,解决多目标冲突和异质性任务优化偏差,提升LLM路由性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11070 2026-06-10 cs.CL cs.AI 新提交 62%

T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains

T1-Bench:真实世界领域中的多场景智能体基准测试

Genta Indra Winata, Amartya Chakraborty, Yuzhen Lin, Swasthi P Rao, Shikhhar Siingh, Houhan Lu, Nadia Bathaee, Sriharsha Hatwar, Paresh Dashore, Anmol Jain, Kshitij Tayal, Xiuzhu Lin, Anirban Das, Sambit Sahu, Shi-Xiong Zhang

机构 * Capital One(第一资本)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出T1-Bench,一个高保真、全面的基准,用于评估多领域真实客户场景中的智能体系统,通过交织的多轮交互任务提升复杂性和评估严谨性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10385 2026-06-10 cs.LG cs.AI 新提交 62%

Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation

超越绝对模仿:基于锚定残差引导的特权在线蒸馏

Wenhao Zhang

机构 * South China University of Technology(华南理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出锚定残差在线蒸馏(AR-OPD),通过部分特权教师建立局部兼容锚点并注入受控残差,解决特权在线蒸馏中后见偏差导致的局部不可达问题,在推理任务上平均提升2.3个点。

Comments 17 pages, 8 figures. Project page: https://vanhowe.github.io/AR-OPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09883 2026-06-10 cs.LG cs.AI 新提交 62%

TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

TD-Grokking:通过训练时分解从零奖励问题中学习

Ningyuan Xi, Hao Xu, Hongsheng Xin, Ning Miao

机构 * Ningyuan Xi 1,2(西宁元 1,2) Hao Xu 3(许浩 3) Hongsheng Xin 3(辛红生 3) Ning Miao 1,2, †(苗宁 1,2, †)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习在零奖励问题上无法提供优化信号的问题,提出训练时分解框架TD-Grokking,将难解问题递归分解为可验证子问题,在数学和医疗任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08496 2026-06-09 cs.CL cs.LG 新提交 62%

SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

SAEExplainer: 基于激活引导偏好优化的SAE特征解释

Jingyi He, Haiyan Zhao, Ruxue Shi, Yanguang Liu, Xin Wang, Fei Sun, Mengnan Du

机构 * Shanghai Jiao Tong University(上海交通大学) NJIT(新泽西理工学院) Jilin University(吉林大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 提出SAEExplainer框架,利用激活分数作为奖励信号,通过两轮优化迭代自纠正基础解释,减少解释幻觉并增强因果触发模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08340 2026-06-09 cs.AI cs.LG cs.MA 新提交 62%

Benchmarking Open-Ended Multi-Agent Coordination in Language Agents

开放式多智能体协作在语言智能体中的基准测试

Kale-ab Abebe Tessera, Andras Szecsenyi, Cameron Barker, Alexander Rutherford, Davide Paglieri, Aidan Scannell, Henry Gouk, Elliot J. Crowley, Tim Rocktäschel, Amos Storkey

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于JAX的开放式多智能体协作基准Alem,评估13种现代LLM在长时生存世界中的零样本协作能力,发现协调能力是前沿LLM智能体的独立瓶颈。

Comments 42 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07812 2026-06-09 cs.AI cs.CL 新提交 62%

Scaling Participation in Modular AI Systems

模块化AI系统中的参与扩展

Shangbin Feng, Yike Wang, Weijia Shi, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07710 2026-06-09 cs.LG cs.AI 新提交 62%

WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing

WhiFlash: 通过令牌级跨范式路由加速推测解码

Young D. Kwon, Miles Williams, Rui Li, Alexandros Kouris, Stylianos I. Venieris

机构 * Samsung AI Center, Cambridge, UK(三星AI中心,剑桥,英国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出WhiFlash,首个统一自回归与扩散并行草稿的跨范式推测解码方法,通过细粒度路由和缓存优化实现高达69.6%的吞吐量提升。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07547 2026-06-09 cs.CL cs.AI cs.SD 新提交 62%

Liberating LLM Capabilities in Full-Duplex Speech Models

在全双工语音模型中释放LLM能力

Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

机构 * Royal Zhang(皇家张)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Listen-Write-Speak (LWS)三通道范式,使LLM在共享因果注意力上下文中同时监听、书写可见文本并实时口语回应,无需架构修改,实现全双工交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14065 2026-08-17 cs.SE cs.AI 新提交 57%

Rethinking Automated Program Repair: The Impact of Bug Complexity, Fault Localization, and LLM Cost-efficiency

重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响

Junchi Liu, Ali Bigdeli, Roya Daneshi, Atu Ambala, Sudipto Ghosh, Fabio Santos

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。

Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14047 2026-08-17 cs.RO cs.AI cs.CV 新提交 57%

Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use

将视觉-语言-动作模型进化为具备即时工具使用能力的智能体

Yi Ding, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang

机构 * Astribot(星舟机器人) Tsinghua University(清华大学) Juxi Tech(矩芯科技) IntelliFusion Inc.(智融公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出带工具使用的智能体机器人(ART)框架,调优VLA模型以利用工具模块,在模拟及真实任务中成功率较基线高20%,为VLA系统实际部署奠定基础。

Comments 12 pages, 4 figures, Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern (CVPR) Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12351 2026-08-14 cs.CY cs.AI 新提交 57%

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

生成式人工智能(GenAI)时代的评估设计:用于测试学生AI素养、学习成果与反思的X1-X2-X3评估模式

Riasat Islam, Thomas Roelleke

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文针对GenAI对在线评估的挑战,提出可复用的X1-X2-X3评估模式,用于测试学生AI素养等,为教师适配GenAI时代评估提供实践指导。

Comments 30 pages, 1 figure, 11 tables. Submitted to the following journal: Assessment & Evaluation in Higher Education (Taylor & Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12338 2026-08-14 cs.CL 新提交 57%

SDAM: Structure-Difference-Aware Memory Evolution for Complex Text-to-SQL

SDAM:面向复杂文本转SQL的结构差异感知记忆演化

Keyan Xu, Dingzirui Wang, Xuanliang Zhang, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对现有文本转SQL记忆设计的缺陷,提出SDAM方法,集成至SDAM-SQL框架,在BIRD-dev和Spider-test数据集上实现指标提升,验证了方法有效性。

Comments 19 pages, 5 figures, 12tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12326 2026-08-14 cs.CL 新提交 57%

On Measuring Semantic Preservation in Legal Ontology Learning

论法律本体学习中的语义保留度量

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文针对法律本体学习的语义保留评估问题,提出通过对比LLM在源文档与转换后表示上的任务性能量化语义损失,经多模型多方法实验发现语义损失随模型-方法配对显著变化,为法律知识系统配置选择提供指导。

Comments Accepted for publication at the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10339 2026-08-12 stat.ME cs.AI stat.AP 新提交 57%

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

基于大型语言模型的专家引导g计算法估计时序因果效应:在医院质量改进中的应用

Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie, Lucas Zier, Fan Xia, Jean Feng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出专家引导g计算法(egg-computation),结合专家判断与LLM技术,用于估计医院干预措施对平均住院时长的因果效应,在模拟和真实医院数据中表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10974 2026-08-12 cs.CL 新提交 57%

MUSE: A Full-Text Cross-Domain Knowledge Base of Scientific Problems, Solutions, and Rationales

MUSE:一个包含科学问题、解决方案及原理的全文跨领域知识库

Tsofia Cohen, Tom Hope

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Allen Institute for AI (Ai2)(艾伦人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出MUSE知识库,通过模块化抽取流程构建含3.7万个P-S-R三元组的跨领域资源,实验表明原理监督可提升复杂问题的性能但会损害简单问题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10504 2026-08-12 cs.AI 新提交 57%

MEGA: Self-Evolving Agent Optimization Infrastructure via Wisdom Graph

MEGA:基于智慧图的自进化智能体优化基础设施

Jung Hwan Lee, Kyu Ho Lee, Gwang Hoon Yoo

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MEGA是一种自进化智能体优化基础设施,通过三层架构实现智慧积累、组合推理与自进化,可系统性优化异构智能体系统,将优化与知识进化融为一体。

Comments 29 pages, 10 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10448 2026-08-12 cs.AI 新提交 57%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

Journal ref S. Oh, J. U. Kim and S. Lee, "Rationale-Guided Learning for Multimodal Emotion Recognition," ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 12577-12581

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-12 cs.AI 新提交 57%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 25 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 57%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 57%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09253 2026-08-11 cs.AI 新提交 57%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09044 2026-08-11 cs.CL 新提交 57%

Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents

经验树:面向自我进化智能体的分层经验管理

Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu, Junbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出经验树(ToE)框架,将经验组织与LLM智能体分层推理对齐,在“24点游戏”和“金融进化基准”上大幅提升了解题性能与效率,解决了现有经验表示与推理过程脱节的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交 57%

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交 57%

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 57%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 57%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05381 2026-08-07 cs.AI 新提交 57%

C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

C³PO:评估全模态模型中的跨模态组合与反事实性能

Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu, Ponnurangam Kumaraguru

机构 * Microsoft Research India(微软研究院印度分院) IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏