arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-19 至 2026-05-19 共收录 279 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 23 篇

2605.18252 2026-05-19 cs.CV 50%

GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance

GaussianZoom: 一种结合几何和语义引导的渐进式缩放生成3D高斯点云

Jiale Shi, Jiarui Hu, Zesong Yang, Kaixuan Luan, Hujun Bao, Zhaopeng Cui

机构 * State Key Lab of CAD & CG(计算机辅助设计与图形学国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GaussianZoom,一种结合几何一致场景建模和多尺度语义推理的生成式缩放3D重建系统,通过迭代渐进框架实现从低分辨率输入生成高保真的极端缩放渲染。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17478 2026-05-19 cs.CV 50%

Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory

Mamba-VGGT: 通过外部滑动窗口Mamba内存实现持久长序列视频几何 grounded 变换器

Tianchen Deng, Zhenxiang Xiong, Nailin Wang, Fangjinhua Wang, Jiuming Liu, Jianfei Yang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zurich(苏黎世联邦理工学院) Cambridge University(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Mamba-VGGT框架,通过引入滑动窗口Mamba内存模块,解决传统VGGT在长序列视频中几何遗忘和累积漂移问题,提升3D场景重建的精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 21 篇

2605.17672 2026-05-19 cs.CL 85%

Stop When Reasoning Converges: Semantic-Preserving Early Exit for Reasoning Models

停止当推理收敛:用于推理模型的语义保留早退出

Dehai Min, Giovanni Vaccarino, Huiyi Chen, Yongliang Wu, Gal Yona, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Google Research(谷歌研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Politecnico di Milano(米兰理工学院)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出PUMA框架,通过识别推理层面的语义冗余信号,实现语义保留的早退出,从而在保持准确性和推理链完整性的同时减少token消耗。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15177 2026-05-19 cs.AI 85%

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink: 通过布拉德利-蒂尔利聚合实现并行推理

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) UC Berkeley(伯克利大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究提出OpenDeepThink框架,通过布拉德利-蒂尔利聚合方法在测试时扩展计算资源,以提高大语言模型的推理能力,通过并行选择候选方案并消除选择瓶颈,从而提升模型在Codeforces等领域的表现。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01857 2026-05-19 cs.AI 85%

Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning

通过逆强化学习学习推理奖励从专家示范

Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 测试时计算 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本文提出了一种名为Reasoning Adversarial Inverse Reinforcement Learning (R-AIRL)的方法,通过逆强化学习从专家示范中学习推理奖励,以克服传统监督微调的局限性,并在多个数据集上展示了其在训练和推理过程中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14004 2026-05-19 cs.CL 84%

Early Stopping Chain-of-thoughts in Large Language Models

大语言模型中的早期停止思维链

Minjia Mao, Bowen Yin, Yu Zhu, Xiao Fang

机构 * University of Delaware(德克萨斯大学) Peking University(北京大学)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07292 2026-05-19 cs.AI cs.CL cs.CV 84%

EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis

EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断

Yi Tang, Kai-Ni Wang, Yang Chen, Xiaopu He, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。

Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE 79%

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22297 2026-05-19 cs.CL 79%

Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate

从自我辩论中学习:为多智能体辩论准备推理模型

Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SDRL框架,通过自我辩论训练使模型具备独立问题解决能力和多智能体辩论中的多样化推理处理能力,实验表明其在多辩论协议和智能体配置下均能提升多智能体辩论性能和单模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17104 2026-05-19 cs.AI 79%

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

具有科学逻辑性的方法论:LLM推理的实践:物理学

Zhaoxin Yu, Nan Xu, Kun Chen, Jiahao Zhao, Lei Wang, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China Beijing Wenge Technology Co., Ltd, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16899 2026-05-19 cs.CV 78%

LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map

LASAR:迈向基于潜在认知图的时空推理

Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出LASAR架构,通过双记忆系统维护事件经历和语义认知图,并引入ST-CRL对比目标训练该架构,以提升长距离碎片化经验中对细粒度空间关系的编码能力,在标准VLN-CE和VSI-Bench基准上实现了零样本泛化能力的2%-3.5%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-05-19 cs.AI cs.CL cs.LG 75%

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 56 pages, 27 figures, 4 tables. Code: https://github.com/facebookresearch/gim ; Dataset: https://huggingface.co/datasets/facebook/gim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02218 2026-05-19 cs.LG cs.AI cs.CL cs.IT math.IT 75%

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

仅在自我合成管道确保可学习信息增益时,自我博弈才会进化

Wei Liu, Siya Qi, Yali Du, Yulan He

机构 * King's College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实验揭示可持续自我进化需要可学习信息递增的自我合成数据管道,提出自我进化LLM的三重角色及系统设计,解决自我博弈停滞问题。

Comments 10 pages, 6 figures, 7 formulas, accepted by ICML 2026 position paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18703 2026-05-19 cs.CL cs.LG 62%

EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL

EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体

Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang, Xiao Zhu, Yinhong Liu, Boyu Zhu, Baiyu Huang, Chao Chen, Heyuan Deng, Fei Mi, Lifeng Shang, Xingshan Zeng, Zhijiang Guo

机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) University of Cambridge(剑桥大学) UCL(伦敦大学学院) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18374 2026-05-19 cs.LG cs.AI 62%

Beyond Inference-Time Search: Reinforcement Learning Synthesizes Reusable Solvers

超越推理时间搜索:强化学习合成可重用求解器

Soheyl Massoudi, Gabriel Apaza, Milad Habibi, Mark Fuge

机构 * ETH Zürich(苏黎世联邦理工学院) University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了强化学习能否将组合优化的推理成本转移到代码LLM的权重中,从而合成可重用的求解器。通过Synergistic Dependency Selection问题,研究发现强化学习能有效生成约束感知的模拟退火模板,并在多个领域展示出更高的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL 62%

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16787 2026-05-19 cs.LG cs.CL 62%

The Unlearnability Phenomenon in RLVR for Language Models

在语言模型中RLVR的不可学习现象

Yulin Chen, He He, Chen Zhao

机构 * New York University(纽约大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了RLVR在提升大语言模型推理能力中的学习动态,发现即使存在正确回放,某些难例仍无法学习,揭示了当前RL方法在推理任务中的根本限制。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08141 2026-05-19 cs.LG 57%

SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training

SCOPE-RL: 稳定和定量控制强化学习后训练中的策略熵

Chen Wang, Zhaochun Li, Jionghao Bai, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SCOPE-RL框架,通过温度自适应的正样本构造正则化项,稳定并定量控制强化学习后训练中的策略熵,实验表明其在Pass@1和Pass@$k$任务上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18031 2026-05-19 quant-ph cs.AI 57%

Quantum Sidecar Architectures for Hybrid AI Training and Inference: Stateful Protected Registers, Stateless Reset-and-Reprepare Circuits and Quantum Weight-State Outlook

用于混合AI训练和推理的量子Sidecar架构:状态保护寄存器、无状态重置和重新准备电路以及量子权重状态展望

Y. Mo, G. D. Su

机构 * Independent Researcher(独立研究者;BroadLink公司) BroadLink Co., Ltd.(杭州电子科技大学副教授) Associate Professor, Hangzhou Dianzi University

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于未来混合AI训练和推理的量子Sidecar架构家族,通过状态保护寄存器和无状态重置和重新准备模式,为优化器侧采样、适配器或专家选择、检索、路由和推理路径提案提供有界信号生成器,并引入了量子权重状态Sidecar作为受限的量子表示。

Comments 14 pages, 8 figures. Architecture and small-scale simulation study; no hardware experiment or quantum-advantage claim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 57%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16462 2026-05-19 cs.CR cs.AI 57%

Asking Back: Interaction-Layer Antidistillation Watermarks

反向提问:交互层反知识蒸馏水印

Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出交互层反知识蒸馏水印,通过教师模型的行为特征进行水印,验证其在不同模型上的有效性与鲁棒性。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18311 2026-05-19 cs.HC 50%

Distorted Perspectives of LLM-Simulated Preferences: Can AI Mislead Design?

LLM模拟偏好中的扭曲视角:AI是否能误导设计?

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 测试时计算 :reasoning(abstract)

AI总结 本研究探讨了LLM驱动的模拟方法所表达的设计偏好与真实用户偏好的一致性,发现LLM模拟在多个操纵下均存在系统性差异,其合成解释缺乏真实深度和细微差别,主要通过关注通用属性、特定元素、详述和过度赞扬等模式来替代。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 28 篇

2602.09805 2026-05-19 cs.CL cs.AI cs.LG 85%

Beyond Accuracy: Decomposing the Reasoning Efficiency of LLMs

超越准确率:分解大语言模型的推理效率

Daniel Kaiser, Arnoldo Frigessi, Ali Ramezani-Kebrya, Benjamin Ricaud

机构 * Integreat - Norwegian Centre for knowledge-driven machine learning(Integreat - 挪威知识驱动机器学习中心) UiT - The Arctic University of Norway(UiT - 北极大学) University of Oslo(奥斯陆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无需追踪的评估协议,通过完成率、条件正确性和生成长度三个指标分解大语言模型的token效率,同时考虑任务工作量元数据进行归一化处理,并评估模型在不同任务上的推理效率和冗余问题。

Comments Preprint (under review). 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-05-19 cs.CV cs.CL 84%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :chain-of-thought(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17305 2026-05-19 cs.AI cs.CL 84%

CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models

CyberCorrect: 一种基于闭环自修正的大型语言模型框架

Yuning Wu, Yingmin Liu, Yang Shu

机构 * School of Software, Henan University, Kaifeng, China(河南大学软件学院,开封,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CyberCorrect框架,将大型语言模型的自我修正建模为闭环控制系统,通过三模态错误检测器、类型导向的修正控制器和收敛判断器,提升模型的自我修正能力和准确性。

Comments 6 pages, 1 figure, submitted to IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18572 2026-05-19 cs.CL 81%

MA$^{2}$P: A Meta-Cognitive Autonomous Intelligent Agents Framework for Complex Persuasion

MA$^{2}$P: 一种用于复杂说服的元认知自主智能体框架

Dingyi Zhang, Ziqing Zhuang, Linhai Zhang, Ziyang Gao, Deyu Zhou

机构 * School of Computer Science and Engineering, Key Laboratory of Computer Network and Information Integration, Ministry of Education, Southeast University, China(计算机科学与工程学院、计算机网络与信息集成重点实验室、教育部、东南大学,中国) Department of Informatics, King’s College London(信息学院、伦敦国王学院)

专题命中 复杂问题求解 :reasoning(abstract,abstract_cn);planning(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出MA$^{2}$P框架,通过自主多智能体架构和元认知配置器,解决复杂说服中说服者需解读内部状态、推断潜在心理状态并生成策略一致行动的挑战,提升说服成功率。

Comments 22 pages, 8 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17088 2026-05-19 cs.CL 81%

ACIL: Auto Chain of Thoughts for In-Context Learning

ACIL: 自动链式思维用于上下文学习

Rui Chu

机构 * Rui Chu(楚瑞)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出ACIL框架,通过自动构建包含推理步骤的演示来提升上下文学习在多步推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22530 2026-05-19 cs.AI 79%

Enhancing Table Reasoning with Deterministic Table-State Rewards

通过确定性表格状态奖励增强表格推理

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University College London(伦敦大学学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manitoba(曼尼托巴大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TABROUGE,一种无需训练的确定性状态奖励,通过改进的LCS指标评估表格状态,提升表格推理准确率并减少样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18153 2026-05-19 cs.SE 78%

Three Heads Are Better Than One: A Multi-perspective Reasoning Framework for Enhanced Vulnerability Detection

三个头比一个好:一种多视角推理框架以增强漏洞检测

Xin Peng, Bo Lin, Jing Wang, Xiaoling Li, Jun Ma, Jie Yu, Xiaoguang Mao, Shangwen Wang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出ReasonVul,一种多视角推理框架,通过三个专门的LLM代理的认知协同,提高漏洞检测的准确性和全面性,其在PrimeVul数据集上实现了40.00%的PairAcc和72.52%的F1分数,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏