arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 112 篇

2604.10917 2026-04-14 cs.CL 83%

HTAA: Enhancing LLM Planning via Hybrid Toolset Agentization & Adaptation

HTAA:通过混合工具集代理化与适应增强大语言模型规划

Chengrui Huang, Junshuo Zhang, Zhiyuan Ma, Xikun Wang, Ximeng Wang, Menghua Jiang, Gang Zeng, Zhaobing Han, Shen Gao, Shuo Shang

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi Global Inc.(滴滴全球股份有限公司)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HTAA框架,通过混合工具集代理化与适应方法,提升大语言模型在复杂任务中的规划效率与可靠性,实验表明其在任务成功率、工具调用轨迹长度及上下文开销方面均优于基线模型。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI 83%

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04038 2026-04-14 cs.CL cs.CV 83%

ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents

ZARA:通过证据驱动的LLM代理实现无训练的运动时间序列推理

Zechen Li, Baiyu Chen, Hao Xue, Flora D. Salim

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼校区) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ZARA通过证据驱动的LLM代理实现无训练的运动时间序列推理,利用参考数据构建统计学基础的知识库,提升活动识别的泛化能力和跨领域适应性。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 82%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27269 2026-04-14 cs.CL cs.AI cs.LG 82%

Why Do Multilingual Reasoning Gaps Emerge in Reasoning Language Models?

为何多语言推理模型中会出现多语言推理差距?

Deokhyung Kang, Seonjeong Hwang, Daehui Kim, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) Agentic AI Lab, KT(KT公司Agentic AI实验室) Department of Computer Science and Engineering, POSTECH(浦项工业大学计算机科学与工程系)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了多语言推理模型中存在多语言推理差距的原因,发现语言理解失败是主因,并提出Selective Translation策略有效缓解了这一问题。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG 82%

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 81%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10455 2026-04-14 cs.CL 81%

EviCare: Enhancing Diagnosis Prediction with Deep Model-Guided Evidence for In-Context Reasoning

EviCare: 通过深度模型引导的证据增强诊断预测

Hengyu Zhang, Xuyun Zhang, Pengxiang Zhan, Linhao Luo, Hang Lv, Yanchao Tan, Shirui Pan, Carl Yang

机构 * Macquarie University(麦考瑞大学) Fuzhou University(福州大学) Monash University(莫纳什大学) Griffith University(格里菲斯大学) Emory University(埃默里大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 EviCare通过整合深度模型指导的证据选择、证据优先级排序和关系证据构建,提升基于LLM的诊断预测性能,在MIMIC-III和MIMIC-IV数据集上实现20.65%的平均提升,尤其在新诊断预测上提升显著。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04842 2026-04-14 cs.LG cs.AI 81%

Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展

Kusha Sareen, Morgane M Moss, Alessandro Sordoni, Rishabh Agarwal, Arian Hosseini

机构 * Mila, McGill University(Mila,麦吉尔大学) Mila, Université de Montréal(Mila,蒙特利尔大学) Microsoft Research, Mila(微软研究院,Mila) Google DeepMind, Mila(谷歌DeepMind,Mila)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10667 2026-04-14 cs.CL cs.AI cs.LG 80%

Learning and Enforcing Context-Sensitive Control for LLMs

学习与强制上下文敏感控制用于大语言模型

Mohammad Albinhassan, Pranava Madhyastha, Mark Law, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院) City University of London(伦敦城市大学) ILASP Limited, UK(英国ILASP有限公司) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种自动学习上下文敏感约束的框架,通过两阶段过程提升LLM生成的有效性,使小型模型也能完美遵守约束,优于其他方法。

Comments ACL 2025 Student Research Workshop

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop), pages 834-842, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 80%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11206 2026-04-14 cs.SE cs.AI 79%

Designing Adaptive Digital Nudging Systems with LLM-Driven Reasoning

基于LLM驱动推理的自适应数字引导系统设计

Tiziano Santilli, Mina Alipour, Mahyar Tourchi Moghaddam

机构 * Syddansk Universitet(南丹麦大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种将行为科学与软件设计结合的自适应数字引导系统架构,通过整合多维用户建模与伦理合规,验证了其在住宅能源可持续性中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10506 2026-04-14 cs.AI 79%

A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning

一种用于对抗具身推理中时空幻觉的渐进训练策略

Xiaoda Yang, Shuai Yang, Can Wang, Jingyang Xue, Menglan Tang, Checheng Yu, Xunzhe Zhou, Sashuai Zhou, Tao Jin, Lixin Yang, Xiangyu Yue, Zhou Zhao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学) Qingdao University(青岛大学) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of YYY(YYY大学) Institute of WWW(WWW研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种渐进训练框架,通过构建CoT数据集和弱标签数据提升视觉语言模型的时空推理能力,有效缩小了正反向性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05549 2026-04-14 cs.CL 79%

Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents

不要执着于提示:针对LLM代理的推理劫持与约束紧缩

Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出JailAgent框架,通过触发提取、推理劫持和约束紧缩三个阶段,避免修改用户提示,提升跨模型和跨场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09676 2026-04-14 cs.LG cs.AI 79%

A Comparative Theoretical Analysis of Entropy Control Methods in Reinforcement Learning

强化学习中熵控制方法的比较理论分析

Ming Lei, Christophe Baehr

机构 * Shanghai Jiao Tong University(上海交通大学) Météo France/CNRS, Université de Toulouse, CNRM UMR 3589(法国气象局/法国国家科学研究中心,图卢兹大学,国家气象研究中心 UMR 3589)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了传统熵正则化与基于协方差的熵控制方法,揭示了熵变化由log-probabilities与logit更新的协方差决定,传统方法引入持续偏差导致次优策略,而基于协方差方法通过稀疏正则化实现无偏性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11177 2026-04-14 cs.CV 78%

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

推理流是否重要?评估Gemini视觉-语言模型在视频场景理解中的推理能力

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 研究评估了Gemini视频语言模型中推理流对视频场景理解的影响,提出三个评估指标,并发现增加推理量对输出质量的提升迅速达到平台期,Flash Lite在质量和token使用之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27484 2026-04-14 cs.LG cs.AI cs.CL 78%

Thought Branches: Interpreting LLM Reasoning Requires Resampling

思维分支:解释大语言模型推理需要重采样

Uzay Macar, Paul C. Bogdan, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过重采样研究大语言模型推理过程中的因果影响,探讨了单个推理链的局限性,并提出了基于重采样的方法来分析模型决策和推理步骤的影响。

Comments Uzay Macar and Paul C. Bogdan contributed equally to this work, and their listed order was determined by coinflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08574 2026-04-14 cs.RO cs.MA 78%

DeepFleet: Multi-Agent Foundation Models for Mobile Robots

DeepFleet:用于移动机器人群的多智能体基础模型

Ameya Agaskar, Sriram Siva, William Pickering, Kyle O'Brien, Charles Kekeh, Alexandre Ormiga Galvao Barbosa, Ang Li, Brianna Gallo Sarker, Alicia Chua, Mayur Nemade, Charun Thattai, Jiaming Di, Isaac Iyengar, Ramya Dharoor, Dino Kirouani, Jimmy Erskine, Tamir Hegazy, Scott Niekum, Usman A. Khan, Federico Pecora, Joseph W. Durham

机构 * Amazon Robotics(亚马逊机器人)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 DeepFleet通过多智能体基础模型支持大规模移动机器人编队的协调与规划,提出四种架构分别体现不同的归纳偏差,评估设计对预测任务性能的影响。

Comments 27 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05510 2026-04-14 cs.CV 78%

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21078 2026-04-14 cs.CV 78%

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization

面向视频时序动作定位中缓解模态偏差的视觉-语言模型

Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan

机构 * UVLab, Department of Computer Science, University of Warwick(华威大学计算机科学系UVLab) Department of Automation, University of Cambridge(剑桥大学自动化系) Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出ActionVLM框架,通过去偏差重加权模块和残差聚合策略缓解视频时序动作定位中的模态偏差,提升时间推理能力,在THUMOS14数据集上取得3.2%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 78%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11703 2026-04-14 cs.AI 77%

DreamKG: A KG-Augmented Conversational System for People Experiencing Homelessness

DreamKG: 一种为经历住房无家可归的人群增强知识图谱的对话系统

Javad M Alizadeh, Genhui Zheng, Chiu C Tan, Yuzhou Chen, Omar Martinez, Philip McCallion, Ying Ding, Chenguang Yang, AnneMarie Tomosky, Huanmei Wu

机构 * Temple University(天普大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California Riverside(加州大学河滨分校) University of Central Florida(中佛罗里达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DreamKG通过整合知识图谱提升对话系统,为住房无家可归者提供准确及时的服务信息,其结合Neo4j知识图谱与结构化查询,有效处理时空敏感查询,初步评估显示在相关查询上优于Google Search AI。

Comments This manuscript has been accepted at the 14th IEEE International Conference on Healthcare Informatics (ICHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10502 2026-04-14 cs.AI 77%

CHAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs

CHAIRO:面向LLMs的上下文分层类比归纳与推理优化

Haotian Lu, Yuchen Mou, Bingzhe Wu

机构 * National Engineering Laboratory for Big Data System Computing Technology(国家大数据系统计算技术工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出CHAIRO框架,通过类比示例提升规则归纳和决策可靠性,在内容审核中实现更准确和可解释的规则生成。

Comments Accepted to ACL 2026 main conference; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10420 2026-04-14 cs.LG 77%

CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation

CARE-ECG:基于因果代理的可解释与反事实ECG解读

Elahe Khatibi, Ziyu Wang, Ankita Sharma, Krishnendu Chakrabarty, Sanaz Rahimi Moosavi, Farshad Firouzi, Amir Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Arizona State University(亚利桑那州立大学) California State University, Dominguez Hills(加州州立大学多明格斯山分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10386 2026-04-14 cs.AI cs.MA 77%

TrajOnco: a multi-agent framework for temporal reasoning over longitudinal EHR for multi-cancer early detection

TrajOnco:一个用于纵向电子健康记录上时间推理的多智能体框架,用于多癌症早期检测

Sihang Zeng, Young Won Kim, Wilson Lau, Ehsan Alipour, Ruth Etzioni, Meliha Yetisgen, Anand Oka

机构 * Truveta Inc.(Truveta公司) University of Washington(华盛顿大学) Fred Hutch Cancer Center(弗雷德·哈钦森癌症中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TrajOnco通过多智能体框架对纵向EHR中的时间序列临床事件进行推理,生成患者总结和风险评分,实现多癌症早期检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08339 2026-04-14 cs.CL 77%

What Factors Affect LLMs and RLLMs in Financial Question Answering?

影响LLMs和RLLMs在金融问答中的因素是什么?

Peng Wang, Xuesi Hu, Jiageng Wu, Yuntao Zou, Qiancheng Zhang, Dagang Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, China(澳门科技大学计算机科学与工程学院) SKLPlanets, Macau University of Science and Technology, China(澳门科技大学月球与行星科学国家重点实验室) School of Economics, Anhui University, China(安徽大学经济学院) School of Energy and Power Engineering, Huazhong University of Science and Technology, China(华中科技大学能源与动力工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨了提示方法、代理框架和多语言对齐方法对LLMs和RLLMs在金融问答任务中的影响,发现提示方法和代理框架能提升LLMs性能,而RLLMs自身具备Long CoT能力,传统方法对其提升有限。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04272 2026-04-14 cs.IR cs.AI 77%

PoTable: Towards Systematic Thinking via Plan-then-Execute Stage Reasoning on Tables

PoTable:通过表格推理中的计划-执行阶段推理实现系统性思维

Qingyang Mao, Qi Liu, Zhi Li, Mingyue Cheng, Zheng Zhang, Rui Li

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PoTable,一种基于计划-执行阶段的表格推理方法,通过明确的分析阶段和代码生成机制提升推理的系统性和可解释性。

Comments Accepted by IEEE TKDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 77%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11625 2026-04-14 cs.LG cs.AI 76%

SCNO: Spiking Compositional Neural Operator -- Towards a Neuromorphic Foundation Model for Nuclear PDE Solving

SCNO:脉冲组合神经算子——迈向核PDE求解的类脑基础模型

Samrendra Roy, Souvik Chakraborty, Rizwan-uddin, Syed Bahauddin Alam

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校) National Center for Supercomputing Applications(国家超级计算应用中心)

专题命中 推理与问题求解 :foundation model(title);分类 cs.AI、cs.LG

AI总结 SCNO通过模块化架构结合脉冲与传统组件,解决神经算子在PDE求解中的三大限制,以低参数量实现高精度求解,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11686 2026-04-14 cs.IR 75%

EA-Agent: A Structured Multi-Step Reasoning Agent for Entity Alignment

EA-Agent:一种用于实体对齐的结构化多步推理代理

Yixuan Nan, Xixun Lin, Yanmin Shang, Ge Zhang, Zheng Fang, Fang Fang, Yanan Cao

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EA-Agent,通过多步规划与执行将实体对齐转化为结构化推理过程,引入属性和关系三元组选择器提升效率,实验表明其在三个基准数据集上均优于现有方法。

Comments ACL 2026,Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏