arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2607.10386 2026-07-14 cs.CL cs.AI 新提交 87%

Structured Thoughts For Improved Reasoning And Context Pruning

用于改进推理和上下文修剪的结构化思维

Zain Sarwar, Supriyo Chakraborty, Berkcan Kapusuzoglu, Chia-Hsuan Lee, Anirban Das, Stephen Rawls, Kartik Balasubramaniam, Sambit Sahu

机构 * University of Chicago(芝加哥大学) Capital One(第一资本金融公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01685 2026-07-07 cs.CL cs.AI cs.MA 87%

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

用真理欺骗:通过生成蒙太奇进行开放式通道多智能体合谋以操纵信念

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了通过公开通道分发真实证据片段,利用多智能体合谋操纵信念的新威胁,提出了生成蒙太奇框架,展示了在14种LLM家族中74.4%的攻击成功率,并揭示了更强的推理能力反而增加了易受攻击的风险。

Comments Accepted to the ACL 2026 Main Conference (Oral Presentation)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 5979-5996, San Diego, California, United States, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22485 2026-06-25 cs.AI cs.CL cs.DB cs.LO 新提交 87%

VADAOrchestra: Neurosymbolic Orchestration of Adaptive Reasoning Workflows

VADAOrchestra:自适应推理工作流的神经符号编排

Teodoro Baldazzi, Luigi Bellomarini, Andrea Coletta, Michela Iezzi, Carsten Maple, Alessandro Pesare, Emanuel Sallinger

机构 * TU Wien(维也纳工业大学) Banca d’Italia(意大利央行) University of Warwick(华威大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出VADAOrchestra框架,结合LLM灵活性与Datalog+/-符号推理,实现可审计、可扩展的自适应工作流编排,在金融场景中验证了忠实性、可扩展性和可解释性。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21867 2026-06-23 cs.AI cs.CL cs.SC 新提交 87%

ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation

ForEx:逻辑谬误检测与可解释推理的形式验证框架

Pei-Cing Huang, Chienyu Liu, Chan Hsu, Ci-Siang Chen, Pei-Ju Lee, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) National Chung Hsing University(中国科技大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ForEx框架,将LLM生成的解释翻译为Lean4并验证其形式可推导性,通过论证验证矩阵区分标签一致性与形式验证状态,揭示形式可推导性与标签一致性之间的系统性差距。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 87%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18372 2026-06-18 cs.CL cs.AI 新提交 87%

Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification

保留还是删除?用于教育对话去标识的完全本地AI级联框架

Haocheng Zhang, Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, René F. Kizilcec

机构 * Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对教育对话中课程术语与个人身份信息混淆的问题,提出一种完全本地的级联框架,通过召回优先的联合提议器和上下文感知审查器实现约束性隐私分类,在数学辅导对话上达到0.958的宏F1,优于商业API和纯LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15419 2026-06-16 cs.CL cs.AI 新提交 87%

Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

让LLMs互相评判:面向医学问答的多智能体同行评审推理

Zaifu Zhan, Shuang Zhou, Rui Zhang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体同行评审推理方法,让多个LLM独立生成思维链推理并相互评估,选择最优推理链输出答案,在三个医学问答数据集上优于单模型和多数投票方法。

Comments Accepted by the Journal of the American Medical Informatics Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 87%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02880 2026-06-09 cs.AI cs.CL 版本更新 87%

ReTreVal: Reasoning Tree with Validation and Cross-Problem Memory for Large Language Models

ReTreVal:带有验证和跨问题记忆的推理树

Abhishek HS, Pavan C Shekar, Arpit Jain, Ashwanth Krishnan

机构 * QpiAI

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ReTreVal通过自适应树探索、带工具增强的节点细化、类型化失败回溯和自修改记忆,使大语言模型在无需微调的情况下实现跨问题学习,其在MATH-500上达到85.8%的pass@1准确率,在MMLU-Pro上达到54.4%的准确率。

Comments 15 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06447 2026-06-05 cs.CL cs.LG 87%

Latent Reasoning with Normalizing Flows

基于归一化流的潜在推理

Guancheng Tu, Xiangjun Fu, Suhao Yu, Yao Tang, Haoqiang Kang, Lianhui Qin, Yizhe Zhang, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学) UC San Diego(圣地亚哥大学) Meta

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出NF-CoT框架,通过归一化流在LLM内部建模连续潜在思维,保留自回归生成、概率采样、KV缓存解码和似然估计等优势,在代码生成任务中提升通过率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 87%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04360 2026-06-04 cs.CL cs.LG 87%

Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs

Deliberate Evolution: 基于智能体推理的样本高效符号回归与LLM

Xinyu Pang, Zhanke Zhou, Xuan Li, Fangrui Lv, Shanshan Wei, Sen Cui, Bo Han, Changshui Zhang

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) Beijing National Research Center for Information Science(北京信息科学国家研究中心) Technology (BNRist), Department of Automation, Tsinghua University, Beijing, P.R. China(技术(BNRist),自动化系,清华大学,北京,中华人民共和国) Lenovo Research(联想研究)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG

AI总结 提出Deliberate Evolution框架,通过解耦符号生成与搜索控制,利用自适应算子、分析工具和反思记忆,在仅用40%样本预算下超越现有LLM符号回归方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17532 2026-06-02 cs.CL cs.LG 87%

OncoReason: Structuring Clinical Reasoning in LLMs for Robust and Interpretable Survival Prediction

OncoReason: 在大语言模型中构建临床推理以实现稳健且可解释的生存预测

Raghu Vamshi Hemadri, Geetha Krishna Guruju, Kristi Topollai, Anna Ewa Choromanska

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出统一多任务学习框架,通过监督微调、思维链提示和强化学习三种对齐策略,使自回归大语言模型在MSK-CHORD数据集上联合进行二元生存分类、连续生存时间回归和自然语言理由生成,实现可解释的生存预测。

Comments This manuscript is withdrawn to allow careful review and correction of bibliographic issues identified after submission, including references that could not be adequately verified. These matters should be resolved before further circulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30654 2026-06-01 cs.CL cs.AI cs.HC 87%

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

EUDAIMONIA: 评估AI中的不良动态

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-05-29 cs.RO cs.AI cs.LG 87%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25281 2026-05-27 cs.CL cs.AI 87%

READER: Reasoning-Enhanced AI-Generated Text Detection

READER: 增强推理的AI生成文本检测

Pingfan Su, Kai Ye, Shijin Gong, Erhan Xu, Jin Zhu, Giulia Livieri, Chengchun Shi

机构 * School of Mathematics, University of Birmingham(布里斯托尔大学数学学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出READER方法,通过微调1.5B参数的LLM在结构化推理数据集READ上,结合推理与检测,在分布偏移下优于GPT-5.2等大100-1000倍的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20539 2026-05-26 cs.AI cs.CL 87%

PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving LLMs

PathWise:通过世界模型规划实现基于自进化LLM的自动启发式设计

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PathWise多智能体推理框架,将启发式生成建模为基于蕴含图的序列决策过程,通过策略智能体、世界模型智能体和评论智能体的协作实现状态感知规划,在组合优化问题上收敛更快、泛化更强。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22257 2026-05-22 cs.LG cs.AI cs.LO 87%

What are the Right Symmetries for Formal Theorem Proving?

正式定理推理中应有的对称性是什么?

Krzysztof Olejniczak, Radoslav Dimitrov, Xingyue Huang, Bernardo Cuenca Grau, Jinwoo Kim, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) KAIST(韩国科学技术院) TU Wien(维也纳技术大学) AITHYRA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了正式定理推理中应尊重的对称性,提出了基于范畴论的重写范畴框架,用于形式化证明等价性和成功不变性,并通过测试时方法改进了LLM基定理证明器的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21856 2026-05-22 cs.LG cs.AI 87%

The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

推理的幻觉:通过零CoT截断揭示LLM中的逃避数据污染

Yifan Lan, Yuanpu Cao, Hanyu Wang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出零CoT探针(ZCP)方法,通过截断整个推理过程来暴露模型中的潜在捷径映射,以检测LLM中的直接和逃避数据污染,提出了 contamination confidence 指标来量化污染的可能性和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14259 2026-05-21 cs.AI cs.CL 87%

Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems

面向异构业务系统的超图企业代理推理器

Ling Wang, Xin Liu, Songnan Liu, Jianan Wang, Cheng Cheng, Yihan Zhu, Enyu Li, Yu Xiao, Jiangyong Xie, Duogong Yan, Jiangyi Chen

机构 * SUPCON

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HEAR,一种基于分层超图本体的企业代理推理器,通过分层图层和超边层实现结构化多跳分析,无需重新训练LLM,在供应链任务中达到94.7%的准确率,并展示出适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06638 2026-05-19 cs.AI cs.CL 87%

Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

强化学习能否教会大语言模型长期 horizon 推理?表达性是关键

Tianle Wang, Zhaoyang Wang, Guangchen Lan, Xinpeng Wei, Sipeng Zhang, Guanwen Qiu, Abulhair Saparov

机构 * Purdue University(普渡大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Tech(佐治亚理工学院) UC San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ScaleLogic框架研究了RL训练与任务难度的关系,发现推理深度和逻辑表达性影响训练计算量,表达性越高,训练效率越高,证明LLM的长期推理问题可通过改进训练方法解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI 87%

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-05-12 cs.CL cs.AI 87%

DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 87%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01399 2026-05-05 cs.CL cs.AI cs.IR 87%

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning

Verbal-R3:作为检索与推理之间缺失桥梁的语义重排序

Sangkwon Park, Donghun Kang, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学人工智能研究所、人工智能研究室、智能网络研究中心和智能系统研究中心) DGIST(延世大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Verbal-R3框架,通过语义注释增强LLM的推理能力,实现检索与推理的高效整合,提升问答任务性能。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 87%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25039 2026-04-29 cs.CL cs.AI 87%

Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

双轨CoT:面向小语言模型的预算感知逐步引导

Sagnik Chatterjee, Atharva Patil, Sricharan Ramesh

专题命中 推理与问题求解 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 87%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21611 2026-04-24 cs.CL cs.AI 87%

Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

通过口头批评过程监督提高大语言模型的推理能力

Hao-Yuan Chen

机构 * Mindify AI Research(Mindify AI研究院) University of London(伦敦大学) Senate House, Malet Street, London WC1E 7HU, United Kingdom(伦敦大学 Senate House, 马莱特街, 伦敦 WC1E 7HU, 英国)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过外部口头监督提升大语言模型推理能力的方法,通过结构化自然语言批评指导生成-批评-完善循环,提升推理性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19464 2026-04-22 cs.CL cs.AI 87%

LePREC: Reasoning as Classification over Structured Factors for Assessing Relevance of Legal Issues

LePREC:基于结构因素的推理作为分类,以评估法律问题的相关性

Fanyu Wang, Xiaoxi Kang, Paul Burgess, Aashish Srivastava, Chetan Arora, Adnan Trakic, Lay-Ki Soon, Md Khalid Hossain, Lizhen Qu

机构 * Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院,澳大利亚) School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息学院) School of Business, Monash University Malaysia(墨尔本大学马来西亚分校商学院) Faculty of Law, Monash University, Australia(墨尔本大学法学院,澳大利亚)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LePREC框架,结合神经生成与结构统计推理,提升法律问题识别的精度,实验表明其比先进LLM基线提升30-40%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏