arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11004 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11004 篇

2605.15044 2026-05-15 cs.SD cs.AI cs.LG cs.MM eess.AS 81%

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

SpeakerLLM:一种面向说话人理解与验证推理的说话人专用音频大语言模型

KiHyun Nam, Jungwoo Heo, Siu Bae, Ha-Jin Yu, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Seoul(首尔大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SpeakerLLM通过统一说话人特征建模、录音条件理解及验证推理,提升音频大语言模型在说话人识别与验证中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11556 2026-05-14 cs.CL cs.AI cs.MA 81%

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

多智能体大语言模型中分布式信息下的集体推理系统性失效

Yuxuan Li, Aoi Naito, Hirokazu Shirado

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学学院,卡内基梅隆大学,匹兹堡,美国) School of Environment and Society, Institute of Science Tokyo, Tokyo, Japan(环境与社会学院,东京科学研究所,东京,日本)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现多智能体大语言模型在分布式信息下仅能获得30.1%的准确率,而单智能体在完整信息下可达80.7%。系统性失效源于智能体无法识别和应对潜在的信息不对称,导致关键分布式事实未被探索。通过轻量级结构化通信协议可显著提升集体推理能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11666 2026-05-13 cs.LG cs.AI 81%

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

进化任务发现:通过技能组合与复杂性缩放推进推理前沿

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvoTD框架,通过结构化进化算子在算法技能与复杂性属性的双轴流形上进行数据合成,提升模型推理能力,并在不同架构和规模上实现稳定泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02450 2026-05-12 cs.RO cs.AI cs.LG 81%

CHARMS: A Cognitive Hierarchical Agent for Reasoning and Motion Stylization in Autonomous Driving

CHARMS:用于自动驾驶中的推理与运动风格化的认知层次代理

Jingyi Wang, Duanfeng Chu, Zejian Deng, Liping Lu, Jinxiang Wang, Chen Sun

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械与电子工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究所) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CHARMS通过强化学习预训练和监督微调pipeline,实现人类般的决策行为和交互真实性,同时利用泊松认知层次理论生成多样化驾驶场景。

Journal ref ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01301 2026-05-12 cs.AI cs.CL 81%

Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner

克服多步复杂性以实现多模态理论思维推理:一种可扩展的贝叶斯规划器

Chunhui Zhang, Zhongyu Ouyang, Kwonjoon Lee, Nakul Agarwal, Sean Dae Houlihan, Soroush Vosoughi, Shao-Yuan Lo

机构 * Dartmouth College(达特茅斯学院) Honda Research Institute USA(本田美国研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种可扩展的贝叶斯理论思维规划器,通过分步贝叶斯更新分解理论思维推理,利用弱到强控制使小语言模型专精于理论思维似然估计,并将其推理行为转移给大语言模型,从而在多模态理论思维基准测试中实现4.6%的准确率提升。

Comments Accepted as a Spotlight at the 2025 Forty-Second International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 81%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08406 2026-05-12 cs.CL cs.AI 81%

Effective Explanations Support Planning Under Uncertainty

有效解释支持在不确定性下的规划

Hanqi Zhou, Britt Besch, Charley M. Wu, Tobias Gerstenberg

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Max Planck Institute for Biological Cybernetics(生物 cybernetics 最大平面研究所) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种计算模型,将解释转化为行动计划,通过大规模语言模型生成策略先验和价值图,结合规划代理在部分可观测条件下执行,验证了高质量解释能提升导航效率。

Comments CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08404 2026-05-12 cs.CL cs.AI cs.CV cs.ET 81%

Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

利用大视觉-语言模型从遥感图像中推导建成环境

Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。

Comments Published in the International Conference on Industrialized Construction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14868 2026-05-11 cs.LG cs.AI 81%

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09629 2026-05-11 cs.AI cs.LG 81%

End-to-end PDDL Planning with Hardcoded and Dynamic Agents

端到端PDDL规划与硬编码和动态智能体

Emanuele La Malfa, Ping Zhu, Samuele Marro, Sara Bernardini, Michael Wooldridge

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering, University of Oxford(牛津大学工程系)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个端到端框架,通过验证器支持规划。协调器接收自然语言规范,转换为PDDL模型,子模块(智能体)迭代优化规划需求。支持硬编码和动态智能体,最终计划转换为自然语言。

Comments Code: https://github.com/EmanueleLM/MultiAgentPlanning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL 81%

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 81%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01327 2026-05-08 cs.AI cs.LG 81%

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

基于段落对齐的策略优化用于多模态推理

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

机构 * Fudan University(复旦大学) Southeast University(东南大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAPO方法,通过将推理步骤而非token或完整序列作为策略更新的基本单元,提升多模态推理任务的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 81%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24175 2026-04-28 cs.CL cs.AI 81%

AdapTime: Enabling Adaptive Temporal Reasoning in Large Language Models

AdapTime:在大语言模型中实现自适应时间推理

Yimin Deng, Yejing Wang, Zhenxi Lin, Zichuan Fu, Guoshuai Zhao, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Xian Wu, Li Zhu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdapTime方法,通过动态执行推理步骤提升大语言模型的时间推理能力,采用重构、重写和复核三步策略,无需外部工具即可增强模型对时间信息的处理能力。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05664 2026-04-28 cs.CL cs.AI cs.SE 81%

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

CODESIM: 通过仿真驱动的规划与调试进行多智能体代码生成与问题解决

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 CODESIM提出了一种基于仿真的多智能体代码生成框架,通过仿真验证和内部调试提升代码生成能力,在多个基准测试中取得新高成绩。

Comments Accepted in NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21204 2026-04-24 cs.CL cs.AI cs.IR 81%

On Reasoning Behind Next Occupation Recommendation

关于未来职业推荐的推理方法

Shan Dong, Palakorn Achananuparp, Hieu Hien Mai, Lei Wang, Yao Lu, Ee-Peng Lim

机构 * Singapore Management University(新加坡国立管理学院) Columbia University(哥伦比亚大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段职业预测方法,通过生成用户职业选择原因来提升大语言模型在职业推荐中的性能,实验表明该方法在准确率上优于无监督方法。

Comments Accepted to PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20043 2026-04-23 cs.CL cs.AI 81%

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs

TriEx:一种基于游戏的三视角框架,用于解释多智能体大语言模型中的内部推理

Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang

机构 * Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TriEx通过三视角框架提升多智能体大语言模型的可解释性,通过结构化自我推理、对手信念状态和 oracle 审计分析,揭示模型在信念动态和评估可靠性上的系统性不匹配。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19766 2026-04-23 cs.CL cs.AI 81%

OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models

OThink-SRR1: 通过强化学习增强大语言模型的搜索、细化与推理

Haijian Liang, Zenghao Niu, Junjie Wu, Changwang Zhang, Wangchunshu Zhou, Jun Wang

机构 * Shenzhen University(深圳大学) OPPO Research Institute(OPPO研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OThink-SRR1通过强化学习训练的迭代搜索-细化-推理流程,有效解决复杂多跳问题中的检索噪声干扰和计算成本问题,实验表明其在多跳问答基准上准确率优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17555 2026-04-23 cs.AI cs.CL cs.IR 81%

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

CoSearch:通过强化学习联合训练推理和文档排序以实现代理搜索

Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

机构 * Center for Intelligent Information Retrieval, University of Massachusetts Amherst(智能信息检索中心,马萨诸塞大学阿默斯特分校) Snap Inc(Snap公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSearch框架,通过群体相对策略优化联合训练推理代理和生成文档排序模型,以解决代理搜索中检索系统性能瓶颈问题,实验表明其在多个问答基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 81%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14902 2026-04-21 cs.AI cs.CL cs.CV cs.RO 81%

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

ADAPT:在未指定 affordance 约束下评估常识规划的基准测试

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ADAPT 模块,通过显式 affordance 推理提升智能具身代理的鲁棒性和任务成功率,展示了领域适应的视觉语言模型在 affordance 推理中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05053 2026-04-21 cs.AI cs.CL 81%

Reinforced Efficient Reasoning via Semantically Diverse Exploration

通过语义多样探索增强高效推理

Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang, Dawei Yin, Xin Xin

机构 * Shandong University(山东大学) Leiden University(莱顿大学) Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ROSE方法,通过语义熵分支策略和ε探索机制提升大语言模型的推理多样性与效率,并通过实验验证其有效性。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07100 2026-04-21 cs.CL cs.AI 81%

STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems

STRIDE-ED:一种基于策略的分步推理框架用于共情对话系统

Hongru Ji, Yuyin Fan, Meng Zhao, Xianghua Li, Lianwei Wu, Chao Gao

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,中国) School of Artificial Intelligence and Big Data, Henan University of Technology, China(人工智能与大数据学院、河南理工大学,中国) School of Computer Science, Northwestern Polytechnical University, China(计算机学院、西北工业大学,中国)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出STRIDE-ED框架,通过结构化策略引导推理,解决共情对话中策略意识和上下文敏感决策的难题,实验表明其在多种LLM上表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05569 2026-04-21 cs.IR cs.AI cs.CL 81%

CBR-to-SQL: Rethinking Retrieval-based Text-to-SQL using Case-based Reasoning in the Healthcare Domain

CBR-to-SQL:重新思考基于检索的文本到SQL方法:在医疗领域使用基于案例的推理

Hung Nguyen, Hans Moen, Pekka Marttinen

机构 * Department of Computer Science Aalto University(奥卢大学计算机科学系) Department of Clinical Medicine Aalborg University(奥尔堡大学临床医学系)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CBR-to-SQL框架,通过分解检索增强生成的两阶段检索,提升医疗领域文本到SQL的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 81%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06211 2026-04-21 cs.CL cs.AI cs.SE 81%

Illocutionary Explanation Planning for Source-Faithful Explanations in Retrieval-Augmented Language Models

意图解释规划:在检索增强语言模型中实现源忠实的解释

Francesco Sovrano, Alberto Bacchelli

机构 * Collegium Helveticum, ETH Zurich(瑞士苏黎世联邦理工学院学院) University of Zurich(瑞士苏黎世大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过意图宏观规划提升检索增强语言模型中解释的源忠实性,通过链式意图提示提升源忠实度,实验显示在部分模型中提升显著,但整体效果仍有限。

Comments 24 pages; Accepted for publication at XAI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 81%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15148 2026-04-17 cs.AI cs.CL cs.IR 81%

IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning

IG-Search: 基于信息增益的步级奖励用于搜索增强推理

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IG-Search框架,通过信息增益在每一步评估检索文档对答案置信度的提升,实现细粒度信用分配,优于传统轨迹级和步级方法,在多跳推理任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 81%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏