arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 119 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2604.12628 2026-04-15 math.OC cs.RO 78%

A Comparison of Reinforcement Learning and Optimal Control Methods for Path Planning

强化学习与最优控制方法在路径规划中的比较

Qiang Le, Yaguang Yang, Isaac E. Weintraub

机构 * Department of Electrical and Computer Engineering, Hampton University(哈珀学院电气与计算机工程系) Air Warfare Directorate, Air Force Research Laboratory(空军研究实验室空战 Directorate)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文比较了强化学习与最优控制方法在路径规划中的应用,提出基于DDPG的方法能快速生成安全路径,但存在不可行区域,未来将改进奖励函数和探索其他方法。

Comments 8 pages, 9 figures, submitted to AAAI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 73%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 67%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12995 2026-04-15 cs.CL cs.CY 57%

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

PolicyLLM:迈向大型语言模型在公共政策领域的卓越理解

Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出PolicyBench基准和PolicyMoE模型,评估大型语言模型在公共政策理解中的能力,发现其在应用任务中表现更优,揭示了当前LLM在政策理解中的局限性。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12762 2026-04-15 cs.CV cs.AI cs.MA 57%

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

ARGOS:智能多摄像机人像搜索中的谁、哪里和何时

Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

机构 * KAIST(韩国科学技术院) University of Seoul(首尔大学) KIST(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ARGOS首次将多摄像机人像搜索转化为交互推理问题,通过智能体在信息不对称下规划、提问和消除候选,包含14个真实场景的2691个任务,实验表明该基准远未解决。

Comments Accepted to CVPR 2026 Workshop on Multimodal Spatial Intelligence (MUSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13647 2026-04-15 cs.RO cs.AI 57%

Improved particle swarm optimization algorithm: multi-target trajectory optimization for swarm drones

改进的粒子群优化算法:多目标轨迹优化用于群无人机

Minze Li, Wei Zhao, Ran Chen, Mingqiang Wei

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PE-PSO算法,通过引入持久探索机制和熵基参数调整策略,提升群无人机在动态环境中的实时轨迹规划能力,实验表明其在轨迹质量、能耗效率等方面优于传统方法。

Comments New experiments have revealed systematic errors in the original data

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17086 2026-04-15 cs.CL 57%

Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning

通过最小化强化学习推进多智能体RAG系统

Yihong Wu, Liheng Ma, Muzhi Li, Jiaming Zhou, Lei Ding, Jianye Hao, Ho-fung Leung, Irwin King, Yingxue Zhang, Jian-Yun Nie

机构 * McGill University \& Mila Montréal QC Canada The Chinese University of Hong Kong Hong Kong China Huawei Noah’s Ark Lab Montréal QC Canada University of Manitoba Winnipeg MB Canada Tianjin University Tianjin China Independent Researcher Hong Kong China McGill University \& Mila The Chinese University of Hong Kong Huawei Noah’s Ark Lab University of Manitoba Tianjin University Independent Researcher

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Mujica-MyGo框架,通过多智能体RAG流程分解多轮交互,结合轻量强化学习算法MyGO,有效解决长上下文问题,提升复杂问答性能。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12437 2026-04-15 cs.CV 50%

A Hybrid Architecture for Benign-Malignant Classification of Mammography ROIs

一种用于乳腺X线摄影ROI良性恶性分类的混合架构

Mohammed Asad, Mohit Bajpai, Sudhir Singh, Rahul Katarya

机构 * Dept. of Electronics and Communication Engineering(电子与通信工程系) Delhi Technological University(德里技术大学) Dept. of Information Technology(信息科技系) IGDTUW Dept. of Computer Science and Engineering(计算机科学与工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出结合EfficientNetV2-M和Vision Mamba的混合架构,用于乳腺X线摄影ROI的良性恶性分类,实现高效全局上下文建模和局部特征提取,提升病变级别分类性能。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22799 2026-04-15 cs.CV 50%

VPTracker: Global Vision-Language Tracking via Visual Prompt

VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪

Jingchao Wang, Kaiwen Zhou, Zhijian Wu, Kunhua Ji, Dingjiang Huang, Yefeng Zheng

机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 12 篇

2604.12896 2026-04-15 cs.CV cs.LG 79%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL 79%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00710 2026-04-15 cs.AI 79%

Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models

RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展

Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu

机构 * University College London(伦敦大学学院) Samsung R&D Institute UK(三星英国研发院) University of California, Los Angeles(加州大学洛杉矶分校) Texas A&M University(德克萨斯农工大学) Imperial College London(伦敦帝国学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过Ariadne框架研究RLVR对视觉-语言模型空间推理能力的影响,证明其能扩展推理边界,并在真实导航任务中取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 78%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 77%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07267 2026-04-15 cs.RO 67%

Bio-Inspired Topological Autonomous Navigation with Active Inference in Robotics

生物启发的拓扑自主导航与主动推断在机器人中的应用

Daria de Tinguy, Tim Verbelen, Emilio Gamba, Bart Dhoedt

机构 * Ghent University(根特大学) Verses Flanders Make(佛兰德斯制造)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种基于主动推断框架的生物启发代理,实现环境拓扑地图的实时生成与更新,通过概率推理框架实现可解释的导航,并在动态和未知环境中表现出鲁棒适应性。

Comments Conference ICCAS 2025 - accepted (in processing)

Journal ref Communications in Computer and Information Science, vol 2857, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 57%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 57%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20330 2026-04-15 cs.CV cs.AI cs.GR 57%

OmniHands: Towards Robust 4D Hand Mesh Recovery via A Versatile Transformer

OmniHands: 一种通过通用变压器实现鲁棒四维手形重建的方法

Dixuan Lin, Yuxiang Zhang, Mengcheng Li, Wei Jing, Qi Yan, Qianying Wang, Yebin Liu, Hongwen Zhang

机构 * Beijing Normal University(北京师范大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniHands,通过通用变压器架构解决单目或多视角输入下手形及相对运动重建问题,引入关系感知双手分词和四维交互推理模块,提升真实场景中手部交互重建性能。

Comments An extended journal version of 4DHands, featured with versatile module that can adapt to temporal task and multi-view task. Additional detailed comparison experiments and results presentation have been added. More demo videos can be seen at our project page: https://OmniHand.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 50%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10992 2026-04-15 cs.CV 50%

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

ArtiCAD: 通过多智能体代码生成实现可动CAD装配设计

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ArtiCAD通过多智能体系统从文本或图像生成可编辑的可动CAD装配,利用连接器定义连接点和关节参数,提升空间推理能力,通过验证步骤和回滚机制确保输出质量,验证了其在概念设计、物理原型和AI训练资产生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12486 2026-04-15 cs.RO 50%

DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation

DeCoNav:基于对话的长时程协作视觉语言导航

Sunyao Zhou, Yunzi Wu, Tianhang Wang, Xinhai Li, Guang Chen, Lizheng Liu, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom Fudan University(中国电信复旦大学) Tongji University(同济大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeCoNav通过事件触发对话与动态任务分配实现多机器人协作,提升了多机器人系统的长时程协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2604.11626 2026-04-15 cs.AI cs.LG 81%

RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time

RationalRewards: 基于理性反馈的视觉生成推理奖励

Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin, Wenhu Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RationalRewards通过显式多维反馈提升视觉生成模型,训练时提供可解释奖励,测试时通过生成-反馈-优化循环改进输出,无需参数更新。

Comments Project Page: https://tiger-ai-lab.github.io/RationalRewards/ ; Code, Dataset, Models are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12647 2026-04-15 cs.SD cs.CL 70%

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

自适应测试时缩放用于零样本呼吸音频分类

Tsai-Ning Wang, Herman Teun den Dekker, Lin-Lin Chen, Neil Zeghidour, Aaqib Saeed

机构 * Eindhoven University of Technology The Netherlands(埃因霍温理工大学荷兰) Erasmus University Medical Center The Netherlands(埃因霍温医学院荷兰) Kyutai France(Kyutai法国) Eindhoven Artificial Intelligence Systems Institute The Netherlands(埃因霍温人工智能系统研究所荷兰)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文提出TRIAGE框架,通过分层零样本方法自适应调整测试时计算,提升呼吸音频分类性能,实现9项任务平均AUROC达0.744,优于现有零样本方法。

Comments Accepted at AHLI CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12543 2026-04-15 cs.AI 70%

A Two-Stage LLM Framework for Accessible and Verified XAI Explanations

一个两阶段LLM框架用于可访问且验证的XAI解释

Georgios Mermigkis, Dimitris Metaxakis, Marios Tyrovolas, Argiris Sofotasios, Nikolaos Avgeris, Panagiotis Hadjidoukas, Chrysostomos Stylios

机构 * Department of Computer Engineering and Informatics, University of Patras(帕特拉大学计算机工程与信息学系) Department of Informatics and Telecommunications, University of Ioannina(伊奥安尼纳大学信息与电信系) Industrial Systems Institute, Athena Research Center(雅典研究中心工业系统研究所) Archimedes Unit, Athena Research Center(雅典研究中心阿基米德单位)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出两阶段LLM框架,通过解释器和验证器LLM生成并验证XAI解释,提升解释的准确性与可访问性。

Comments 8 pages, 8 figures, Accepted for publication at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12262 2026-04-15 cs.CL cs.AI 62%

CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades

级联辩论:面向成本感知的LLM级联的多智能体辩论

Raeyoung Chang, Dongwook Kwon, Jisoo Lee, Nikhil Verma

机构 * Sogang University(首尔大学) Kwangwoon University(匡明大学) Seoul National University(首尔国立大学) LG Electronics, Toronto AI Lab(LG电子,多伦多人工智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CascadeDebate,通过在每个层级的升级边界插入多智能体辩论,解决单模型层级在模糊查询中易引发升级的问题,提升准确性和成本效率。

Comments 12 pages, 6 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12196 2026-04-15 cs.CL 57%

Beyond Majority Voting: Efficient Best-Of-N with Radial Consensus Score

超越多数投票:基于径向共识得分的高效最佳-N选择

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(应用人工智能倡议,德肯大学,澳大利亚)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Radial Consensus Score方法,通过计算答案嵌入的加权Fréchet均值并计算径向距离,实现高效最佳-N选择,优于现有方法并在多代理辩论中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 14 篇

2604.05643 2026-04-15 cs.CL 89%

Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs

基于图的链式推理剪枝:减少推理LLM中冗余反射

Hongyuan Yuan, Xinran He, Run Shao, Bolei He, Xianwei Xue, Mengke Chen, Qiutong Pan, Haiwei Wang, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于图的链式推理优化框架,通过剪枝策略减少推理过程中冗余反射,提升效率与准确性。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12487 2026-04-15 cs.CL cs.AI 84%

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner: 一种用于端到端多跳知识图谱推理的强化模型

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Reasoner,通过强化学习整合多步推理至LLM的'思考'阶段,实现动态探索推理路径,实验表明其在多跳和知识密集型推理任务中表现优异。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11271 2026-04-15 cs.LG cs.CL cs.CV cs.MA 84%

OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning

OctoTools: 一个具有可扩展工具的代理框架,用于复杂推理

Pan Lu, Bowen Chen, Sheng Liu, Rahul Thapa, Joseph Boen, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 OctoTools通过标准化工具卡、规划器和执行器,提供一种无需训练的多代理框架,实现跨领域复杂推理,其在16种任务中达到9.3%的平均准确率提升。

Comments 88 pages, 18 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12651 2026-04-15 cs.CL cs.AI 82%

Learning Chain Of Thoughts Prompts for Predicting Entities, Relations, and even Literals on Knowledge Graphs

学习链式思维提示以预测知识图谱中的实体、关系以及甚至字面量

Alkid Baci, Luke Friedrichs, Caglar Demir, N'Dah Jean Kouagou, Axel-Cyrille Ngonga Ngomo

机构 * Department of Computer Science(计算机科学系)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RALP方法,通过学习基于字符串的链式思维提示作为评分函数,提升知识图谱链接预测的性能,实验表明其在多个基准测试中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏