arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 117 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2604.13757 2026-04-16 cs.AI cs.HC 70%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13384 2026-04-16 cs.NI 67%

Agentic Open RAN: A Deterministic and Auditable Framework for Intent-Driven Radio Control

代理式开放无线接入网:一种确定性和可审计的意图驱动无线控制框架

Hengxu Li, Dongkuan Xu, Mingzhe Chen, Yuchen Liu

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出A1gent框架,通过分离推理与实时执行,实现意图驱动的无线控制,结合非实时代理和近实时代理,确保可审计的协调与可预测的适应性。

Comments 6 pages, 5 figures. Accepted at IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 57%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13452 2026-04-16 cs.CL 57%

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13328 2026-04-16 cs.LG 57%

Multi-Task LLM with LoRA Fine-Tuning for Automated Cancer Staging and Biomarker Extraction

多任务LLM结合LoRA微调用于自动癌症分期和生物标志物提取

Jiahao Shao, Anam Nawaz Khan, Christopher Brett, Tom Berg, Xueping Li, Bing Yao

机构 * Department of Industrial & Systems Engineering, The University of Tennessee, Knoxville(工业与系统工程系,田纳西大学, Knoxville)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种参数高效、多任务框架,利用LoRA微调LLM实现乳腺癌TNM分期、组织学分级和生物标志物的自动化提取,实验显示其在宏F1分数上达到0.976,优于传统方法。

Comments 11 pages, 3 figures and 4 tables in the main manuscript. Additional content, figures and tables are in supplementary material section. 17 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08639 2026-04-16 cs.CV cs.AI 57%

UNBOX: Unveiling Black-box visual models with Natural-language

UNBOX:通过自然语言揭示黑盒视觉模型

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 UNBOX在无数据、无梯度、无反向传播约束下,利用大语言模型和扩散模型生成可解释文本描述,揭示模型隐含概念与潜在偏见,通过实验验证其在ImageNet-1K等数据集上的有效性。

Comments Under review at IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13996 2026-04-16 cs.HC 50%

Acts of Configuration: Rethinking Provenance, Temporality and Legitimacy in Post-Mortem Agents

配置行为:重新思考死后代理的来源、时间和合法性

Kellie Yu Hui Sim, Pin Sym Foong, Darryl Lim, John-Henry Lim, Kenny Tsu Wei Choo

专题命中 规划推理 :planning(abstract)

AI总结 本文通过工作坊探讨死后代理在决策能力丧失后如何配置,发现人们更倾向于基于第一方授权的有限代理,但时间因素促使代理在能力丧失后保持静止并影响后续使用。

Comments Accepted at DIS 2026 (PWiP). 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13542 2026-04-16 cs.RO cs.DC cs.SE 50%

Self-adaptive Multi-Access Edge Architectures: A Robotics Case

自适应多接入边缘架构:机器人案例

Mahyar T Moghaddam, Joakim Leed, Anders Frandsen

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种自适应计算系统,用于混合人类-机器人环境,通过神经网络预测人类移动行为,提升移动机器人路径规划并确保安全,采用边缘计算系统优化处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13397 2026-04-16 cs.CV 50%

A Multimodal Clinically Informed Coarse-to-Fine Framework for Longitudinal CT Registration in Proton Therapy

一种多模态的临床导向粗到细框架用于质子治疗纵向CT配准

Caiwen Jiang, Yuzhen Ding, Mi Jia, Samir H. Patel, Terence T. Sio, Jonathan B. Ashman, Lisa A. McGee, Jean-Claude M. Rwigema, William G. Rule, Sameer R. Keole, Sujay A. Vora, William W. Wong, Nathan Y. Yu, Michele Y. Halyard, Steven E. Schild, Dinggang Shen, Wei Liu

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, Arizona, USA(梅奥诊所放射肿瘤科) School of Biomedical Engineering, ShanghaiTech University, Shanghai, China(上海科技大学生物医学工程学院) Shanghai United Imaging Intelligence Co., Ltd., Shanghai 200230, China(上海联合影像智能科技有限公司) Shanghai Artificial Intelligence Laboratory, Shanghai 200232, China(上海人工智能实验室) Shanghai Clinical Research and Trial Center, Shanghai 201210, China(上海临床研究与试验中心)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种多模态的临床导向粗到细框架,结合质子放疗工作流程中的多种信息,提升纵向CT配准的准确性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13255 2026-04-16 eess.SY cs.SY 50%

Dynamic Regret in Time-varying MDPs with Intermittent Information

时间变化马尔可夫决策过程中的动态遗憾

Negin Musavi, Melkior Ornik

专题命中 规划推理 :planning(abstract)

AI总结 本文研究了在有限更新率下时间变化马尔可夫决策过程中的序列决策问题,提出了一种跳过更新学习与规划框架,通过基于似然的转移核估计和有限时间跨度规划,在更新间使用过时信息执行策略,并分析了其动态遗憾性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10605 2026-04-16 cs.RO 50%

LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator

LEO-RobotAgent: 一种通用的基于语言的机器人代理框架

Lihuang Chen, Xiangyu Luo, Jun Meng

机构 * Zhejiang University, Hangzhou 310000, P. R. China(浙江大学,杭州310000,中华人民共和国)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出LEO-RobotAgent框架,旨在通过语言驱动实现机器人在复杂场景中完成多样化任务,具备强泛化能力、鲁棒性和高效性,降低人机交互门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 6 篇

2604.12102 2026-04-16 cs.AI cs.CV cs.LG 81%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 50%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO 50%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13708 2026-04-16 eess.SY cs.SY 50%

Homotopy-Guided Potential Games for Congestion-Aware Navigation

基于同调的势游戏用于拥堵感知导航

Mohammed Irshadh Ismaaeel Sathyamangalam Imran, Lasse Peters, Michael Khayyat, Stefano Arrigoni, Francesco Braghin, Laura Ferranti

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种结合同调方法和势游戏的多智能体路径规划框架,通过拓扑结构策略集和递推时间窗设置,提升导航效率与安全性,实验验证其在拥堵场景下的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV 50%

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16445 2026-04-16 cs.RO 50%

FiLM-Nav: Efficient and Generalizable Navigation via VLM Fine-tuning

FiLM-Nav:通过VLM微调实现高效且通用的导航

Naoki Yokoyama, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FiLM-Nav,通过微调预训练VLM作为导航策略,直接利用视觉轨迹历史和导航目标进行探索决策,实现复杂环境中的高效导航与物体定位。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2510.14232 2026-04-16 cs.LG cs.AI cs.CL 85%

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

通过扩展测试时间计算实现IOI金牌奖章的开放权重模型

Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

机构 * NVIDIA

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GenCluster框架,利用开放权重模型在有限预算下高效探索解决方案空间,实现IOI金牌级性能,缩小开放与闭合系统差距。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13398 2026-04-16 cs.CL cs.AI 81%

From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning

从预测到论证:通过强化学习对齐情感推理与人类推理

Shihao Zhang, Ziwei Wang, Jie Zhou, Yulan Wu, Qin Chen, Zhikai Lei, Liyang Yu, Liang Dou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Qiji Zhifeng Co., Ltd.(上海启智丰科技有限公司) Ocean University of China(中国海洋大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ABSA-R1框架,通过强化学习使模型具备生成自然语言论证的能力,提升情感分类和三元组提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11465 2026-04-16 cs.AI 57%

Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents

三种角色,一个模型:推理时的角色编排以缩小小规模与大规模代理之间的性能差距

S. Aaron McClendon, Jorge Gallego-Feliciano, Stavros Zervoudakis, Antonios Saravanos

机构 * Aimpoint Digital Labs(Aimpoint数字实验室) New York University(纽约大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI

AI总结 本文研究在推理时仅使用架构支撑是否能提升小模型在复杂多步骤环境中的性能,通过三阶段推理架构使小模型在AppWorld基准测试中任务完成率提升近一倍,展示了结构化推理干预使小模型能与大模型竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13786 2026-04-16 cs.CL 57%

QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs

QuantileMark:一种消息对称的多比特水印用于大语言模型

Junlin Zhu, Baizhou Huang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 QuantileMark通过在连续累积概率区间[0,1)内嵌入信息,实现消息对称的多比特水印,提升水印检测的鲁棒性和生成质量的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 50%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 18 篇

2604.13271 2026-04-16 cs.LG 91%

Enhancing Confidence Estimation in Telco LLMs via Twin-Pass CoT-Ensembling

通过双通道CoT-集成增强电信领域LLM的置信度估计

Anton Saenko, Pranshav Gajjar, Abiodun Ganiyu, Vijay K. Shah

机构 * NextG Wireless Lab(NextG无线实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 复杂问题求解 :CoT(title,title_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出双通道CoT-集成方法,通过多独立推理评估提升电信领域LLM的置信度估计,降低ECE误差达88%,提高模型自我评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10164 2026-04-16 cs.AI 90%

Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization

通过小规模偏好优化修剪大推理模型的长推理链

Bin Hong, Jiayu Liu, Kai Zhang, Jianwen Sun, Mengdi Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) Central China Normal University(中部师范大学) Meituan(美团) NeoShell

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LCPO方法,通过统一的Bradley-Terry损失框架,有效减少大推理模型的输出长度,同时保持推理性能,实验显示在多个基准上平均输出长度减少超过50%。

Comments 26 pages, 8 figures, ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10245 2026-04-16 cs.AI cs.CL cs.LG 85%

TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks

TRIM:通过多步推理任务中的目标逐步路由进行混合推理

Vansh Kapoor, Aman Gupta, Hao Chen, Anurag Beniwal, Jing Huang, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TRIM通过目标逐步路由在多步推理任务中提升推理效率,通过识别错误步骤并分配不同模型处理,实现更高的成本效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13395 2026-04-16 cs.AI cs.LG 81%

Quantifying and Understanding Uncertainty in Large Reasoning Models

对大规模推理模型中不确定性量化与理解的研究

Yangyi Li, Chenxu Zhao, Mengdi Huai

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种量化推理-答案结构不确定性的新方法,并开发了基于Shapley值的统一解释框架,通过理论分析和实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20490 2026-04-16 cs.MA cs.CL cs.CV 79%

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

RadAgents: 多模态代理推理用于胸片解读的放射科工作流程

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi

机构 * Oracle Health AI Lehigh University(莱荷大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 RadAgents通过结合临床先验知识和任务感知的多模态推理,构建模块化、可审计的放射科工作流程,提升胸片解读的可靠性与临床一致性。

Comments MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23137 2026-04-16 cs.CV cs.CL 79%

When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?

当‘是’遇见‘但是’:大型模型能否通过比较推理理解矛盾的幽默?

Tuo Liang, Zhe Hu, Jing Li, Hao Zhang, Yiren Lu, Yunlai Zhou, Yiran Qiao, Disheng Liu, Jeirui Peng, Jing Ma, Yu Yin

机构 * Computer and Data Sciences Department, Case Western Reserve University(卡内基梅隆大学计算机与数据科学系) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文探讨了大型视觉-语言模型在理解涉及复杂矛盾叙述的幽默时的挑战,通过分析漫画中的矛盾对比,提出YesBut基准,并评估了多种模型在比较推理任务中的表现,揭示了模型在视觉感知和叙事理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22750 2026-04-16 cs.CL cs.AI 73%

MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference

MARCH:评估歧义解释与多跳推理的交集

Jeonghyun Park, Ingeol Baek, Seunghyun Yoon, Haeun Jang, Aparna Garimella, Akriti Jain, Nedim Lipka, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学) Adobe Research(Adobe 研究)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARCH基准,通过多LLM验证和人工标注,包含2209个多跳歧义问题,揭示了当前模型在结合歧义解决与多步推理上的挑战,并提出CLARION框架提升推理系统鲁棒性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏