arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-25 至 2026-05-25 共收录 99 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2605.23820 2026-05-25 cs.CY cs.SI 50%

Inferential Privacy Leakage in Anonymized Conversational AI Logs

匿名化对话式AI日志中的推断隐私泄露

S M Mehedi Zaman, Kiran Garimella

专题命中 规划推理 :reasoning(abstract)

AI总结 通过分析来自四个全球南方国家1000多名用户的ChatGPT对话历史,测量了显式披露和推断性隐私泄露,发现即使移除显式个人身份信息,大型语言模型仍能以高F1分数推断用户年龄、性别和国家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV 50%

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

专题命中 规划推理 :reasoning(abstract)

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21880 2026-05-25 cs.RO 50%

Optimal Solutions for the Moving Target Vehicle Routing Problem with Obstacles via Lazy Branch and Price

带障碍物的移动目标车辆路径问题的最优解:懒惰分支定价法

Anoop Bhat, Geordan Gutow, Surya Singh, Zhongqiang Ren, Sivakumar Rathinam, Howie Choset

机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人学院) Mechanical and Aerospace Engineering at Michigan Technological University(密歇根理工大学机械与航空航天工程系) Robotics and AI Institute(机器人与人工智能研究所) UM-SJTU Joint Institute and Department of Automation at Shanghai Jiao Tong University(上海交通大学与美国密歇根大学联合研究所及自动化系) Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(德克萨斯农工大学机械工程系和计算机科学与工程系)

专题命中 规划推理 :planning(abstract)

AI总结 针对带障碍物的移动目标车辆路径问题(MT-VRP-O),提出懒惰分支定价法(Lazy BPRC),通过松弛连续性约束的延迟成本计算和凸集图搜索,实现最优解并显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23428 2026-05-25 cs.CV cs.MM 50%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23280 2026-05-25 cs.DB 50%

BCTuner: LLM-Guided Monte Carlo Tree Search for Efficient Blockchain Knob Tuning

BCTuner: 基于LLM引导的蒙特卡洛树搜索实现高效区块链参数调优

Yaoyi Deng, Chongyang Tao, Mingxuan Li, Xuelian Lin, Han Sun, Mingchao Wan, Shuai Ma

专题命中 规划推理 :reasoning(abstract)

AI总结 针对许可区块链参数调优中架构复杂、语义鸿沟及试错成本高的问题,提出BCTuner框架,结合大语言模型知识推理与蒙特卡洛树搜索,通过结构化动作轨迹逐步构建配置并自适应剪枝,显著提升吞吐量并减少系统交互次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10743 2026-05-25 eess.SY cs.SY 50%

Scaling and Trade-offs in Multi-agent Autonomous Systems

多智能体自主系统中的规模与权衡

Abram H. Clark, Liraz Mudrik, Colton Kawamura, Nathan C. Redder, João P. Hespanha, Isaac Kaminer

专题命中 规划推理 :planning(abstract)

AI总结 通过大规模仿真和量纲分析,揭示自主无人机蜂群在三种典型场景中的标度律,量化智能体数量与平台参数间的权衡,并展示最优路径规划对结果标度律的改善。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00560 2026-05-25 cs.RO cs.CV 50%

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving

使用集成扩散估计端到端自动驾驶的不确定性

Florian Wintel, Sigmund H. Høeg, Gabriel Kiss, Frank Lindseth

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出EnDfuser系统,利用扩散模型作为轨迹规划器,通过集成扩散从单一感知帧生成候选轨迹分布,实现不确定性感知决策,在LAV基准上驾驶评分提升1.7%。

Comments Accepted at NLDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 12 篇

2602.02780 2026-05-25 cs.AI cs.LG 86%

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

机构 * Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系) Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)

专题命中 视觉空间推理 :reasoning(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Cuttlefish,一种统一多模态大语言模型,通过缩放感知适配器和几何基础适配器,自适应调整结构令牌数量并注入几何线索,以提升异构结构推理性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 84%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL 62%

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23898 2026-05-25 cs.AI 57%

SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

SPACENUM: 重新审视视觉语言模型中的空间数值理解

Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu

机构 * Northwestern(西北大学) UCSD(加州大学圣地亚哥分校) USC(南加州大学) GaTech(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SpaceNum框架,通过Num2Space和Space2Num双向任务评估VLM在动态过渡和静态布局中对空间数值的理解,发现模型依赖浅层空间线索,难以建立稳定的坐标感知表示。

Comments Project page: https://sterzhang.github.io/SpaceNum-Home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 57%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23771 2026-05-25 cs.CV cs.AI cs.MA 57%

PhotoFlow: Agentic 3D Virtual Photography Missions

PhotoFlow: 智能体式3D虚拟摄影任务

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PhotoFlow智能体框架,通过导演-评审-反思闭环搜索机制,在任意Blender场景中根据语言指令自动完成虚拟摄影,并引入VPhotoBench基准,实验表明其在外观质量对齐和成功率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17015 2026-05-25 cs.CV cs.CL 57%

Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models

Multi-SpatialMLLM: 多模态大语言模型的多帧空间理解

Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang

机构 * FAIR, Meta(FAIR,Meta) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一种框架,通过整合深度感知、视觉对应和动态感知等基本空间技能,使多模态大语言模型具备多帧空间理解能力,并构建MultiSPA数据集和基准测试,模型Multi-SpatialMLLM在多项任务上取得显著提升。

Comments CVPR 2026 Camera Ready. 27 pages. Project page: https://runsenxu.com/projects/Multi-SpatialMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09583 2026-05-25 cs.RO cs.AI 57%

AirVista-II: An Agentic System for Embodied UAVs Toward Dynamic Scene Semantic Understanding

AirVista-II:面向动态场景语义理解的具身无人机智能体系统

Fei Lin, Yonglin Tian, Tengchao Zhang, Jun Huang, Sangtian Guan, Fei-Yue Wang

机构 * Department of Engineering Science, Faculty of Innovation Engineering, Macau University of Science and Technology(创新工程学院工程科学系,澳门科学技术大学) State Key Laboratory for Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院自动化研究所) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AirVista-II端到端智能体系统,通过集成智能体任务识别调度、多模态感知和差异化关键帧提取策略,实现零样本下无人机动态场景的通用语义理解与推理。

Journal ref Proc. 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 6319-6324, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23891 2026-05-25 cs.CV 50%

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Smart-Insertion-V: 通过闭环反馈双流框架实现逼真的视频插入

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种端到端双流框架Smart-Insertion-V,通过闭环反馈机制和双世界视角旋转位置编码解决参考对象与源视频风格域差异大的问题,实现无需掩码的逼真视频对象插入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23160 2026-05-25 cs.RO cs.CV 50%

Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping

语义感知引导的无人机探索:面向语言条件的三维室内建图

Nitin Vegesna, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences(电气工程与计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出SAGE系统,结合CLIP语义提示与覆盖导向探索,在未知室内环境中优先发现目标物体,同时保持高覆盖率。

Comments 10 pages, 6 figures, 4 tables. To be presented at the 2nd 3D-LLM/VLA Workshop at CVPR 2026 (non-archival workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05997 2026-05-25 cs.CV 50%

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker: 用4D图像进行动态空间理解的思考

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

机构 * Tsinghua University, SIGS(清华大学 SIGS) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) LMMs-Lab(LMMs实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出4DThinker框架,通过动态潜在心理图像(在连续隐藏空间中模拟场景演化)增强视觉语言模型的动态空间推理能力,并引入无标注数据生成、动态图像微调及4D强化学习,在多个基准上超越强基线。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19859 2026-05-25 cs.CV 50%

Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

Eyes on VLM: 视觉语言模型中注视跟随与社会性注视预测的基准测试

Hengfei Wang, Anshul Gupta, Pierre Vuillecard, Jean-Marc Odobez

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出EyeVLM评估框架,通过零样本和微调方式测试视觉语言模型在注视跟随(几何视觉处理)和社会性注视预测(社交推理)两个核心任务上的能力,发现当前VLM缺乏精确的注视理解能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 8 篇

2602.12579 2026-05-25 cs.LG cs.AI 88%

VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction

VI-CuRL: 通过置信度引导的方差缩减稳定与验证器无关的强化学习推理

Xin-Qiang Cai, Masashi Sugiyama

机构 * RIKEN AIP(日本理化学研究所高级研究所) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VI-CuRL框架,利用模型内在置信度构建课程学习,在不依赖外部验证器的情况下通过降低动作和问题方差稳定训练,理论保证渐近无偏性,在数学和通用推理基准上超越依赖/不依赖验证器的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23493 2026-05-25 cs.AI 70%

EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation

EDGE-OPD:通过证据引导的在线策略蒸馏内化特权上下文

Aristotelis Lazaridis, Dylan Bates, Aman Sharma, Brian King, Vincent Lu, Jack FitzGerald

机构 * EdgeRunner AI

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对在线策略自蒸馏中特权信息导致模型行为偏移的问题,提出EDGE-OPD方法,通过引导展开和证据掩码实现目标行为的高效迁移与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03715 2026-05-25 cs.LG cs.AI 62%

R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification

R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大

Weijie Shi, Yanxi Chen, Zexi Li, Xuchen Pan, Yuchang Sun, Jiajie Xu, Xiaofang Zhou, Yaliang Li

机构 * Tongyi Lab(通义实验室) Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 57%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23562 2026-05-25 cs.MA cs.AI 57%

ARMS: Automatic Reward Shaping for Sparse-Reward Multi-Agent Reinforcement Learning

ARMS: 稀疏奖励多智能体强化学习的自动奖励塑形

Elie Abboud, Oren Gal

机构 * Department of Marine Technologies(海洋技术系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出ARMS框架,通过自监督轨迹排序学习稠密塑形信号,并基于条件最优反应推理证明其保持纳什均衡,从而解决多智能体强化学习中的稀疏奖励问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23344 2026-05-25 cs.CV cs.AI 57%

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

CHASD:面向LVLMs中幻觉的语言增量校准对比解码

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出CHASD框架,通过不确定性驱动的置信门控和注意力引导的局部扰动,在推理时按需校准对比解码,减少对象幻觉并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23069 2026-05-25 cs.CL 57%

DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

DFKI-MLT 在 SemEval-2026 任务 7 中:将多语言模型引导至文化知识

Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah, Josef van Genabith, Cristina España-Bonet, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔布吕肯信息学校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出使用从并行 FLORES 数据中提取的语言向量进行激活引导,在推理时调整多语言模型以提升文化知识,并在 SemEval-2026 任务 7 的 MCQ 赛道上取得 86.96% 准确率,排名第 7。

Comments Accepted to The 20th International Workshop on Semantic Evaluation at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07399 2026-05-25 cs.AI cs.CV 57%

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应

Changhua Xu, En Yu, Junyu Xuan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 12 篇

2605.20201 2026-05-25 cs.CL cs.AI cs.LG 89%

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

基于代理思维链调优的长上下文推理

Miao Li, Irina Saparina, Alexander Gurung, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProxyCoT训练框架,通过将短代理上下文中的推理能力迁移到完整长上下文中,以提升大语言模型在长上下文复杂推理任务上的表现。

Comments Long paper, ACL 2026 (Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16331 2026-05-25 cs.LG 89%

Decoding the Critique Mechanism in Large Reasoning Models

解码大型推理模型中的批判机制

Hoang Phan, Quang H. Nguyen, Hung T. Q. Le, Xiusi Chen, Heng Ji, Khoa D. Doan

机构 * VinUni-Illinois Smart Health Center(VinUniversity-伊利诺伊州智能健康中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);self-correction(abstract)

AI总结 本文通过插入算术错误研究大型推理模型如何从错误中恢复,发现存在隐藏的批判向量,通过引导潜在表示可提升错误检测和测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23074 2026-05-25 cs.AI 87%

PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning

PathCal: 状态感知的反思标记校准用于高效推理

Lingyu Jiang, Zirui Li, Shuo Xing, Peiran Li, Tsubasa Takahashi, Dengzhe Hou, Zhengzhong Tu, Kazunori Yamada, Fangzhou Lin

机构 * Tohoku University(东大大学) Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PathCal,一种无需训练的解码控制器,通过区分反思标记类型并在局部不确定状态进行干预,校准推理路径,在保持或提升准确率的同时减少生成长度。

Comments 21 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏