arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 333 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 31 篇

2605.30280 2026-06-02 cs.RO cs.AI cs.CL 62%

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

机构 * Qwen Team(通义实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Qwen-VLA,一种基于DiT动作解码器的统一具身基础模型,通过大规模联合预训练和具身感知提示,将操作、导航和轨迹预测统一为动作-轨迹预测框架,实现跨任务、环境和机器人形态的泛化。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02463 2026-06-02 cs.CV cs.AI 57%

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

MASER: 面向具身3D空间智能的模态自适应专家路由

Hilton Raj, Vishnuram AV

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MASER框架,通过训练共享VLM骨干的五个模态适配器并学习基于问题选择最佳适配器的神经路由策略,解决具身代理在3D环境中多模态推理时忽略问题语义的问题。

Comments Accepted to CVPR 2026 Foundation Models Meet Embodied Agents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02374 2026-06-02 cs.AI 57%

Spatial Representation Learning Beyond Pixels: Unifying Raster Data and Vector Semantics for Human-Centric Geospatial Foundation Models

超越像素的空间表示学习:统一栅格数据和向量语义以构建以人为中心的地理空间基础模型

Steffen Knoblauch, Hao Li, Gengchen Mai, Konstantin Klemmer, Song Gao, WenWen Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一栅格感知与向量推理的联合空间表示学习范式,旨在解决当前地球观测基础模型仅依赖栅格模态、忽略向量数据中丰富结构化信息的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00582 2026-06-02 cs.AI 57%

PropLLM: Propagation-Aware Scene Reconstruction for Network Fault Diagnosis

PropLLM:面向网络故障诊断的传播感知场景重建

Zongzong Wu, Ming Zhao, Fengxiao Tang, Nei Kato

机构 * National Natural Science Foundation of China(国家自然科学基金委员会) High Performance Computing Center of Central South University(中南大学高性能计算中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PropLLM,首次将逐跳场景重建范式与LLM生成推理能力结合,通过双知识图谱和时序因果传播注意力机制,从端点告警回溯定位根因并确定故障类型,在真实Wi-Fi多模态故障数据集上诊断准确率提升3.9%,根因定位准确率提升4.7%,幻觉率降低50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23500 2026-06-02 cs.CV cs.LG 57%

B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

B-GRTO: 引导式分组相对工具优化用于指代分割

Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱门特·欧赫里迪斯基")

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出B-GRTO框架,通过引导式预训练和分组相对工具优化,联合优化策略与可微分割解码器,显著提升复杂指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15231 2026-06-02 cs.AI 57%

RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography

RadAgent:一种用于胸部CT逐步解读的工具型AI智能体

Mélanie Roschewitz, Kenneth Styppa, Yitian Tao, Jiwoong Sohn, Jean-Benoit Delbrouck, Benjamin Gundersen, Nicolas Deperrois, Christian Bluethgen, Julia E. Vogt, Bjoern Menze, Farhad Nooralahzadeh, Michael Krauthammer, Michael Moor

机构 * Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) ETH AI Center, Zurich(ETH人工智能中心,苏黎世) Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) Faculty of Computer Science and Mathematics, Heidelberg University(计算机科学与数学学院,海德堡大学) Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学人工智能在医学和影像中的中心) Department of Radiology, Stanford University(放射科,斯坦福大学) Department of Quantitative Biomedicine, University of Zurich(定量生物医学系,苏黎世大学) Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出RadAgent,一种通过逐步、可解释过程生成CT报告的工具型AI智能体,在临床准确性、鲁棒性和忠实度上优于3D VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 57%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08884 2026-06-02 cs.CV cs.AI cs.GR 57%

ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

ShapeLib: 利用大型语言模型设计程序化3D形状抽象库

R. Kenny Jones, Paul Guerrero, Niloy J. Mitra, Daniel Ritchie

机构 * Stanford University(斯坦福大学) Adobe Research(Adobe研究) University College London(伦敦大学学院) Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ShapeLib方法,利用大型语言模型的先验知识,通过引导式工作流自动设计可泛化的程序化3D形状抽象库,并支持下游形状编辑与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00762 2026-06-02 cs.RO 50%

STEM: Semantic Target Search and Exploration using MAVs in Cluttered Environments

STEM: 杂乱环境中使用MAV的语义目标搜索与探索

Nikhil Sethi, Max Lodel, Laura Ferranti, Robert Babuška, Javier Alonso-Mora

机构 * Department of Cognitive Robotics(认知机器人学系) Delft University of Technology(代尔夫特理工大学) CIIRC(捷克技术大学布拉格分校智能信息研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种基于语义引导视点规划器的框架,利用MAV在非结构化3D环境中最小化目标搜索与探索时间,通过组合规划器和主动感知管道实现高效语义探索。

Comments Accepted to Autonomous Robots Journal. Nikhil Sethi and Max Lodel contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16740 2026-06-02 cs.CV 50%

TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation

TRACE:基于证据定位的多视频事件理解与声明生成

Pengyu Yan, Akhil Gorugantu, Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, David Doermann

机构 * University at Buffalo, SUNY(布法罗大学) New York University(纽约大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出TRACE框架,通过先构建文本可搜索时间线进行证据定位,再引导视觉语言模型生成声明和跨视频引用,显著提升多视频事件理解的事实完整性和归因准确性。

Comments Accepted at ACL 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12724 2026-06-02 cs.RO 50%

TRANS: Terrain-aware Reinforcement Learning for Agile Navigation of Quadruped Robots under Social Interactions

TRANS:面向社交互动下四足机器人敏捷导航的地形感知强化学习

Wei Zhu, Irfan Tito Kurniawan, Ye Zhao, Mitsuhiro Hayashibe

机构 * Department of Robotics, Graduate School of Engineering, Tohoku University(东邦大学机器人学系) Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院智能决策与自主机器人实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出一个名为TRANS的两阶段深度强化学习框架,通过三个DRL流水线(TRANS-Loco、TRANS-Nav和统一TRANS)实现四足机器人在非结构化地形上的社交导航,克服了传统方法中运动规划与运动控制分离、缺乏地形感知以及假设静态环境等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 16 篇

2605.11374 2026-06-02 cs.LG cs.CL cs.IR 84%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17045 2026-06-02 cs.CV cs.AI cs.LG 84%

Video Reasoning without Training

无需训练的视频推理

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague

机构 * Qualcomm AI Research(高通AI研究) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。

Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04718 2026-06-02 cs.CL cs.AI 84%

T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models

T1:小语言模型测试时计算扩展的工具集成验证

Minki Kang, Jongwon Jeong, Jaewoong Cho

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对小语言模型在测试时扩展中验证能力不足的问题,提出T1框架,通过外部工具过滤候选输出后由小语言模型进行最终验证,显著提升验证准确率和测试时扩展性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG 83%

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01080 2026-06-02 cs.LG cs.AI 81%

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

ThinkSwitch:基于LoRA和权重插值的上下文蒸馏用于特定目的推理任务

Dhruv Saini, Rohan Pandey

机构 * bellevue High School(贝尔维尤高中) DigitalOcean

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ThinkSwitch方法,通过QLoRA蒸馏和球面权重插值协同训练指令模型和思考模型,在AIME 2026和PubMedQA上分别提升指令模型10/30→20/30和13/30→18/30,思考模型14/30→22/30和18/30→25/30,仅需15个训练提示和$2.86成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01464 2026-06-02 cs.CL 79%

Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

跨语言自一致性:面向语言模型的多语言推理

Ahmed Elhady, Eneko Agirre, Mikel Artetxe

机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心) Reka AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出无监督强化学习方法,通过强制模型对跨语言等价问题产生相同答案来增强多语言推理,在MGSM上平均提升21.7%,并展现出强泛化能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00660 2026-06-02 cs.CL 79%

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算

James Xu Zhao, Hui Chen, Bryan Hooi, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL

AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。

Comments 8+18 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01104 2026-06-02 cs.CV 78%

Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

自适应密集证据精炼用于视频关系推理:VRR-QA挑战

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(国立新加坡大学) Independent Researcher(独立研究员) Opus AI Research(Opus AI研究) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title);verifier(abstract)

AI总结 提出一种自适应测试时计算系统,通过轻量视图识别不稳定问题并路由到高预算密集证据模块,在VRR-QA测试集上达到90.07%平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30290 2026-06-02 cs.LG cs.AI cs.CL 75%

Self-Trained Verification for Training- and Test-Time Self-Improvement

自训练验证用于训练和测试时的自我改进

Chen Henry Wu, Aditi Raghunathan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自训练验证(STV)方法,通过让验证器模仿参考解决方案下的自身版本,解决自我改进中验证器瓶颈问题,在测试时显著提升验证-细化循环,在训练时通过验证器在环训练(ViL)进一步提升生成器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24919 2026-06-02 cs.CV 67%

Agentic AI for Remote Sensing: Technical Challenges and Research Directions

Agentic AI 在遥感中的应用:技术挑战与研究方向

Muhammad Akhtar Munir, Muhammad Umer Sheikh, Akashah Shabbir, Muhammad Haris Khan, Fahad Khan, Xiao Xiang Zhu, Begüm Demir, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。

Comments 31 pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00755 2026-06-02 cs.CL cs.LG 62%

Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning

内化温度:面向强化学习的同策略自蒸馏作为策略加热器

Xuewei Yang, Jiachen Yu, Jie Wu, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00971 2026-06-02 cs.CL 57%

HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

HypothesisMed:生物医学问答中的推理时答案融合与结构化假设空间报告

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系雷士打理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系雷士打理工学院)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出HypothesisMed推理时可靠性流水线,通过答案融合和SPACE标签(有效/不完整/矛盾)提升生物医学多项选择问答的准确率、可解析性和结构化可靠性报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00739 2026-06-02 cs.LG 57%

Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation

Score × Decoder:无监督推理时缩放缓解幻觉的统一视角

Yun-Chen Cheng, Che-Yu Lin, Cheng-Lin Yang

机构 * CyCraft AI Lab, Taiwan(CyCraft人工智能实验室,台湾)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出Score×Decoder框架,通过配对四种内在分数(困惑度、对比度、幂分布似然、自验证)与三种解码族(优化、采样、共识),在无监督条件下选择最佳组合以缓解大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00328 2026-06-02 cs.LG 57%

KG-Guard: Graph-Based Hallucination Detection for Knowledge Base Question Answering

KG-Guard: 基于图的知识库问答幻觉检测

Albert Sawczyn, Piotr Bielak, Tomasz Kajdanowicz

机构 * Department of Artificial Intelligence(人工智能系) Wroclaw University of Science and Technology(波兹南科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 针对知识库问答中LLM的幻觉问题,提出一种轻量级图框架,将问答实例构建为增强图,通过图编码器和MLP分类器检测幻觉答案节点,在三个基准上取得最高F1并显著提升下游KBQA性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07109 2026-06-02 cs.AI 57%

Vision Language Models Cannot Reason About Physical Transformation

视觉语言模型无法推理物理变换

Dezhi Luo, Yijiang Li, Maijunxian Wang, Tianwei Zhao, Bingyang Wang, Siheng Wang, Pinyuan Feng, Pooyan Rahmanzadehgervi, Ziqiao Ma, Hokin Deng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文通过构建ConservationBench基准,评估112个视觉语言模型在物理守恒任务上的表现,发现模型在动态场景中无法维持物理属性的变换不变性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03719 2026-06-02 cs.CL 57%

BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning

BranPO:面向长程智能体强化学习的可扩展对比分支采样

Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :planning(abstract);分类 cs.CL

AI总结 针对长程智能体强化学习中轨迹级奖励稀疏且信用分配困难的问题,提出一种无值函数方法BranPO,通过截断轨迹并重采样延续构建对比分支,实现局部对比监督,无需密集奖励。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 37 篇

2603.08000 2026-06-02 cs.CL cs.LG 92%

SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning

SmartThinker: 渐进式思维链长度校准以实现高效的大语言模型推理

Chenzhi Hu, Qinzhe Hu, Yuhang Xu, Junyi Chen, Ruijie Wang, Shengzhong Liu, Jianxin Li, Fan Wu, Guihai Chen

机构 * Tsinghua University(清华大学)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

AI总结 针对大型推理模型输出冗余问题,提出基于GRPO的渐进式CoT长度校准方法SmartThinker,通过动态估计最优长度和调节长度奖励系数,在压缩响应长度同时提升准确率。

Comments Accepted by ICML 2026, 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01243 2026-06-02 cs.CL cs.LG 88%

Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention

解锁潜在推理的黑箱:一种可解释性引导的干预方法

Shuochen Chang, Tong Bai, Xiaofeng Zhang, Qianli Ma, Qingyang Liu, Zhaohe Liao, Yibo Miao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文通过结构、因果和几何探针分析潜在推理向量的可解释性,并基于此提出无需训练的解码时干预方法,提升大语言模型推理准确性。

Journal ref ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00832 2026-06-02 cs.CL 83%

Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

Momento:评估多会话代理对话中的持久记忆与推理

Adril Putra Merin, David Anugraha, Ayu Purwarianti, Genta Indra Winata

机构 * Institut Teknologi Bandung(万隆技术大学) Stanford University(斯坦福大学) Capital One

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出Momento基准,通过多会话服务环境评估代理在跨会话中利用持久记忆和推理完成个性化任务的能力,发现现有代理因误估用户状态而表现不佳。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏