arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 348 篇

2608.04385 2026-08-06 cs.CV 新提交 78%

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03134 2026-08-05 cs.CR cs.SE 新提交 78%

CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection

CLEAR:基于因果上下文的智能体推理漏洞检测

Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29052 2026-08-03 cs.RO 新提交 78%

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

结果引导蒸馏:一种提升自动驾驶中视觉语言模型推理能力的师生框架

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) Sunrise Technology Inc.(晨昇科技公司)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本研究提出结果引导蒸馏的师生框架,将VLM的显式推理与几何轨迹生成结合,在Waymo基准上使自动驾驶性能提升约24%,优于经典推理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 78%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 78%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16896 2026-07-21 cs.NI 新提交 78%

PERA: A Perceive-Reason-Act Interface Bridging Sensing, Cognitive Reasoning, and Trustworthy Agentic Response for 6G

PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应

Mohammad Farzanullah, Melike Erol-Kantarci, Lajos Hanzo

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。

Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 78%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10625 2026-07-14 cs.RO 新提交 78%

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control

双过程原子技能学习:解耦语义推理与实时控制

Jun Chen, Erdent Bao, Wenlong Dong, Jierui Liu, Qi Cai, Hao Wan, Shaopeng Li, Weijun Qin, Jing Liang, Huiping Zhuang

机构 * University of Electronic Science and Technology of China(电子科技大学) Huazhong University of Science and Technology(华中科技大学) Southern University of Science and Technology(南方科技大学) South China University of Technology(华南理工大学) EbTech Co. Ltd.(依比特科技有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对语言条件模仿学习推广到多步组合任务的挑战,提出双过程原子技能学习框架DASL,通过解耦语义推理与实时控制,含低频和高频策略,有效减轻技能码本干扰问题,性能显著优于现有基线。

Comments 28 pages,20 figures,21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07361 2026-07-13 cs.CV 新提交 78%

BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

BUS:用于高级多模态推理的受脑启发的无监督自我反思

Jiacheng Yang, Tongying Xiao, Yunkai Dang, Cong Wang, Yuekun Yang, Qi Fan, Tianyu Ding, Wenbin Li, Feng Miao, Yang Gao

机构 * AAAI Press(美国人工智能协会出版社)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07380 2026-07-09 cs.IR 新提交 78%

Interpretable Uncertainty for Adaptive Retrieval and Reasoning in Question Answering

问答中自适应检索与推理的可解释不确定性

Ritajit Dey, Iadh Ounis, Graham McDonald

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究针对问答中大型语言模型的问题,提出基于LLM内部表示显式信号的不确定性感知框架,区分知识不足与模糊冲突,能在单次前向传播中估计,指导系统行为,为检索和推理策略提供透明实用替代方案。

Comments 2 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04779 2026-07-07 cs.CV 新提交 78%

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

DGSeg:用于推理分割的语义-空间引导预测的动态门控

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00562 2026-07-02 cs.SE 新提交 78%

Towards Better Linux Kernel Fault Localization: Leveraging Contrastive Reasoning and Hierarchical Context Analysis

迈向更好的Linux内核故障定位:利用对比推理和层次上下文分析

Haichi Wang, Ruiguo Yu, Yesong Pang, Yingquan Zhao, Junjie Chen, Jiajun Jiang, Zan Wang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出CoHiKer方法,通过对比推理分析测试用例行为差异,结合层次上下文分析从文件到方法逐级缩小定位范围,在Linux内核故障定位中Top-1准确率提升高达26.07%(文件级)和56.85%(方法级)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-07-02 cs.CR 新提交 78%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27684 2026-06-29 cs.IR 新提交 78%

Intuition-Guided Latent Reasoning for LLM-Based Recommendation

直觉引导的潜在推理用于基于LLM的推荐

Chang Liu, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Qifan Wang, Fuli Feng, Wenge Rong

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交 78%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 78%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22151 2026-06-23 cs.IR 新提交 78%

Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning

新颖性感知的智能检索:通过结构化多步推理比较研究贡献

Shou-Tzu Han

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出新颖性感知研究智能体,通过结构化多步推理增强RAG,实现论文间重叠、差异及问题-方法缺失的对比分析,在100篇论文语料上支持五种结构化比较能力。

Comments 9 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15651 2026-06-16 cs.CV 新提交 78%

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

自问式视觉语言模型:用于组合视觉推理的强化学习

Saraswathy Amjith

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12195 2026-06-11 cs.CV 新提交 78%

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

InternVideo3: 用多模态上下文推理代理化基础模型

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11354 2026-06-11 cs.ET 新提交 78%

A Zero-Shot Multi-Agent Framework for Human-Building Interaction via Programmatic Reasoning

通过程序化推理实现人楼交互的零样本多智能体框架

Yuqi Wang, Gulai Shen, Ali Mehmani

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出一种分层多智能体框架,利用语义路由和程序化推理解耦自然语言理解与建筑分析,通过“门卫”机制分解任务并生成可执行Python脚本,在200多栋商业建筑数据上验证了准确性和上下文响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09303 2026-06-09 cs.CV 新提交 78%

Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

再思考:通过候选发现与比较推理进行分割

Xinyan Gao, Haoran Hao, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。

Comments Project page: https://snowball521.github.io/Rea2Seg-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-06-08 eess.AS 新提交 78%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 77%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 复杂问题求解 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 77%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02490 2026-07-03 cs.CL cs.CV 新提交 77%

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12836 2026-08-14 cs.CL cs.AI 新提交 76%

From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options

从原子证据到逻辑组合:针对复合答案选项的结构化组合推理

Obed Junias, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型处理复合逻辑答案选项时的失败问题,提出了一种分解原子判断并结合整数线性规划的框架,在LOGICAL-COMMONSENSEQA和LOGICAL-SATA基准上显著提升了宏F1指标。

Comments 21 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05428 2026-07-08 cs.DL cs.AI 新提交 76%

CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science

CHARLIE:用于法医学证据推理的本地多智能体检索增强生成系统

Leandro D. Carneiro, Andre L. S. Meirelles, Juliano de A. Gomes, Rafael C. A. Cabral

机构 * Forensic Institute, Civil Police of Federal District, Brazil(巴西联邦区刑事研究所) University of Brasília, Brazil(巴西巴西利亚大学)

专题命中 复杂问题求解 :reasoning(title,comments);分类 cs.AI

AI总结 介绍用于法医学证据推理的本地多智能体检索增强生成系统CHARLIE,通过结合多种机制应对取证挑战,在机构内运行维护数据主权等,经案例研究验证其能支持证据工作流程,为高风险取证环境部署AI系统提供蓝图。

Comments 10 pages, 1 figure. Archival version of a paper presented at RELAF 2026: 1st Workshop on Reasoning with Evidence in Law Enforcement and Forensics, co-located with ICAIL 2026, Singapore, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 75%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19236 2026-06-18 cs.LG cs.AI cs.CL 新提交 75%

STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

STARE: 基于惊讶度的令牌级优势重加权以实现策略熵稳定性

Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Hunyuan(腾讯 Hunyuan)

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对GRPO等RL算法中策略熵崩溃问题,提出STARE方法,通过惊讶度分位数识别熵关键令牌并重加权其优势,结合目标熵闭环门控稳定熵,在1.5B-32B模型和多种任务上实现稳定训练,AIME24/25准确率提升4%-8%。

Comments LLM, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08960 2026-08-11 cs.AI 新提交 74%

Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression

阅读并非推理:弥合视觉-文本压缩中的智能体策略差距

Cheng Fan, Junyi Zhou, Tingzhang Luo, RongJian Xu, Qiyanhui Lu, Mingjian Zhu, Hanting Chen, Jianyuan Guo

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 该研究针对视觉-文本压缩导致的智能体策略差距,提出CAPS跨模态智能体策略自蒸馏框架,在SearchQA、ALFWorld等数据集上显著提升性能并大幅降低上下文成本。

详情

展开后加载摘要…

URL PDF HTML 收藏