arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 46 篇

2607.17213 2026-07-21 cs.RO 新提交 50%

Retriever: Composing Closed-Loop Asynchronous Robot Programs

Retriever:组合闭环异步机器人程序

Linfeng Zhao, Haojie Huang, Jiayuan Mao, Weiyu Liu, Mykel Kochenderfer, Lawson L. S. Wong

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract)

AI总结 研究构建长期运行机器人智能体的闭环管道问题,提出Retriever,它涵盖异步决策模型等整个堆栈,将智能体表示为有状态因果流函数图,编译到支持多后端的运行时,可系统调试和确定性重放,通过案例研究等进行评估。

Comments Project website: http://retriever.systems; Package open-source website: http://openretriever.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13458 2026-07-21 cs.NI 版本更新 50%

From Traditional Automation to Embodied Wireless Intelligence: Vision-Language-Action Empowered Physics-Aware Communication Networks

从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

专题命中 规划推理 :reasoning(abstract)

AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。

Comments submitted for possible jounal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07939 2026-07-21 cs.CY 版本更新 50%

The atomic structure of work: a micro-action instrument reveals two-pole AI occupational exposure and its decade-scale polar inversion

稳定几何,反转两极:AI职业替代性的双极结构及其十年尺度反转

Shuyao Gao, Minghao Huang

专题命中 规划推理 :planning(abstract)

AI总结 通过多智能体LLM流水线将O*NET活动分解为微动作,发现职业替代性呈双极结构(物理操作与规划设计为两极),且过去十年间两极高低顺序已反转。

Comments v2: major revision, retitled (v1: "Stable Geometry, Reversing Poles"). Adds an independent blind three-annotator validation study (construct kappa = 0.90; encoder-vs-human kappa = 0.63), a vintage-matched O*NET 18.1 reprojection, a demographic overlay, and recalibrated claims throughout. 27 pages; Supplementary Information (29 pages) in ancillary files. Dataset: doi:10.5281/zenodo.21395792

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 20 篇

2607.17243 2026-07-21 cs.AI 新提交 83%

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

LenGuard-GPC:用于空间推理强化学习的带引导提示一致性的长度保护

Xingjian Tao, Yiwei Wang, Yujun Cai, Jing Tang

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对多视图空间推理中思维链推理冗长不准确及标准GRPO奖励问题,提出LenGuard-GPC框架,通过比较标准与引导提示下预测分布得KL散度作奖励信号,并引入阶段长度奖励,提升了准确率且缩短了平均响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 79%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09757 2026-07-21 cs.CV cs.AI 版本更新 79%

MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering

MedLVR: 基于潜在视觉推理的可靠医学视觉问答

Suyang Xi, Songtao Hu, Yuxiang Lai, Wangyun Dan, Yaqi Liu, Shansong Wang, Xiaofeng Yang

机构 * Department of Radiation Oncology and Winship Cancer Institute, Emory University School of Medicine(埃默里大学医学院放射肿瘤学系与温希普癌症研究所) Department of Biostatistics and Bioinformatics, Emory University(埃默里大学生物统计学与生物信息学系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MedLVR通过引入显式视觉证据状态,在自回归解码中插入短时latent推理段,提升医学视觉问答的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 78%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00931 2026-07-21 cs.RO cs.CV 78%

VL-Nav: Neuro-Symbolic Reasoning-based Vision-Language Navigation

VL-Nav: 一种基于神经符号的方法用于基于推理的视觉语言导航

Yi Du, Taimeng Fu, Zhipeng Zhao, Shaoshu Su, Zitong Zhan, Qiwei Du, Zhuoqun Chen, Bowen Li, Chen Wang

机构 * Spatial AI & Robotics Lab, University at Buffalo, USA(美国布法罗大学空间人工智能与机器人实验室) Robotics Institute, Carnegie Mellon University, USA(卡内基梅隆大学机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VL-Nav,一种结合神经推理与符号引导的视觉语言导航系统,通过任务规划和探索系统提升机器人在复杂环境中的导航能力,实验证明其在室内和室外场景中均取得较高成功率。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07530 2026-07-21 cs.RO 版本更新 78%

ICLR: In-Context Imitation Learning with Visual Reasoning

ICLR: 基于视觉推理的上下文模仿学习

Toan Nguyen, Weiduo Yuan, Songlin Wei, Hui Li, Daniel Seita, Yue Wang

机构 * University of Southern California(南加州大学) Autodesk Research(Autodesk研究)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。

Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16956 2026-07-21 cs.RO 新提交 67%

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图

Yuwen Liao, Yihang Lan, Yizhuo Yang, Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 67%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17317 2026-07-21 cs.LG cs.AI 新提交 62%

TAPAS: Throughput-adaptive Perception for Autonomous Systems

TAPAS:自主系统的吞吐量自适应感知

Aman Vyas, Vasista Kodumagulla, Zain Taufique, Pasi Liljeberg, Anil Kanduri

机构 * University of Turku(图尔库大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对自主系统感知模块吞吐量需求随场景变化的问题,提出基于强化学习的吞吐量自适应感知策略TAPAS,能在异构移动/边缘平台智能分配资源,在KITTI和nuScenes数据集上评估,吞吐量满足率高且节能效果显著。

Comments 15 Pages, 20 Figures, Accepted at ACM/IEEE International Conference on Codesign of Embedded Systems at Embedded Systems Week (ESWEEK-CODES), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 57%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18078 2026-07-21 cs.CV 新提交 50%

VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction

VGOcc:学习视觉几何高斯用于以视觉为中心的3D驾驶占用预测

Junhong Lin, Xianda Guo, Kangli Wang, Yuqi Ye, Xiaoyu Liang, Yanlun Peng, Wei Gao

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究仅视觉3D驾驶占用预测问题,提出VGOcc方法,通过从基础模型学习视觉和几何线索,纳入高斯建模的初始化与细化,实现高效语义占用预测,在nuScenes实验中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17767 2026-07-21 cs.RO 新提交 50%

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16920 2026-07-21 cs.RO cs.SE 新提交 50%

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

一种用于机器人研究的基于BIM和智能体的离散事件模拟平台:一种基于图论的方法

Ping Xu, Xinghua Gao

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究针对室内机器人复杂任务中建筑信息利用不足问题,提出基于BIM和智能体的模拟平台,将室内环境映射为图,用图论算法规划导航路径,经模拟验证其有效性,为BIM智能机器人系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16280 2026-07-21 cs.CV 新提交 50%

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

3D FaceShell:作为视觉语言模型防御机制的3D人脸头像属性转移

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对VLM可从3D人脸渲染图像提取敏感属性的隐私挑战,提出3D FaceShell框架,通过可学习高斯壳产生扰动,在保持面部外观的同时引导VLM语义解释,实验证明其能有效提高属性注入和不匹配率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 50%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19541 2026-07-21 cs.MA cs.HC 版本更新 50%

FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要

Haoran Yin, Zhiyuan Wen, Jiannong Cao, Bo Yuan, Ruosong Yang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14302 2026-07-21 cs.CV 版本更新 50%

Geometrically Consistent Multi-View Scene Generation from Freehand Sketches

从自由手绘图生成几何一致的多视角场景

Ahmed Bourouis, Savas Ozkan, Andrea Maracani, Yi-Zhe Song, Mete Ozay

机构 * Samsung Research, UK(三星研究院(英国)) SketchX, University of Surrey, UK(SketchX,塞维利亚大学(英国))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出从单张自由手绘图生成几何一致的多视角场景,通过自定义数据集、并行摄像头感知注意力适配器和稀疏对应监督损失提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 50%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 50%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08982 2026-07-21 cs.CV 版本更新 50%

CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation

CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位

Qi Ma, Runyi Yang, Bin Ren, Nicu Sebe, Ender Konukoglu, Luc Van Gool, Danda Pani Paudel

机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 13 篇

2607.10139 2026-07-21 cs.LG cs.AI 版本更新 84%

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型

Ning Liu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 79%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17531 2026-07-21 cs.CL cs.AI 新提交 73%

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration

预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法

Jie Hu

机构 * Research Institute of China Telecom(中国电信研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。

Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 70%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 66%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17290 2026-07-21 cs.LG cs.AI cs.LO 新提交 62%

Lookahead Branching for Neural Network Verification

神经网络验证中的前瞻分支

Liam Davis, Duo Zhou, Huan Zhang, Guy Katz, Clark Barrett, Haoze Wu

机构 * Amherst College(阿默斯特学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络验证中前瞻分支策略,提出通用集成方法,以FSB为例说明,还阐述其能生成加速验证的引理,通过在两个验证器中实例化,实现验证时间加速及解决实例数增加。

Comments Accepted to IJCAI 2026. Lookahead branching is part of the Marabou and $α$-$β$-CROWN verifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17247 2026-07-21 cs.LG cs.AI 新提交 62%

Distilled Reinforcement Learning for LLM Post-training

用于大语言模型训练后处理的蒸馏强化学习

Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) College of Software, Nankai University(南开大学软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏