arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-04 至 2026-06-04 共收录 172 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2606.03564 2026-06-04 cs.CV cs.AI 92%

CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

CR-Seg:注意力引导与CoT增强的由粗到精推理分割

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 视觉空间推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出CR-Seg两阶段框架,通过注意力图提取和全局到局部思维链,实现由粗到精的推理分割,解决跨模态对齐和推理-答案不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI 81%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04226 2026-06-04 cs.RO cs.AI 79%

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

PerceptTwin:面向迭代LLM规划与验证的语义场景重建

Charlie Gauthier, Sacha Morin, Liam Paull

机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) Mila - Quebec AI Institute(魁北克人工智能研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.AI

AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。

Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04436 2026-06-04 cs.CV cs.RO 67%

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

3DThinkVLA:通过3D思维引导的协同训练赋予视觉-语言-动作模型潜在3D先验

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

机构 * Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达梦机器人) Great Bay University(大亚大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出3D思维引导的协同训练框架,通过解耦3D几何感知与空间推理并在不同特征层次注入,使VLA模型在动作预测中隐式进行3D空间推理,无需3D传感器或外部模型,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04389 2026-06-04 cs.CL 57%

When Clients Stop Following: A Cognitive Conceptualization Diagram-driven Framework for Strategic Counseling

当来访者不再跟随:基于认知概念化图的策略性咨询框架

Yihao Qin, Junyi Zhao, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Chang Liu, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有评估协议中来访者过度顺从导致评分虚高的问题,提出基于认知行为疗法的抵抗感知框架,通过认知概念化图模拟动态抵抗,并利用强化学习优化策略推理与响应生成,以提升在困难咨询交互中的策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04172 2026-06-04 cs.RO 50%

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation

Affordance2Action: 任务条件下的场景级功能区域定位用于实时操作

Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu

机构 * Department of Computer Science, Rutgers University-New Brunswick(罗格斯大学新布朗斯维尔回声分校计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(GZ)) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Affordance2Action框架,通过构建A2A-Bench基准和A2A-AffordGen标注流程,解决场景级任务条件功能区域定位中的多区域对应问题,并支持实时操作。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 12 篇

2606.04402 2026-06-04 cs.AI 83%

Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation

并非所有错误都同等重要:后果感知的推理计算分配

Jingbo Wen, Liang He, Ziqi He

机构 * The University of Sydney(悉尼大学) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出后果感知的测试时计算分配方法,通过轻量级预测器估计任务错误成本,在相同预算下将高后果任务路由到更多计算资源,在SWE-bench上降低22%-33%的成本加权损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05145 2026-06-04 cs.LG cs.AI cs.CL 82%

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

失败推理轨迹告诉你什么是可修复的(但仅凭阅读它们不行)

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) CHU Sainte-Justine(圣约斯特医院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过失败推理轨迹的分布特征而非文本内容来识别可修复的失败,并设计无训练的路由规则提升测试时干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07036 2026-06-04 cs.CL cs.AI cs.LG 82%

Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers

Mid-Think: 通过词元级触发器实现无需训练的中间预算推理

Wang Yang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Shouren Wang, Vikash Singh, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析注意力机制和提示实验,发现推理行为主要由少量触发词元控制,并据此提出Mid-Think方法,通过组合触发词元实现中间预算推理,在准确率-长度权衡上优于基线,并能在强化学习训练中减少时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10630 2026-06-04 cs.LG cs.AI 81%

Time Series Forecasting as Reasoning: A Slow-Thinking Approach with Reinforced LLMs

时间序列预测作为推理:一种基于强化LLM的慢思考方法

Yitong Zhou, Yucong Luo, Mingyue Cheng, Qi Liu, Jiahao Wang, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Time-R1框架,通过两阶段强化微调(监督微调+强化学习)训练LLM进行多步推理,以提升时间序列预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05233 2026-06-04 cs.LG cs.AI cs.CL 67%

MesaNet: Sequence Modeling by Locally Optimal Test-Time Training

MesaNet: 通过局部最优测试时训练进行序列建模

Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Saurous, Guillaume Lajoie, Charlotte Frenkel, Razvan Pascanu, Blaise Agüera y Arcas, João Sacramento

机构 * Google(谷歌) Paradigms of Intelligence Team(智能范式团队) Google DeepMind(谷歌DeepMind) MIT CSAIL(麻省理工学院CSAIL)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于共轭梯度求解器实现局部最优测试时训练的Mesa层,在保持常数推理成本的同时,在语言建模困惑度和下游基准性能上超越现有RNN模型。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04847 2026-06-04 cs.CV cs.CL cs.LG 62%

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU

MusaCoder: 在摩尔线程GPU上通过全栈训练实现原生GPU内核生成

Kun Cheng, Songshuo Lu, Sicong Liao, Tankun Li, Yafei Zhang, Dong Yang, Qiheng Lv, Hua Wang, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 提出MusaCoder全栈训练框架,结合渐进式数据合成、多样性保持拒绝微调和基于执行反馈的强化学习,在CUDA和MUSA后端上生成高效原生GPU内核,9B模型匹配前沿闭源模型,27B模型达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04120 2026-06-04 cs.CL cs.AI 62%

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SaliMory: 为对话代理编排认知记忆

Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann Lee, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05054 2026-06-04 cs.CL 57%

Boosting Self-Consistency with Ranking

通过排序提升自洽性

Maria Marina, Daniil Moskovskiy, Sergey Pletenev, Mikhail Salnikov, Alexander Panchenko, Viktor Moskvoretskii

机构 * AIRI Skoltech(斯克利切夫斯基因工大学) EPFL(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出RISC方法,将自洽性中的答案选择转化为排序问题,使用轻量级LambdaRank模型结合五个特征,在多个数据集上实现了比标准自洽性更好的准确率-效率权衡。

Comments 16 pages, 13 figures, accepted at ACL Student Research Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04036 2026-06-04 cs.LG 57%

Self-Distilled Policy Gradient

自蒸馏策略梯度

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Princeton AI Laboratory, Princeton University, Princeton, NJ, USA(普林斯顿大学普林斯顿AI实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 提出SDPG框架,结合组相对验证器优势、归一化标准差、精确全词汇在线自蒸馏和参考策略KL正则化,提升稀疏奖励强化学习的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30947 2026-06-04 cs.CL 57%

Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship

将人工智能研究扩展到人文学科:一个用于证据基础学术的多智能体框架

Yating Pan, Jiajun Zhang, Jun Wang, Qi Su

机构 * Department of Information Management(信息管理系) Research Center for Digital Humanities(数字人文研究中心) School of Foreign Languages(外国语言学院) Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出SPIRE多智能体框架,通过将人文学科操作建模为协作智能体角色,结合多尺度细读检索,实现基于证据的论证,在古典文献基准上优于现有方法。

Comments 28 pages, 3 figures. Code, data catalogues, and reproduction scripts: https://github.com/YatingPan/SPIRE. Lead corresponding author: Jun Wang; corresponding author: Qi Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04323 2026-06-04 cs.CV 50%

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

面向CVPR 2026 VidLLMs挑战赛的基于边际触发问题重新仲裁的答案自一致性方法

Tomoya Miyazawa, Hiroyasu Okuno

机构 * Data Analytics Labo Co.(数据分析师实验室公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出一种无需训练的测试时推理框架ASC-MQRA,通过答案自一致性聚合多轮视频问答结果,并利用边际触发机制对低置信度样本进行条件性重新仲裁,在CVPR 2026 VidLLMs挑战赛Track 2上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM 50%

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 22 篇

2502.17956 2026-06-04 cs.CL 85%

Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments

在跨语言和多语言环境中更好地理解程序思维推理

Patomporn Payoungkhamdee, Pume Tuchinda, Jinheon Baek, Samuel Cahyawijaya, Can Udomcharoenchaikit, Potsawee Manakul, Peerat Limkonchotiwat, Ekapol Chuangsuwanich, Sarana Nutanong

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) KAIST(韩国科学技术院) Cohere SCB 10X AI Singapore(AI新加坡) Department of Computer Engineering, Chulalongkorn University(朱拉隆梭大学计算机工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过分离推理与代码执行,提出评估程序思维提示的框架,发现微调显著提升多语言推理能力,且推理质量与答案准确性强相关。

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16867 2026-06-04 cs.LG cs.CL 84%

Efficient Reasoning on the Edge

边缘设备上的高效推理

Yelysei Bondarenko, Thomas Hehn, Rob Hesselink, Romain Lepert, Fabio Valerio Massoli, Evgeny Mironov, Leyla Mirvakhabova, Tribhuvanesh Orekondy, Spyridon Stasis, Andrey Kuzmin, Anna Kuzina, Markus Nagel, Ankita Nayak, Corrado Rainone, Ork de Rooij, Paul N Whatmough, Arash Behboodi, Babak Ehteshami Bejnordi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出结合LoRA适配器、监督微调、强化学习预算控制、并行测试时缩放、动态适配器切换和KV缓存共享的方法,在资源受限的边缘设备上实现高效准确的推理。

Comments Project page: https://qualcomm-ai-research.github.io/llm-reasoning-on-edge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08498 2026-06-04 cs.CL 84%

Characterizing, Evaluating, and Optimizing Complex Reasoning

表征、评估与优化复杂推理

Haoran Zhang, Yafu Li, Zhi Wang, Zhilin Wang, Shunkai Zhang, Xiaoye Qu, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Nanjing University, Suzhou, Jiangsu, China(南京大学) Peking University, Beijing, China(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ME$^2$原则来表征推理质量,基于有向无环图(DAG)的成对评估方法,并构建TRM-Preference数据集训练Thinking Reward Model(TRM),以优化推理过程。

Comments Code and data are available at https://github.com/Simplified-Reasoning/TRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 81%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28829 2026-06-04 cs.CL cs.AI cs.CY 81%

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

Aryabhata 2:扩展强化学习以提升高级STEM推理能力

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

机构 * PhysicsWallah

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aryabhata 2,一个通过强化学习后训练在竞争性STEM考试中提升推理能力的语言模型,在JEE、NEET等基准上超越基础模型且输出token减少高达64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12329 2026-06-04 cs.CL cs.AI 81%

Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time

推测性思考:在推理时利用大模型指导增强小模型推理能力

Wang Yang, Xiang Yue, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的推测性思考框架,通过让大推理模型在推理层面引导小模型,在提升小模型推理准确率的同时缩短输出长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04454 2026-06-04 cs.CL 79%

Stepwise Reasoning Enhancement for LLMs via External Subgraph Generation

通过外部子图生成增强大语言模型的逐步推理

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SGR框架,通过从知识图谱生成查询相关子图来引导大语言模型进行逐步推理,提升复杂多步推理的准确性、鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01161 2026-06-04 cs.LG 79%

Reasoning Shift: How Context Silently Shortens LLM Reasoning

推理偏移:上下文如何无声地缩短LLM推理

Gleb Rodionov, Roman Garipov, George Yakushev

机构 * Yandex HSE University(俄罗斯高等经济学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 通过系统评估,发现推理模型在不同上下文条件下(如无关长上下文、多轮对话、子任务)对同一问题的推理链长度显著缩短(最高65%),且伴随自我验证和不确定性管理行为减少,但简单任务性能不受影响,复杂任务可能受影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 79%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL 79%

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04448 2026-06-04 cs.IR 78%

Bridging Short Videos and Live Streams: Reasoning-Guided Multimodal LLMs for Cross-Domain Representation Learning

连接短视频与直播:推理引导的多模态大语言模型用于跨域表示学习

Le Zhang, Xiaolan Zhu, Yuchen Wang, Shilong Kang, Jiaqi Xue, Xiaoyu Zhang, Xiang Chen, Yalong Guan, Xiangyu Wu, Shijun Wang, Lantao Hu, Kun Gai

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对短视频到直播的跨域推荐冷启动问题,提出推理引导的跨域表示学习框架RGCD-Rep,利用多模态大语言模型生成结构化推理知识并蒸馏到轻量模型,通过两阶段训练学习可迁移的物品表示,在快手部署后显著提升核心业务指标。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03927 2026-06-04 cs.CV 78%

StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning

StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型

Xiaowen Sun, Matthias Kerzel, Mengdi Li, Xufeng Zhao, Paul Striker, Stefan Wermter

机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) King Abdullah University of Science and Technology(卡塔尔科学与技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏