arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 14 篇

2607.00361 2026-07-02 cs.CR 新提交 87%

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 78%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00434 2026-07-02 cs.CV cs.LG 新提交 74%

Information-Regularized Attention for Visual-Centric Reasoning

信息正则化注意力用于以视觉为中心的推理

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

机构 * FAIR at Meta(Meta 的 FAIR 部门) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 其他推理 :reasoning(title);分类 cs.LG

AI总结 针对视觉语言模型中的对象幻觉、视觉基础弱和灾难性遗忘问题,提出信息正则化注意力机制,通过随机注意力显式调控视觉信息注入,改善表示学习稳定性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00415 2026-07-02 cs.CL cs.LG 新提交 73%

A Mechanistic View of Authority Hierarchy in LLM Sycophancy

LLM 谄媚中权威层级的机制性视角

Emil Joswin, Srujananjali Medicherla, Priyanka Mary Mammen

机构 * Independent Research(独立研究)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 通过受控医疗QA实验,发现LLM按感知权威程度分级响应,机制是特定后期层中正确答案表征被权威信号主动擦除,且该擦除与权威水平成比例、抵抗均值向量干预、仅部分可逆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01104 2026-07-02 cs.LG cs.AI cs.CL 新提交 67%

CausalMix: Data Mixture as Causal Inference for Language Model Training

CausalMix: 数据混合作为语言模型训练的因果推断

Zinan Tang, Yukun Zhang, Shaomian Zheng, Zhuoshi Pan, Qizhi Pei, Dingnan Jin, Jun Zhou, Yujun Wang, Biqing Huang

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00856 2026-07-02 q-fin.CP cs.LG 新提交 57%

Shapley in Context: Explaining Financial Language with Domain Expertise

语境中的Shapley:利用领域专业知识解释金融语言

Dangxing Chen, Pengzhan Guo

机构 * Zu Chongzhi Center, Duke Kunshan University(杜克昆山大学祖冲之中心) Digital Innovation Research Center, Duke Kunshan University(杜克昆山大学数字创新研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究Shapley值在大型语言模型金融文本解释中的适用性,通过理论分析和实验验证其与金融领域知识的一致性。

Comments European Journal of Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01084 2026-07-02 cs.AI 新提交 57%

Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

智能体能否泛化到开放世界?揭示工具使用中静态训练的脆弱性

Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM智能体在真实场景中因查询、工具集和交互动态变化而性能下降的问题,形式化定义了开放世界工具使用问题,构建了四层层次的环境偏移框架,并通过实验揭示了监督微调和强化学习训练智能体在面对开放环境偏移时的脆弱性,提出了扰动增强微调策略以提升鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00828 2026-07-02 cs.DB cs.AI 新提交 57%

Exploring the Semantic Gap in Agentic Data Systems: A Formative Study of Operationalization Failures in Analytical Workflows

探索智能体数据系统中的语义鸿沟:分析工作流中操作化失败的形成性研究

Jalal Mahmud, Eser Kandogan

机构 * Megagon Labs(Megagon实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过跨领域分析236个分析意图,识别出153种反复出现的操作化失败,归纳为五类语义鸿沟,揭示用户分析概念与系统可用信息之间的差距,并提出未来智能体数据系统需要更丰富的语义表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00048 2026-07-02 cs.SE cs.AI 新提交 57%

Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns

在Scrum认证风格问题上比较大型语言模型:准确性、稳定性和错误模式

Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 评估GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993个Scrum认证问题上的表现,发现模型间差异显著,Gemini 3 Flash准确率最高,错误模式具有系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01125 2026-07-02 cs.LG math.OC 新提交 57%

ZO-Act: Efficient Zeroth-Order Fine-Tuning via One-Shot Activation-Informed Low-Rank Subspaces

ZO-Act: 通过一次性激活信息低秩子空间实现高效零阶微调

Xun Dong, Yibo Xu, Naigang Wang, Xin Li, Penghang Yin, Zi Yang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) IBM T. J. Watson Research Center(IBM托马斯·J·沃森研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 提出ZO-Act方法,利用输入激活构建固定低秩子空间,仅优化系数矩阵,降低扰动维度并支持Adam优化器,实现高效零阶微调,在多个LLM上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新 57%

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01213 2026-07-02 cs.SE 新提交 50%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 其他推理 :reasoning(abstract)

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 50%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19570 2026-07-02 cs.CV 版本更新 50%

RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

RF-HiT:校正流分层变换器用于通用医学图像分割

Ahmed Marouane Djouamaa, Abir Belaala, Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Cosimo Distante, Abdenour Hadid

机构 * Computer Science department Mohamed Khider University Biskra, Algeria ISASI, CNR \& University of Salento 73100 Lecce, Italy AI University of the Basque Country (UPV/EHU), Spain Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE

专题命中 其他推理 :reasoning(abstract)

AI总结 RF-HiT通过整合hourglass变换器骨干和多尺度分层编码器,实现高效的医学图像分割,在保持精度的同时提升效率,达到91.27%的Dice系数。

详情

展开后加载摘要…

URL PDF HTML 收藏