arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 25 篇

2608.02820 2026-08-05 cs.CR cs.AI cs.LG 新提交 91%

Evading Chain-of-Thought Monitoring Through Model Poisoning

通过模型投毒规避思维链监控

Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(summary_cn,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06374 2026-08-05 cs.CL cs.LG 版本更新 87%

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

叠加的幻觉?语言模型中潜在思维的原理性分析

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03838 2026-08-05 cs.AI 新提交 79%

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法

Zhinan Liu, Jie Li, Mingyu Kang, Jiayi Ji

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03673 2026-08-05 cs.LG 新提交 79%

CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning

CausalOPD:用于提炼因果链推理的首错误步监督

Jian Zhang, Bingyi Wang, Yizhi Liu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 CausalOPD 是一种课程在线过程提炼框架,通过识别首错误步并结合短视界强化学习,提升了学生模型的因果链推理能力,在三个领域中表现优于序列级提炼及专有参考模型。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 79%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22207 2026-08-05 cs.SE cs.AI cs.CL 版本更新 79%

Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations

评估基于大语言模型的目标提取在需求工程中的应用:提示策略及其局限性

Anna Arnaudo, Riccardo Coppola, Maurizio Morisio, Flavio Giobergia, Andrea Bioddo, Angelo Bongiorno, Luca Dadone

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 其他推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过三个阶段自动提取功能目标以实现目标导向的需求工程,提出基于工程提示的LLM链,实验表明反馈循环机制在零样本学习中表现更优,但提示策略仍是性能限制因素。

Comments 11 pages, 1 figure. This contribution will be published in the conference proceedings of EASE 2026 Conference (https://conf.researchr.org/home/ease-2026/prompt-se-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 77%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03161 2026-08-05 cs.AI cs.CL 新提交 76%

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

面向多讲座教育推理的证据 grounded 多模态知识图谱构建

Sahil Al Farib, Momota Ahsana Meem, Sheikh Redwanul Islam, Md. Tanvir Raihan

专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 该研究针对讲座视频知识保留不全问题,提出基于证据的多模态知识图谱构建流程,在神经网络讲座实验中取得高覆盖率与检索准确率,贡献可审计的知识图谱构建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12448 2026-08-05 cs.CL cs.AI cs.LG 版本更新 67%

Uncovering Spontaneous Physics Representations in In-Context Learning

揭示上下文学习中自发形成的物理表征

Yeongwoo Song, Jaeyong Bae, Dong-Kyum Kim, Hawoong Jeong

机构 * Department of Physics, KAIST(KAIST物理系) MPI for Security and Privacy, Germany(德国安全与隐私研究所) Center for Complex Systems, KAIST(KAIST复杂系统中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 62%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 62%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26760 2026-08-05 cs.CL cs.LG 版本更新 62%

Metis: Memory Foundation Model

Metis:记忆基础模型

Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao, Zehao Lin, Yang Zhang, Xiaoyan Zhao, Tong Shen, Bo Tang, Zhi-Qin John Xu, Junchi Yan, Haofen Wang, Xu Chen, Feiyu Xiong, Zhiyu Li, Tat-Seng Chua

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。

Comments 46 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03844 2026-08-05 cs.AI 新提交 57%

MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

MAFIA:针对经审计的大语言模型智能体的、基于探测与事实注入的仅查询内存攻击

Jiaming Chen, Yisen Gao, Yanping Li, Zifan Liu, Yumeng Zhang, Jun Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对经审计的LLM智能体,提出MAFIA攻击框架,通过放置策略与伪装有效载荷实现高攻击成功率,大幅降低审计检测率,揭示智能体内存系统的关键漏洞。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 57%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03624 2026-08-05 cs.CL 新提交 57%

LoopMTP: A looped transformer guided by latent multi-token prediction

LoopMTP:由潜在多令牌预测引导的循环Transformer

Behzad Shomali, Markus Frey, David Berghaus, Joachim Koehler, Mehdi Ali

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LoopMTP针对循环Transformer的潜在过度思考问题,通过潜在多令牌预测实现软对齐与轻量门控,使平均准确率提升最高8.1%,15次循环内训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 57%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03428 2026-08-05 cs.CV cs.AI 新提交 57%

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03388 2026-08-05 cs.CL 新提交 57%

Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

别让我主动索要:大语言模型在用于溯因推理的主动多轮信息获取中存在缺陷

Shahrukh Mohiuddin, Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究通过Alien Abduction游戏探究LLMs的主动多轮信息获取能力,发现其在分轮提供证据、自行选择查询时表现欠佳,存在假设验证与停止决策的缺陷。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02775 2026-08-05 cs.AI 新提交 57%

Towards a new paradigm of scientific discovery with socialized artificial intelligence

面向社会化人工智能的科学发现新范式

Xinjie Yao, Xingxin Xu, Xiyuan Gao, Zhoupeng Guo, Kunlong Yang, Dengyu Zhao, Siqi Zhao, Zhihe Fan, Yichen Dong, Xin Li, Jiekang Feng, Jiahe Wu, Sen Wang, Beiming Yu, Kejia Zhao, Ruipu Zhao, Jiaqi Zhou, Heyang Li, Jianjun Chen, Anbo Dai, Xin Liu, Zhengtao Yu, Qinghua Hu, Pengfei Zhu

机构 * Baize Research(白泽研究院) Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence, Kunming University of Science and Technology(昆明理工大学云南省人工智能重点实验室) School of Automation, Southeast University(东南大学自动化学院) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机学院) SeetaCloud Technology(思特云科技) GPUhub Pte. Ltd.(GPUhub私人有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BLAZE社会化科学智能范式,将AI作为科学发现的组织基础设施,整合知识、推理、实验与人类判断,提升科学发现的可追溯性、可重复性与累积性,以扩展集体科学探究的规模与深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03962 2026-08-05 quant-ph cs.AI cs.CC 新提交 57%

Separating quantum circuits from classical LLMs

将量子电路与经典大语言模型分离

Srinivasan Arunachalam, Arkopal Dutt, Hari Krovi, Rik Sengupta

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本研究证明了低深度量子计算与经典大语言模型架构在分布和功能上的无条件分离,为大语言模型时代量子优势的研究奠定了基础。

Comments 60 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02486 2026-08-05 cs.CV cs.CL 版本更新 57%

VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理

Haz Sameen Shahgir, Xiaofu Chen, Yu Fu, Erfan Shayegani, Nael Abu-Ghazaleh, Yova Kementchedjhieva, Yue Dong

机构 * University of California, Riverside(加州大学河滨分校) MBZUAI(穆桑人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。

Comments Accepted at the Conference on Language Modeling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03232 2026-08-05 cs.CR 新提交 50%

MalTotal: Cost-Effective and Language-Agnostic Malicious Code Poisoning Detection for Millions of Repositories

MalTotal:面向数百万代码仓库的高性价比、语言无关型恶意代码投毒检测方法

Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出MalTotal框架,可跨5种主流语言检测恶意代码,F1值达93.1%,成本大幅降低,在12万个GitHub仓库中发现564个未知恶意仓库,适用于大规模多语言场景。

Comments Accepted by ISSTA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03016 2026-08-05 cs.CV 新提交 50%

Clinically-Grounded Hierarchical Classification for Consistent Chest X-ray Interpretation

基于临床依据的分层分类用于一致性胸部X射线影像解读

Jong Hak Moon, Minjun Kim, Minjun Kim

机构 * Yeji X(艺智X)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究针对胸部X射线解读的层级特性,提出CHASE框架,通过三级分类与多层级优化,提升了预测的一致性与性能。

Comments MICCAI 2026 Accepted. First & Corresponding author: Jong Hak Moon (jh.moon@yejix.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02791 2026-08-05 cs.CV 新提交 50%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00280 2026-08-05 cs.OS cs.SE 版本更新 50%

Benchmarking LLMs on File System Design and Implementation

在文件系统设计与实现上对大语言模型(LLMs)进行基准测试:优势、不足与缺陷

Yuqi Xue, Daixuan Li, Jian Huang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出针对文件系统特定任务的LLM基准框架phi-Bench,含505项六类任务,测试开源与专有LLMs,揭示模型效率、失败原因及缓解技术,将开源phi-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏