arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-30 至 2026-06-30 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 24 篇

2603.12277 2026-06-30 cs.CL cs.AI cs.CR 85%

Prompt Injection as Role Confusion

提示注入作为角色混淆

Charles Ye, Jasmine Cui, Dylan Hadfield-Menell

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07683 2026-06-30 cs.CV cs.AI 83%

TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding

TAR:基于时间锚的视频时间定位推理

Chaohong Guo, Xun Mo, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long

机构 * South China University of Technology(华南理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Bytedance Inc.(字节跳动有限公司)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 TAR通过引入时间锚机制,提升视频时间定位任务中推理过程的可信度和自主性,采用自举方法生成高质量推理轨迹,实现更精确的最终预测。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29425 2026-06-30 cs.AI cs.CL cs.MA cs.MM 81%

Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning

辩论者混合:在多智能体推理中实现架构级别的辩论学习

Dayong Liang, Kaisong Gong, Yi Cai, Changmeng Zheng, Xiao-Yong Wei

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28392 2026-06-30 cs.CV cs.AI cs.LG 81%

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

RADIANT-PET:结合大语言模型和强化学习的推理增强型PET/CT病灶分割

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu

机构 * Division of Hematology, The Ohio State University Comprehensive Cancer Center(血液科,俄亥俄州立大学综合癌症中心) Department of Radiology, Mahidol University(医学放射科,玛希多大学) Department of Radiology, Mettapracharak Hospital(医学放射科,Mettapracharak医院) Department of Radiation Oncology, The Ohio State University Comprehensive Cancer Center(放射肿瘤科,俄亥俄州立大学综合癌症中心)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出RADIANT-PET框架,通过大语言模型和强化学习对候选摄取区域进行推理分类,抑制生理性假阳性,提升PET/CT病灶分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00305 2026-06-30 cs.CL cs.AI 81%

Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance

通过近未来指导桥接在线策略蒸馏中的推理轨迹

Yuxuan Jiang, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对在线策略蒸馏中令牌级学习信号无法有效桥接推理轨迹的问题,提出基于近未来轨迹信息的轨迹感知在线策略蒸馏方法,显著提升大语言模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 79%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02456 2026-06-30 cs.CV cs.CL 77%

See, Think, Learn: A Self-Taught Multimodal Reasoner

看见、思考、学习:一种自教的多模态推理器

Sourabh Sharma, Sonam Gupta, Sadbhawna

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出See-Think-Learn框架,通过自训练提升多模态推理能力,结合感知与推理生成结构化推理过程,增强模型区分正确与误导性回答的能力。

Comments Accepted at The Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05386 2026-06-30 cs.LG cs.AI cs.CL 75%

Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training

强化微调自然缓解持续训练中的遗忘

Song Lai, Haohan Zhao, Rong Feng, Changyi Ma, Wenzhuo Liu, Hongbo Zhao, Xi Lin, Dong Yi, Qingfu Zhang, Hongbin Liu, Gaofeng Meng, Fei Zhu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了监督微调与强化微调在持续训练中的影响,发现强化微调能有效保留先验知识,优于监督微调和多任务训练,且在标准基准上提升模型通用知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29034 2026-06-30 cs.CL cs.AI cs.IR cs.LG 67%

The strength of clinical evidence is recoverable from language model representations but not from their stated grades

临床证据强度可从语言模型表示中恢复,但无法从其陈述的等级中恢复

Soroosh Tayebi Arasteh

机构 * Lab for AI in Medicine(医学人工智能实验室) RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛大学医院) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过构建临床声明数据集,测试22个开源大语言模型,发现模型内部表示可编码证据强度(中位AUROC 71.8%),但模型陈述的等级接近随机(低于估计器25-27个百分点),且该信号主要来自词汇特征,不随规模提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30481 2026-06-30 cs.CY cs.AI cs.CL cs.ET 62%

Situation Perception: A Necessary Primitive to Artificial Superintelligence

情境感知:通向超级人工智能的必要基础

Ziqin Yuan, Jaymari Chua

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出情境感知(situation perception)是通向超级人工智能的关键缺失能力,包括抽象预测、长期压缩记忆和目标驱动的主动学习,并分析了当前大语言模型的不足及相应测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28916 2026-06-30 cs.CL cs.AI cs.DB 62%

Latent Bridges for Multi-Table Question Answering

多表问答的潜在桥梁

Simone Varriale, Tamara Cucumides, Floris Geerts, Paolo Papotti

机构 * EURECOM University of Antwerp(安特卫普大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GRAB管道,通过图编码器和潜在桥梁将关系数据转化为紧凑表示,冻结LLM以保持推理能力,在多表问答中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11491 2026-06-30 cs.CL cs.AI 62%

Ontology-Guided Reverse Thinking Makes Large Language Models Stronger on Knowledge Graph Question Answering

本体引导的反向思维使大语言模型在知识图谱问答中更强

Runxuan Liu, Bei Luo, Jiaqi Li, Baoxin Wang, Ming Liu, Dayong Wu, Shijin Wang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Joint Laboratory of HIT and iFLYTEK(哈工大与科大讯飞联合实验室) University of Science and Technology of China(中国科学技术大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ontology-Guided Reverse Thinking框架,通过反向推理构建路径,提升大语言模型在知识图谱问答中的表现,实验表明其在WebQSP和CWQ数据集上达到最佳性能。

Comments We now public our source codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30093 2026-06-30 cs.CL cs.IR 57%

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

基于Token共现图的高效检索增强生成

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29526 2026-06-30 cs.LG 57%

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

优化训练策略的幻象:单调推理策略作为大语言模型强化学习的真正目标

Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

机构 * Tianjin University(天津大学) Alibaba(阿里巴巴)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 针对LLM强化学习中训练-推理概率不一致导致的策略不稳定问题,提出单调推理策略改进(MIPI)目标及两阶段框架MIPU,通过推理侧间隙代理选择候选更新,提升推理性能与训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28929 2026-06-30 cs.CR cs.LG 57%

Cybersecurity is the True Frontier for Generative AI Success or Failure

网络安全是生成式AI成功或失败的真正前沿

Edward Raff, Maor Ashkenazi, Sagar Samtani, David J. Elkind, Sven Krasser

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出网络安全是比自然语言和计算机视觉更复杂的AI测试床,因其数据规模大、标注成本高、环境动态变化且要求低延迟和可解释性。

Comments to appear in the 5'th Workshop on Rethinking Malware Analysis (WoRMA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28601 2026-06-30 cs.DB cs.AI 57%

Database Context Compression for Text-to-SQL on Real-World Large Databases

面向真实世界大型数据库的文本到SQL数据库上下文压缩

Jingwen Liu, Weibin Liao, Xin Gao, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) Peking University Information Technology Institute, Tianjin Binhai(天津滨海大学信息技术研究所,北京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对真实大型数据库中文本到SQL性能瓶颈,提出基于SGCF原则的数据库上下文压缩方法DBCC,通过离线结构语义压缩和在线证据净化,将输入上下文减少两个数量级,并提升模式链接召回率和执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16291 2026-06-30 cs.CY cs.AI cs.GT 57%

AI of the People, by the People, for the People: A Social Choice Approach to Collective Control of Artificial Intelligence

为人民的AI,由人民,为人民:一种社会选择方法用于集体控制人工智能

Paul Anton Bachmann, Niclas Boehmer, Lukas Daniel Klausner, Martin Lackner

机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) Hasso Plattner Institute, University of Potsdam(哈索·platzer研究所,波茨坦大学) Center for Artificial Intelligence, University of Applied Sciences St. Pölten(人工智能中心,圣波尔滕应用科学大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于社会选择理论的集体控制AI方法,强调在机器学习全流程中融入公众意见,提供数学框架评估控制机制。

Comments Accepted for publication in Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

Journal ref Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), 2026, 4610-4629

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02351 2026-06-30 cs.CL 57%

Generative Large Language Models in Automated Fact-Checking: A Survey

生成式大语言模型在自动事实核查中的应用:综述

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了生成式大语言模型在自动事实核查中的作用,分析了其在事实验证、数据生成及评估中的应用,探讨了多语言和低资源环境下的挑战与趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 50%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 其他推理 :reasoning(abstract)

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29270 2026-06-30 cs.MA 50%

Minority Sentinel: When to Overturn Majority Voting in Multi-Agent LLM Debates

少数派哨兵:何时推翻多智能体LLM辩论中的多数投票

Chuan He, Zebin Chen, Zhengyi Yang, Shaobo Qiao, Mingchen Ju, Jiate Liu, Dong Wen, Guanfeng Liu

专题命中 其他推理 :reasoning(abstract)

AI总结 针对LLM辩论中多数投票压制正确少数意见的问题,提出Minority Sentinel轻量级元分类器,通过辩论日志特征训练LightGBM模型,在6个基准上实现81.2%的翻转精度和正向净增益。

Comments 11 pages, 4 figures. Accepted at the AgentSearch Workshop @ SIGIR 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29207 2026-06-30 cs.DC 50%

KernelFlume: Elastic Core-Attention Scaling for Agentic Long-Context Decoding

KernelFlume: 面向智能体长上下文解码的弹性核心注意力扩展

Guangyu Xiang, Xueze Kang, Lin Zhang, Wenxiang Lin, Shaohuai Shi, Yuxin Wang, Xiaowen Chu

专题命中 其他推理 :reasoning(abstract)

AI总结 针对智能体长上下文解码中突发性长上下文需求超出部署容量的问题,提出KernelFlume架构,通过解耦投影/FFN路径与核心注意力计算,实现无权重注意力节点的弹性扩展,在降低延迟的同时显著降低输出成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28845 2026-06-30 cs.CV 50%

Personalizing MLLMs via Reinforced Multimodal Reference Game

通过强化多模态参考游戏个性化多模态大语言模型

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。

Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28351 2026-06-30 cs.IR 50%

HyperSU: Corpus-Driven Semantic-Unit Hypergraph for Retrieval-Augmented Generation

HyperSU:面向检索增强生成的语料驱动语义单元超图

Jiate Liu, Liuyi Chen, Zhengyi Yang, Chuan He, Mingchen Ju, Bocheng Han, Ruyi Liu, Xu Zhou

专题命中 其他推理 :reasoning(abstract)

AI总结 提出HyperSU框架,通过语义单元超图和线索引导的双向检索,解决超图RAG中的幻觉、高索引成本和语义漂移问题,在GraphRAG-Bench上准确率提升14.7%。

Comments 24 pages, 6 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23882 2026-06-30 cs.AR 50%

PowerFlow-DNN: Compiler-Directed Fine-Grained Power Orchestration for End-to-End Edge AI Inference

PowerFlow-DNN:编译器驱动的端到端边缘AI推理的细粒度功率编排

Paul Yi-Chia Chen, Jeongeun Kim, Wenbo Zhu, Yuanhan Li, Shunyao Huang, Chenjie Weng, Christopher Torng

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出PowerFlow-DNN,通过编译器驱动的端到端功率状态编排,解决边缘AI推理中低功耗加速器的细粒度功率编排问题,实现高效能优化。

Comments Accepted at ISLPED 2026. Best Paper Nomination

详情

展开后加载摘要…

URL PDF HTML 收藏