arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-20 至 2026-05-20 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 16 篇

2601.22478 2026-05-20 cs.LG 79%

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

增强推理探索的变换增强GRPO

Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学) IBM Research(IBM研究院) Meta AI Florida State University(佛罗里达州立大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出变换增强GRPO(TA-GRPO)方法,通过问题重述解决大语言模型强化学习中梯度消失和多样性崩溃问题,提升模型在推理任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18903 2026-05-20 cs.LG cs.CV 79%

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era

推理可移植性:引导MLLMs在RLVR时代的持续学习

Qiuhe Hong, Yuyang Liu, Shuo Yang, Tiantian Peng, Fei Zhu, Yonghong Tian

机构 * Shenzhen Graduate School of Peking University(北京大学深圳研究生院) Centre for Artificial Intelligence and Robotics, HKISI, CAS(香港科学院人工智能与机器人研究中心) Peng Cheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种名为推理可移植性(RP)的机制,通过在持续学习中引入推理层面的约束,改进了多模态大语言模型在RLVR环境下的适应能力,实验表明RDB-CL在提升最后准确率方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI 79%

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18820 2026-05-20 cs.LG cs.AI 73%

Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision

前沿叠加的涌现:莫比乌斯吸引子与级联监督

Hongyu Gu, Jingwen Fu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过叠加实现深度推理的问题,提出莫比乌斯吸引子和级联监督方法,证明了在Erdős-Rényi图上,叠加推理的涌现是通过建筑和监督的贡献实现的。

Comments 40 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19738 2026-05-20 cs.CL cs.AI 62%

TERGAD: Structure-Aware Text-Enhanced Representations for Graph Anomaly Detection

TERGAD: 用于图异常检测的结构感知文本增强表示

Wen Shi, Zhe Wang, Huafei Huang, Qing Qing, Ziqi Xu, Qixin Zhang, Xikun Zhang, Renqiang Luo, Feng Xia

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息科技学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TERGAD,一种通过大语言模型的语义推理能力增强图异常检测的新型数据增强框架,通过将节点拓扑属性转化为描述性自然语言,再结合门控双分支自编码器融合语义嵌入和原始节点属性,从而更有效地检测图中异常实体。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00856 2026-05-20 eess.SP cs.AI cs.HC cs.LG 62%

One-Block Transformer (1BT) for EEG-Based Cognitive Workload Assessment

用于EEG认知负荷评估的单块变换器(1BT)

Stefanos Gkikas, Christian Arzate Cruz, Thomas Kassiotis, Giorgos Giannakakis, Raul Fernandez Rojas, Randy Gomez

机构 * Honda Research Institute Japan Wako City, Japan Department of Electronic Engineering Hellenic Mediterranean University Chania, Greece BioSIS (Biosensing \& Intelligent Systems) Lab Centre for Intelligent Computing Systems University of Canberra Canberra, Australia

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于EEG认知负荷评估的单块变换器(1BT),通过一个最小的潜在瓶颈聚合多通道时间序列,结合轻量级自注意力机制,实现了高效且紧凑的模型设计,从而在保持高性能的同时显著降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01499 2026-05-20 cs.LG cs.AI cs.GT 62%

Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information

超越多数投票:利用高阶信息进行LLM聚合

Rui Ai, Yuqi Pan, David Simchi-Levi, Milind Tambe, Haifeng Xu

机构 * Massachusetts Institute of Technology(麻省理工学院) School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学) Data Science, The University of Chicago(数据科学,芝加哥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Optimal Weight和Inverse Surprising Popularity两种算法,通过结合一阶和二阶信息,有效缓解多数投票的局限性,提升多智能体LLM聚合的可靠性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19952 2026-05-20 cs.CL 57%

Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory

重新思考如何记忆:超越原子事实的终身LLM代理记忆

Jingwei Sun, Jianing Zhu, Jiangchao Yao, Tongliang Liu, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 实验组) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Sydney AI Center, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TriMem,一种能够维护三种共存表示粒度的内存系统,通过保留原始对话片段、提取原子事实以及合成轮廓来实现对积累对话历史的忠实存储、高效检索和深度推理,从而克服现有方法在细节丢失和推理能力不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19645 2026-05-20 cs.CL 57%

K-Quantization and its Impact on Output Performance

K-量化及其对输出性能的影响

Robin Baki Davidsson, Pierre Nugues

机构 * Lund University(隆德大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了不同量化级别(2-6位)对大型语言模型(LLM)在MMLU-Pro、CRUXEval和MuSR等任务上的性能和准确性的影响,发现高精度量化(如8位Q8_0)能提升性能,但降维量化(如2位Q2_K)会带来性能损失,且不同模型和任务的响应差异显著。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25064 2026-05-20 cs.CL 57%

Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?

LLMs能否估算阅读理解题的认知复杂性?

Seonjeong Hwang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(韩国立科学技术院人工智能研究生院) Department of Computer Science and Engineering, POSTECH, Republic of Korea(韩国立科学技术院计算机科学与工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型是否能通过证据范围和转换级别两个维度估算阅读理解题的认知复杂性,结果显示LLMs能够近似估算认知复杂性,但存在推理能力与元认知意识之间的差距。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16112 2026-05-20 cs.AI 57%

IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra

IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构

Heewoong Noh, Namkyeong Lee, Gyoung S. Na, Kibum Kim, Chanyoung Park

机构 * KAIST(韩国科学技术院) KRICT(韩国信息通信技术研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20033 2026-05-20 cs.CV cs.GT 50%

A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

为无训练多模态步骤验证构建纳什均衡框架

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软印度研究院) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一种无训练的多模态步骤验证方法,将步骤验证视为专门法官之间的协调问题,并通过纳什均衡游戏形式化法官之间的交互,通过闭式解计算均衡分数,实现对分歧的敏感过滤和稳定性意识的排名,实验表明跨模态一致性(而非平均置信度)提供了鲁棒的验证信号。

Comments ICLR 2026 Workshop VerifAI-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19322 2026-05-20 cs.CV 50%

DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs

DynaTok: 时序自适应和位置偏见感知的视频大语言模型token压缩

Minyoung Park, Taehun Kong, Sangjun Ahn

机构 * LG Electronics, Seoul, South Korea(LG电子,首尔,韩国)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DynaTok,一种无需训练的时序自适应和位置偏见感知的token压缩框架,通过在时序和空间维度上分配token预算,有效减少冗余的时空覆盖,提升视频大语言模型的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19137 2026-05-20 cs.CV 50%

Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

迈向数据高效的视频预训练:使用冻结的图像基础模型

Svetlana Orlova, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了如何通过冻结预训练的图像基础模型并仅训练时间模块来实现数据高效的视频预训练,从而减少对大规模视频数据和计算资源的需求。

Comments Accepted to CVPR 2026 Workshops CV4Smalls

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14828 2026-05-20 cs.IR 50%

Toward Robust GraphRAG: Mitigating Retrieval Drift and Hallucination from Imperfect Knowledge Graphs

迈向稳健的GraphRAG:减轻不完美知识图谱中的检索漂移和幻觉

Yizhuo Ma, Jinchuan Xu, Tao Wen, Qizhi Chen, Jiakai Li, Rongzheng Wang, Muquan Li, Shuang Liang, Ke Qin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文针对GraphRAG中因知识图谱不完美导致的检索漂移和幻觉问题,提出CS-RAG框架,通过精细化检索和充分性检查来减少不准确的证据延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07777 2026-05-20 cs.MA cs.GT 50%

Talk, Judge, Cooperate: Gossip-Driven Indirect Reciprocity in Self-Interested LLM Agents

谈话、评判、合作:在自利LLM代理中基于 gossip 的间接互惠

Shuhui Zhu, Yue Lin, Shriya Kaistha, Wenhao Li, Baoxiang Wang, Hongyuan Zha, Gillian K. Hadfield, Pascal Poupart

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出ALIGN框架,通过策略性分享开放式 gossip 实现去中心化代理的声誉形成、信任评估和社会规范协调,从而提升间接互惠并抵御恶意入侵,发现LLM的更强推理能力促进更激励对齐的合作,而聊天模型容易过度合作。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏