arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-15 至 2026-05-15 共收录 157 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2605.14458 2026-05-15 cs.AI 57%

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

机构 * Samsung Research(三星研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04236 2026-05-15 cs.LG 57%

Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals

通过顺序证据累积实现LLM集成的自适应共识:自动预算识别和校准的承诺信号

Roberto E. Medina

机构 * Independent Researcher(独立研究员)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DASE方法,通过顺序证据累积实现LLM集成的自适应共识,通过自动预算识别和校准承诺信号提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16659 2026-05-15 cs.AI econ.GN q-fin.EC 57%

LLMs learn scientific taste from institutional traces across the social sciences

大语言模型通过社会科学研究中的机构痕迹学习科学品味

Ziqin Gong, Ning Li, Huaikang Zhou

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 57%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14733 2026-05-15 cs.CV 50%

Video-Zero: Self-Evolution Video Understanding

Video-Zero: 自主进化视频理解

Ruixu Zhang, Deyi Ji, Lanyun Zhu, Xuanyi Liu, Yuxin Meng, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) Tencent(腾讯) Tongji University(同济大学) Peking University(北京大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出Video-Zero框架,通过无标注的Questioner-Solver共进化机制,聚焦时间局部证据,提升视频理解的自进化能力,验证了证据中心自进化方法的有效性与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14070 2026-05-15 cs.NI 50%

WirelessSenseLLM: Zero-Shot Human Activity Understanding by Bridging Wireless Signals and Human Language

WirelessSenseLLM: 通过连接无线信号与人类语言实现零样本人体活动理解

Mahmuda Keya, Sneh Pillai, Jiawei Yuan, Kai Zeng, Long Jiao

专题命中 其他推理 :reasoning(abstract)

AI总结 WirelessSenseLLM通过引入CSI到语言适配器和跨模态投影机制,利用大语言模型实现从未分割的Wi-Fi CSI信号中零样本人体活动理解,提升了动作识别和语言推理性能。

Comments Accepted at IEEE SECON 2026. 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13898 2026-05-15 cs.SE 50%

Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey

双向赋能:变形测试与大语言模型的相互促进:系统综述

Zheng Zheng, Zenghui Zhou, Yinwang Xu, Daixu Ren, Tsong Yueh Chen

专题命中 其他推理 :reasoning(abstract)

AI总结 本文系统综述了93项研究,探讨变形测试与大语言模型之间的双向赋能关系,提出分类框架,分析其在验证、评估和自动化测试中的应用。

Comments Daixu Ren is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏